为什么 PDF 消耗的 AI 上下文比其文字看起来更多
PDF 描述的是固定的页面,而不是简单的阅读顺序。根据 AI 产品和模型的不同,处理过程可能包括提取的文本、渲染的页面图片、OCR,或这些输入的组合。页眉、页脚、页码、重复的导航和装饰性文字也可能进入上下文,即使它们无助于回答问题。
Markdown 本身就是线性的、基于文本的。标题、段落、列表、表格、链接和代码都是显式的,无需模型先重建页面布局。当任务只需要文档的文字内容时,这种更简单的表示可以减少不必要的输入,为指令、源材料和答案留出更多上下文。
将 PDF 转换为 Markdown 后会发生什么变化
转换会提取有用的文档结构,同时丢弃大多数固定布局指令。结果不是压缩的 PDF 或像素级还原的副本,而是一份为阅读、搜索和复用而设计的可编辑源文档。
| 输入关注点 | 直接发送 PDF | 经评审的 Markdown |
|---|---|---|
| 页面布局 | 可能需要解析页面或图片 | 已按阅读顺序呈现 |
| 重复内容 | 页眉和页脚可能在每页出现 | 提示前一次性删除即可 |
| 结构 | 从字体和位置推断 | 显式的标题、列表和表格 |
| 视觉证据 | 图表仍可用 | 通常丢失,除非单独描述 |
| 编辑 | 难以精确裁剪 | 易于移除无关章节 |
省 token 的 PDF 到 AI 工作流
先转换 PDF,再把 Markdown 当作草稿。在依赖它之前,请对照源文档进行评审。最大的实际收益往往来自转换之后:你只需要保留与问题相关的章节,而不必为每次提示都发送整份报告。
- 上传 PDF 并将其转换为 Markdown。
- 检查标题、阅读顺序、表格、名称、数字和 OCR 输出。
- 删除页码、重复的页眉、法律套话和无关的附录。
- 当任务涉及不同章节时,把长文档拆分为聚焦的文件。
- 给 AI 明确的指令,并指明 Markdown 为源材料。
- 保留原始 PDF,用于视觉核验和引用。
Use the attached Markdown as the source. Task: Summarize the implementation risks and required decisions. Rules: - Base the answer only on the supplied content. - Cite the relevant Markdown heading for each finding. - Say when the source does not contain enough information. - Do not invent details missing from the document.
测量 token 用量,而不是猜测
文件大小不等于 token 数量。PDF 可能因为内嵌字体或图片而很大,而一份简短的 Markdown 文件仍然可能包含很多 token。只要你的 AI 提供商开放 token 计数或响应用量,就用同一个模型、同样的指令和等价的源内容来比较输入 token 用量。
在转换大型档案之前,先做一个小型的代表性测试。除了 token 之外,还要比较回答质量:如果缺失的表格、图表、脚注或 OCR 错误改变了含义,那么更低的计数就没有意义。
- 记录原始 PDF 工作流的输入 token。
- 把同一份文档转换为 Markdown 并进行评审。
- 提交同样的任务,比较输入 token、成本、延迟和回答质量。
- 分别用扫描版 PDF 和原生文本 PDF 重复测试,因为它们的处理方式不同。
何时应该发送原始 PDF
当视觉排布承载含义时,请使用 PDF。图表、示意图、手写内容、表单、数学符号、签名、指定页面的引用以及多栏关系,可能无法在文本提取中保留到足以完成任务的程度。
混合工作流往往最强:用清理后的 Markdown 进行搜索、摘要、提取或重复提问,仅当模型必须检查视觉证据时,才提供相关的 PDF 页面或图片。转换后切勿丢弃权威源文件。
扫描版 PDF 需要 OCR 和仔细评审
扫描版 PDF 包含的是页面图片,而不是可选择文本。当某页可提取的文本过少时,本转换器会自动对该页应用本地英语 OCR。OCR 让页面可搜索、可编辑,但它可能混淆分栏、标点、名称、数字或低质量的扫描件。
当准确性重要时,请逐行评审 OCR 输出。对于主要以其他语言撰写的文档,即使界面本身支持多种语言,当前的英语 OCR 配置也可能产生较差的结果。
在把内容分享给任何 AI 服务之前,先精简内容
Markdown 让脱敏和精简变得更容易,因为提取出的内容可见且可编辑。在把文件发送给外部 AI 提供商之前,请移除凭据、个人信息、私人评论和无关章节,并单独查看该提供商的留存、训练和数据控制设置。
本转换器会临时处理上传文件,并在请求结束后删除其工作文件。默认情况下,你的转换草稿存储在浏览器本地,但将下载的 Markdown 发送到其他服务的行为受该服务的政策约束。