Jerry Liu(@jerryjliu0)于 2026 年 9 月 5 日发布了 GPT-6 Astra 在 ExtractBench 文档解析与结构化抽取任务上的结果。原帖同时强调了短、中、长文档之间的明显差异,以及成本和原生 OCR 能力的边界。

英文原文与中文翻译

We benchmarked GPT-6 Astra on hard document parsing and extraction tasks.

It is the best frontier model for one-shotting document extraction over short and medium-sized documents:
📊 97.2% over short documents, achieving a new SOTA on our benchmark
📊 90.6% over medium documents

But a few caveats:

  • it’s pricy! The average price per page is 11c which is 10x our cost-effective document extraction solution
  • one-shot performance over long documents is inherently tricky, it only achieves 31.7%
  • the native OCR capabilities of Astra isn’t that much better than other frontier models (e.g. Fable 5.1, gpt-5.6-sol). It does very well on table understanding, but isn’t great on charts, layout, and semantic formatting.

Full results for document extraction on ExtractBench: https://www.extractbench.ai/

中文:

我们在高难度文档解析和抽取任务上对 GPT-6 Astra 进行了基准测试。

对于短文档和中等长度文档的一次性文档抽取,它是表现最好的前沿模型:
📊 短文档得分 97.2%,在我们的基准上达到新的最高水平
📊 中等长度文档得分 90.6%

但有几点需要注意:

  • 它很贵:平均每页价格为 11 美分,是我们经济型文档抽取方案的 10 倍;
  • 对长文档进行一次性处理本来就很困难,它的得分只有 31.7%;
  • Astra 的原生 OCR 能力并没有明显强于其他前沿模型,例如 Fable 5.1 和 gpt-5.6-sol。它在表格理解方面表现很好,但不擅长图表、版面和语义格式。

ExtractBench 上的完整文档抽取结果:https://www.extractbench.ai/

线程补充原文:

Full results for document parsing on ParseBench:

中文:

ParseBench 上的完整文档解析结果:https://parsebench.ai/

公开评测页核对

ExtractBench 当前公开页面列出 370 份文档、4,869 页、67 个 Schema 和 8 个领域。GPT-6 Astra 的总体 Value F1 为 91.9,排名第 3;分段成绩为短文档 97.2、中等长度文档 90.6、长文档 31.7,公开成本为每页 11.09 美分,与原帖中的数字一致。

这里需要区分原作者的表述与完整排行榜:Jerry Liu 所说的“最佳前沿模型”限定于短、中等长度文档的一次性抽取;在包含专用抽取系统的总体榜单中,LlamaExtract Agentic Plus 与 Codex(GPT-5.5)位于 GPT-6 Astra 之前。

该基准以文档级均值计算 Value F1,失败或缺失的文档按零分处理;页面称评分流程不使用 LLM 评委。评测由 LlamaIndex 项目维护,因此比较结果仍应结合公开数据集、评测代码和实际业务文档复验,不能直接外推到所有 OCR 或文档理解场景。

原作者:Jerry Liu(@jerryjliu0)
原帖:Jerry Liu on X: "We benchmarked GPT-6 Astra on hard document parsing and extraction tasks. It is the best frontier model for one-shotting document extraction over short and medium-sized documents: 📊 97.2% over short documents, achieving a new SOTA on our benchmark 📊 90.6% over medium documents … / X