英文原文
we’ve evaluated 100+ models on doc parsing 🔥
from frontier VLMs, open-weight VLMs, OCR tools, and OSS parsers
check out parsebench: https://parsebench.ai/
中文翻译
我们已经对 100 多个模型进行了文档解析评测 🔥
覆盖前沿视觉语言模型(VLM)、开放权重 VLM、OCR 工具以及开源解析器。
查看 ParseBench:https://parsebench.ai/
公开资源核验
ParseBench 的公开榜单按表格、图表、内容忠实度、语义格式和视觉定位五个维度评测文档解析方法;页面显示数据集包含 2,000 多个经人工核验的页面和约 16.9 万条测试规则。榜单会持续更新,2026 年 9 月 19 日核验时显示 98 种方法,因此榜单数字与原帖所称的“100+”属于不同时间点的快照。
论文最初评测了视觉语言模型、专用文档解析器和 LlamaParse 等 14 种方法,并说明没有一种方法在全部五个维度上都保持领先。数据集和评测框架分别公开在 Hugging Face 与 GitHub,可用于复现或接入新的解析流水线。
- 论文:[2604.08538] ParseBench: A Document Parsing Benchmark for AI Agents
- 数据集:llamaindex/ParseBench · Datasets at Hugging Face
- 评测框架:GitHub - run-llama/ParseBench: ParseBench - A Document Parsing Benchmark for AI Agents · GitHub
- 运行入口:
uv run parse-bench run <pipeline>
说明:公开榜单会随新增方法和重新评测而变化,具体分数应以对应时间点的榜单与版本为准。