多数文档抽取流程会把 Excel 或 CSV 先转成文本、Markdown,再交给模型按目标 Schema 生成结构化结果。LlamaIndex 这次公开的 Spreadsheet Mode 选择直接读取工作簿单元格,重点解决表头层级、合并单元格、隐藏行以及公式等结构信息在扁平化过程中丢失的问题。该功能目前是 LlamaParse 平台中的 Beta 能力。

英文原文与中文翻译

Most extraction tools treat spreadsheets like PDFs. They flatten the file into text or markdown, then ask a model to infer the original structure. But spreadsheets depend on structure. Headers, formulas, merged cells, and hidden rows give every value its context. Strip that away, and you map the right number to the wrong metric or period. That’s why we built native spreadsheet extraction into the LlamaParse platform. Instead of flattening your workbook to text, it reads the raw cells directly and maps the data to your schema. Available today in beta on the agentic_plus tier. Give it a spin on your messiest .xlsx, .xls, or .csv files. Docs:
Configuring Extract | Developer Documentation

大多数抽取工具会把电子表格当成 PDF:先将文件扁平化为文本或 Markdown,再让模型推断原始结构。但电子表格依赖结构。表头、公式、合并单元格和隐藏行共同提供了每个值的上下文。去掉这些结构后,就可能把正确的数字映射到错误的指标或期间。

因此,LlamaIndex 在 LlamaParse 平台中加入了原生电子表格抽取。它不把工作簿扁平化成文本,而是直接读取原始单元格,并把数据映射到用户提供的 Schema。该功能目前以 Beta 形式提供,仅适用于 agentic_plus 层级,可用 .xlsx、.xls 或 .csv 文件进行测试。

官方文档确认的配置

开启该模式需要在抽取任务的配置中设置 spreadsheet_mode: true,并使用 agentic_plus:

job = client.extract.create(
    file_input=file_obj.id,
    configuration={
        "data_schema": Portfolio.model_json_schema(),
        "tier": "agentic_plus",
        "spreadsheet_mode": True,
        "sheet_names": ["Holdings"],
    },
)

sheet_names 是可选参数:省略时处理所有工作表;填写时名称必须精确匹配。在电子表格任务中,它取代面向分页文档的 target_pages。目标 Schema 仍需描述最终希望得到的字段、类型和含义。

如果工作簿结构事先未知,官方文档建议使用更通用的“整洁单元格”Schema:为每个单元格记录行标题路径、列标题路径和值,再在后续处理中重组表格。对结构稳定的持仓表、导出账本等场景,则可直接按业务 Schema 提取。

验证方式

可以准备包含多级表头、合并单元格、隐藏行、多个工作表和公式的测试工作簿,分别运行传统文本扁平化流程与 Spreadsheet Mode,然后检查:

  • 输出字段是否映射到正确的期间、指标和工作表;
  • 行数、关键合计值及空值是否与源工作簿一致;
  • 隐藏行、合并表头和公式单元格的处理是否符合业务预期;
  • 限定 sheet_names 后是否只返回指定工作表的数据。

这些是 Codex 根据功能机制整理的验证建议,并不是原帖提供的基准结果。生产使用前仍应基于自己的文件集建立人工标注样本和字段级准确率检查。

适用边界与局限

官方文档明确说明,该模式只适用于 .xlsx、.xls 和 .csv,仅在 agentic_plus 层级运行,并且不提供引用定位或置信度分数;计费方式也不同于按页抽取。原帖没有公布准确率、延迟、成本对比或失败案例,也没有说明公式是读取表达式、缓存值还是重新计算,因此不能从“读取原始单元格”进一步推断公式语义一定被完整保留。

它更适合结构化且形状相对可预测的工作簿。面对大量宏、外部链接、损坏文件或高度动态的公式模型时,原帖未说明支持程度,需要单独验证。

发布日期:2026 年 8 月 27 日
官方文档:Configuring Extract | Developer Documentation

原作者:LlamaIndex(@llama_index)
原帖:LlamaIndex 🦙 on X: "Most extraction tools treat spreadsheets like PDFs. They flatten the file into text or markdown, then ask a model to infer the original structure. But spreadsheets depend on structure. Headers, formulas, merged cells, and hidden rows give every value its context. Strip that" / X