Meta AI 于 2026 年 9 月 5 日公开了自主 AI 研究系统 AIRA₃ 的一次外部竞赛测试。官方称,团队在 6 月把 AIRA₃ 投入 NVIDIA 举办的 Kaggle 实时竞赛:参赛者需要微调一个 30B 参数的 Nemotron 模型以增强推理能力,所有队伍获得相同信息,最终由私有测试集外部评分。

结果

AIRA₃ 在约 4,000 支队伍中排名第 8,获得金牌。实时竞赛提交使用 GPT-5.5 + OpenCode 与 Claude 4.8 + Claude Code 的组合。

Meta AI 还在赛后用相同私有测试集评估了其他组合:Muse Spark 1.2 + Muse Code 达到金牌水平;Muse Spark 1.1 + OpenCode 与 GLM 5.2 + OpenCode 达到银牌水平。这里的“金牌/银牌水平”是 Meta AI 对同一竞赛评分体系下结果的表述。

AIRA₃ 如何协作

AIRA₃ 不依赖单一中央控制器,而是让多组“模型 + 编码工具”Agent 在各自隔离环境中长时间运行,并通过两个共享介质异步协调:

  1. 一个用于交流假设与发现的论坛;
  2. 一个保存解决方案产物的共享文件系统。

单个 Agent 可以读取其他 Agent 的发现并继续推进。Meta AI 表示,系统会随着计算投入积累共享知识,各 Agent 也会自行决定采用哪些已有发现,从而动态形成搜索策略。

其他测试

官方线程还给出两项内部或补充结果:AIRA₃ 在生产 GPU kernel 优化基准中把延迟降低了 27%;在另一项把约 4,000 年前阿卡德语泥板翻译成英语的 Kaggle 竞赛中达到金牌水平。它们说明同一协作框架可以在只更换任务规范的情况下迁移到不同领域,但不能单独证明系统具备通用自主研究能力。

英文原文关键摘录与翻译

AIRA₃ placed 8th out of ~4,000 teams to win Gold, outperforming human competitors who had access to the same frontier tools.

中文:AIRA₃ 在约 4,000 支队伍中排名第 8 并获得金牌,超过了能够使用相同前沿工具的人类参赛者。

如何理解这些结果

可以直接核实的是:这是 Meta AI 官方账号发布的四帖线程,明确写出了竞赛规模、排名、模型与编码工具组合、协作架构及补充测试结果。

仍需保留边界:原线程没有公开完整提示词、计算预算、Agent 数量、消融实验、训练代码或独立复现实验;GPU kernel 的 27% 延迟下降属于内部基准结果。因而,这更适合作为“多 Agent 系统能在受控竞赛中形成有效协作”的强信号,而不是递归自我改进已经得到普遍验证的结论。

原作者:Meta AI(@AIatMeta),2026 年 9 月 5 日
原帖:AI at Meta on X: "As a test of our progress to advance the frontier of AI research, in June we entered the next generation of our autonomous AI research system, AIRA₃, in a live Kaggle competition run by NVIDIA to fine-tune a 30B Nemotron model. The challenge was to teach the model to reason better… / X