Dylan Patel 宣布 SemiAnalysis 将 Google TPU 的推理表现纳入公开、持续更新的 InferenceX 基准,并表示在其测试和成本模型下,TPUv7 Ironwood 的每 token 成本优于 NVIDIA B200/B300。原帖链接的技术文章给出了测试模型、精度、吞吐、延迟和成本假设,也明确展示了 TPU 并非在所有区间领先。
英文原帖与中文翻译
We are excited to bring the first open benchmarking of Google’s TPUs to the world. Running every day, on many models + scenarios.
我们很高兴把首个 Google TPU 公开基准带给大家。它每天运行,覆盖多种模型和场景。
原帖其余内容说明:按该基准的成本模型,TPU 的每 token 成本优于 B200 和 B300;这项工作由 Google、Inferact 与 SemiAnalysis 的 InferenceX 团队历时数月完成。
原帖引用的 SemiAnalysis 动态标题为:
TPU Inference Externalization — Full Steam Ahead: InferenceX, up to 50% better performance per dollar, rapid externalization of the TPU stack.
TPU 推理对外开放正在提速:InferenceX 显示每美元性能最高提升 50%,TPU 软件栈也在快速走向外部使用。
这次测了什么
SemiAnalysis 将本次结果标为 InferenceX Official Preview,称这是 TPUv7 Ironwood 的首批第三方推理测试。初始模型为 Qwen3.5 397B、FP8,比较对象是 FP8 模式下的 NVIDIA B200 和 B300。当前重点是聚合式服务、单 token 预测以及约 8k 输入、1k 输出的请求形态。
这不是“同一块芯片在所有指标上的绝对排名”。报告分别观察每用户生成速度、总吞吐、端到端延迟、首 token 延迟(TTFT)和建模后的总拥有成本(TCO),不同约束下结论会变化。
关键结果
在每用户约 100 token/s 的交互速度下,报告估算:
- TPUv7 Ironwood:约 0.181 美元/百万总 token;
- B200:约 0.222 美元/百万总 token;
- B300:约 0.276 美元/百万总 token。
对应 TPU 成本约比 B200 低 19%、比 B300 低 34%。
在每用户约 20 token/s 的测试点,Ironwood 达到每芯片 9,364 token/s,B200 为 8,903 token/s,B300 为 8,925 token/s。报告据其外部 TCO 模型计算,Ironwood 的每美元 token 数分别高 50.4% 和 96.0%。这些百分比只对应特定吞吐、并发和成本假设,不能推广为所有工作负载的固定优势。
按约 20 秒中位端到端响应时间读取 Pareto 曲线时,报告给出的成本约为:TPU 0.098 美元/百万 token、B200 0.106 美元、B300 0.132 美元,即 TPU 分别低约 8% 和 25%。
延迟与精度边界
报告同时展示了几个重要反例:
- 在大部分纯原始性能曲线上,TPU 并没有超过 NVIDIA;每美元优势主要来自报告采用的较低 TPU TCO。
- 并发 256、采用 Google 内部 TCO 时,TPU 的每美元性能优势会进一步扩大,但平均 TTFT 为 5.41 秒,慢于 B200 的 3.75 秒和 B300 的 2.40 秒。
- TPUv7 没有原生 FP4 计算;NVIDIA GPU 使用 FP4 时仍领先,但 FP4 相对 FP8 可能带来质量损失。报告关于 TPUv8i 原生 FP4 后将改变格局的说法属于预测,尚不是本轮实测结果。
- 当前外部 TPU 服务栈还没有完整优化解耦式 prefill/decode。将 TPUv7 聚合式服务与 GB300 NVL72 解耦式服务相比,在部分中等延迟区间 GB300 可领先约 30%;因此不能把不同服务架构混为“苹果对苹果”对比。
TorchTPU 软件栈为何重要
旧的 TorchAX 路径会把 PyTorch 模型操作转换给 JAX 执行。新的 TorchTPU 方案则让 vLLM 和 SGLang 把 TPU 当作原生 PyTorch 设备,底层再由 StableHLO、XLA 和 Pallas 优化内核完成执行。报告称,团队后续还需完善推测解码、解耦式 prefill、KV-cache 卸载、多轮 Agent 工作负载与更多开源模型支持。
文章预计 TorchTPU 私有测试结束后将在 10 月左右开源;这是路线图,不是当前已完成状态。
如何验证与使用这些数据
- 完整方法和曲线见 SemiAnalysis 技术文章;公开基准入口为文中的 InferenceX Preview。
- 评估采购或云端部署时,应固定模型、数值精度、输入输出长度、并发、目标 TTFT、端到端延迟和 TCO 口径,再比较曲线上的同一工作点。
- 这些结果来自 SemiAnalysis 的预览测试及成本模型,本帖未独立复现;Google、Inferact 和 SemiAnalysis 团队参与了相关优化,读者应结合后续公开代码、独立复测和实际报价判断。
- “每美元性能最高提升 50%”是报告摘要,不代表所有模型、延迟目标、FP4 场景或解耦式服务配置。
原作者:Dylan Patel(@dylan522p),2026 年 9 月 7 日
原帖:Dylan Patel on X: "We are excited to bring the first open benchmarking of Google's TPUs to the world Running every day, on many models + scenarios $/token is better than B200 and B300 Huge shout-out to Google @inferact and the InferenceX team at SemiAnalysis to this effort that's taken many months" / X