英文原文(节选)与中文翻译

Reasoning from scratch round 3: This time, I cover generating a verifier for…

从零构建推理模型第三期:这次介绍如何生成一个验证器。

本期用途

该验证器有两个直接用途:

  1. 评估基础模型,并与后续模型改进进行对比;
  2. 为之后使用“可验证奖励的强化学习”(RLVR)提供训练所需的判定机制。

章节内容

  • 00:00:介绍
  • 01:21:四类 LLM 评估方法
  • 07:20:验证器与 RLVR
  • 10:52:Notebook 环境与依赖
  • 13:43:构建数学验证器
  • 18:57:加载预训练模型以生成文本
  • 24:34:生成并展示模型答案
  • 29:23:封装文本生成接口
  • 34:00:提取答案中的最终结果框
  • 37:29:处理没有结果框的答案
  • 43:17:规范化提取出的答案
  • 46:56:验证数学等价性
  • 53:32:实现相等性检查
  • 57:48:对答案评分
  • 59:20:构建并测试答案评分器
  • 1:03:18:加载 MATH-500 评测数据集
  • 1:07:51:执行模型评测
  • 1:08:34:评测提示词模板
  • 1:10:47:提示词敏感性与记忆问题
  • 1:13:55:最小评测示例
  • 1:15:32:构建评测循环
  • 1:20:27:比较 CPU、MPS 与 CUDA 结果
  • 1:21:54:复现性与浮点运算差异
  • 1:23:37:基础模型与推理模型对比
  • 1:25:30:总结与下一步

原帖时长为 1 小时 26 分 46 秒。内容覆盖从答案提取、规范化和数学等价性判断,到 MATH-500 数据集评测、跨硬件结果比较以及复现性边界,目标是先得到可复用的验证与评测基础,再进入后续 RLVR 训练。