Skip to main content
使用此接口分析任务的完整训练指标历史。该分析会检测可能预示奖励作弊的奖励突增,并在整个训练过程中计算汇总统计。在将模型接纳到生产环境之前,这可用于审计 RL 任务。

方法与路径

认证

Authorization 头中以 Bearer 令牌的形式携带你的 PIN API 令牌或 JWT。

路径参数

string
required
任务标识符(例如 jb_abc123def456)。

请求示例

响应

返回标准的 PIN 成功信封,包含分析结果。
integer
required
成功为 0,出错为非零值。
object
required
string
可读消息(成功时为空)。

响应示例

检测逻辑

分析器在整个步历史上执行以下检查:
  1. 奖励突增检测:对于前 10 步之后的每一步,若奖励至少为前 10 步均值的 2 倍,则该步被标记为突增。
  2. 后半段比较:若训练后半段的奖励均值比前半段高出 50% 以上,则追加证据。
  3. 风险标记:两个及以上突增步触发 suspected_reward_hacking。否则风险为 ok
  4. 高方差警告:若未发现突增但标准差超过 0.3,则追加人工复核建议。
不报告奖励的非 RL 任务(SFT、OPD)会跳过针对奖励的检查。

错误