> ## Documentation Index
> Fetch the complete documentation index at: https://docs.ariacompute.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# 分析训练指标并检测奖励作弊

> 获取任务的训练后指标分析，包括奖励统计、突增检测与奖励作弊风险标记。

使用此接口分析任务的完整训练指标历史。该分析会检测可能预示奖励作弊的奖励突增，并在整个训练过程中计算汇总统计。在将模型接纳到生产环境之前，这可用于审计 RL 任务。

## 方法与路径

```http theme={null}
GET /v1/jobs/:id/analysis
```

## 认证

在 `Authorization` 头中以 Bearer 令牌的形式携带你的 PIN API 令牌或 JWT。

```http theme={null}
Authorization: Bearer <token>
```

## 路径参数

<ParamField path="id" type="string" required>
  任务标识符（例如 `jb_abc123def456`）。
</ParamField>

## 请求示例

<CodeGroup>
  ```bash curl theme={null}
  curl -s "https://api.ariacompute.com/v1/jobs/jb_abc123def456/analysis" \
    -H "Authorization: Bearer $PIN_API_TOKEN"
  ```
</CodeGroup>

## 响应

返回标准的 PIN 成功信封，包含分析结果。

<ResponseField name="code" type="integer" required>
  成功为 `0`，出错为非零值。
</ResponseField>

<ResponseField name="data" type="object" required>
  <Expandable title="分析对象">
    <ResponseField name="reward" type="object">
      奖励统计。

      <Expandable title="属性">
        <ResponseField name="mean" type="number">
          所有步上的平均奖励。
        </ResponseField>

        <ResponseField name="std" type="number">
          奖励的标准差。
        </ResponseField>

        <ResponseField name="spike_steps" type="array">
          奖励突增的步号（>= 前 10 步基线的 2 倍）。
        </ResponseField>
      </Expandable>
    </ResponseField>

    <ResponseField name="risk" type="string">
      风险评估：`ok` 或 `suspected_reward_hacking`。
    </ResponseField>

    <ResponseField name="evidence" type="array">
      可读证据字符串列表。
    </ResponseField>
  </Expandable>
</ResponseField>

<ResponseField name="message" type="string">
  可读消息（成功时为空）。
</ResponseField>

### 响应示例

```json theme={null}
{
  "code": 0,
  "data": {
    "reward": {
      "mean": 0.7421,
      "std": 0.3124,
      "spike_steps": [1240, 1890]
    },
    "risk": "suspected_reward_hacking",
    "evidence": [
      "reward spiked multiple times (>=2x baseline)",
      "second-half reward mean is >50% above first-half"
    ]
  },
  "message": ""
}
```

## 检测逻辑

分析器在整个步历史上执行以下检查：

1. **奖励突增检测**：对于前 10 步之后的每一步，若奖励至少为前 10 步均值的 2 倍，则该步被标记为突增。
2. **后半段比较**：若训练后半段的奖励均值比前半段高出 50% 以上，则追加证据。
3. **风险标记**：两个及以上突增步触发 `suspected_reward_hacking`。否则风险为 `ok`。
4. **高方差警告**：若未发现突增但标准差超过 0.3，则追加人工复核建议。

不报告奖励的非 RL 任务（SFT、OPD）会跳过针对奖励的检查。

## 错误

| Code | HTTP | 含义                 |
| ---- | ---- | ------------------ |
| 401  | 401  | 缺失或无效的 Bearer 令牌。  |
| 404  | 404  | 任务不存在或不属于你。        |
| 422  | 422  | 任务尚无指标（训练未开始或未上报）。 |
| 500  | 500  | 内部服务器错误。           |
