> ## Documentation Index
> Fetch the complete documentation index at: https://docs.ariacompute.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# Aria 模型包与量化

> 了解咏唱引擎如何以量化等级打包模型包、进行 SDK 版本管理，并通过预签名 URL 完成认证投递。

Aria 模型包是一个目录，包含在你的硬件上运行设备原生基础模型所需的全部内容。每个模型包以「模型 slug + 量化等级」命名，例如 `gemma-4-e2b-it_q4` 或 `qwen3.5-2b_q8`。这种命名约定让你可以轻松识别正在部署的确切模型与精度。

## 模型包内容

每个模型包至少包含以下文件：

| 文件            | 用途       |
| ------------- | -------- |
| `weight.bin`  | 量化后的模型权重 |
| `config.json` | 模型配置与元数据 |

可选的 tokenizer 附属文件（如 `tokenizer.json`）也可能随附，取决于模型架构。

## 量化等级

咏唱引擎为模型权重支持三种量化值：

| 量化       | 说明                          |
| -------- | --------------------------- |
| `int4`   | 4 位整数量化权重，体积最小              |
| `int8`   | 8 位整数量化权重，体积与精度均衡           |
| `int326` | INT3.26 混合精度，用于语言与 VLA/策略模型 |

存储空间受限时选择 `int4`，追求均衡质量时选择 `int8`，用于需要更高精度的先进语言与视觉模型时选择 `int326`。

## SDK 版本管理

下载模型包时，你可以通过 `sdk` 参数指定 SDK 版本（例如 `sdk=v1.0`）。这确保你获得与应用中所用 Aria SDK 兼容的模型包。若省略该参数，服务端将返回最新的兼容模型包。

## 下载与模型库

模型包托管于私有 S3 模型库。认证下载请求将返回一个短时效的 S3 预签名 URL。你可以在 `Authorization: Bearer` Header 中使用会话 JWT 或 API 密钥进行认证。

阅读[下载模型指南](/guides/download-models)获取分步说明，或查看 [`GET /api/models/{slug}/download`](/api-reference/models/download) 参考了解查询参数与响应格式。

## 公开镜像

咏唱引擎还在 Hugging Face（`ariacompute/*`）与 ModelScope（`AriaCompute/*`）维护公开镜像，供偏好通过这两个平台下载的用户使用。
