gemma-4-e2b-it_q4 或 qwen3.5-2b_q8。这种命名约定让你可以轻松识别正在部署的确切模型与精度。
模型包内容
每个模型包至少包含以下文件:
可选的 tokenizer 附属文件(如
tokenizer.json)也可能随附,取决于模型架构。
量化等级
咏唱引擎为模型权重支持三种量化值:
存储空间受限时选择
int4,追求均衡质量时选择 int8,用于需要更高精度的先进语言与视觉模型时选择 int326。
SDK 版本管理
下载模型包时,你可以通过sdk 参数指定 SDK 版本(例如 sdk=v1.0)。这确保你获得与应用中所用 Aria SDK 兼容的模型包。若省略该参数,服务端将返回最新的兼容模型包。
下载与模型库
模型包托管于私有 S3 模型库。认证下载请求将返回一个短时效的 S3 预签名 URL。你可以在Authorization: Bearer Header 中使用会话 JWT 或 API 密钥进行认证。
阅读下载模型指南获取分步说明,或查看 GET /api/models/{slug}/download 参考了解查询参数与响应格式。
公开镜像
咏唱引擎还在 Hugging Face(ariacompute/*)与 ModelScope(AriaCompute/*)维护公开镜像,供偏好通过这两个平台下载的用户使用。