主题
模型广场
查看令牌分组和可用模型
进入模型广场:从控制台首页,点击顶部导航的「模型广场」
选择令牌分组:左侧可以按分组、供应商、标签、定价类型和端点类型筛选模型;右侧显示当前可用模型卡片。选择分组后,模型卡片会按该分组重新计算实际价格
了解计费倍率:创建 API 令牌时选择的分组会影响单次调用消耗。当前用户可见分组为:
OpenAI-plan:1x,适合 GPT / 图片模型Claude-plan:2.5x,适合 Claude 模型default:10x,适合免费或按次体验

读懂模型卡片
模型卡片除了模型名称和价格,还会显示近期性能数据:
| 指标 | 含义 |
|---|---|
| Latency | 请求从发出到完成的平均耗时 |
| TPS | 模型平均每秒生成的 Token 数 |
| Status | 最近成功率的趋势提示 |
点击「详情」可以继续查看不同分组的性能、延迟趋势和支持的接口类型。这些指标来自最近一段时间的实际调用,只适合判断近期状态,不代表长期服务承诺。
价格以所选分组为准
同一个模型在不同令牌分组下可能有不同价格。查看价格时,先选择准备创建或正在使用的令牌分组,再读取卡片和详情页的金额。
缓存计费
支持上下文缓存的模型可能分别展示缓存读取和缓存创建价格。缓存读取通常比普通输入便宜,但首次写入缓存仍会按缓存创建价格计费。实际扣费请以模型详情和控制台用量日志为准。
当前上架模型
模型会持续上架、下架或调整可用分组,完整清单请以模型广场实时结果为准。当前常见类型包括:
| 类型 | 模型 |
|---|---|
| Claude | Claude Haiku、Sonnet、Opus 系列 |
| GPT / OpenAI | GPT、Codex 系列 |
| 图片 | GPT Image 系列 |
| Embedding | 文本向量模型 |
GPT-5.6 系列端点限制
小马AI 当前的 GPT-5.6 系列模型仅支持 Responses API(/v1/responses),暂不支持 Chat Completions API(/v1/chat/completions)。如果客户端仅支持 Chat Completions API,请改用其他模型或更换支持 Responses API 的客户端。
不支持的模型
小马AI 不提供 DeepSeek 和 Banana2 Pro。请不要在 API 令牌、CLI 或客户端中配置这两类模型。
提示
用户经常在配置分组时不了解其内容,导致实施时出现「模型未找到」的错误。建议直接在模型广场验证分组详情。