Skip to main content
所有文本模型都走 OpenAI 兼容的 Chat Completions 接口,换模型只改 model,不需要按厂商换 URL 或换 Key。本页按厂商列出全部模型 ID、支持的能力和计费方式。

调用入口

Chat Completions

POST /v1/chat/completions。默认入口,本页所有模型都从这里调用(Responses 专用模型除外)。

Responses

POST /v1/responses。GPT Pro / Codex / o3-pro 系列只接受这个入口。

Claude Messages

POST /v1/messages。为已有 Anthropic SDK 的应用保留的原生信封。

Gemini 原生

POST /v1beta/models/{model}:generateContent。为已有 Gemini 客户端保留的原生信封。
新接入建议使用 Chat Completions。原生入口用于兼容已有客户端,不提供额外能力。所有入口都用 WaveAPI Key 作为凭据(Chat / Responses 走 Authorization: Bearer,Messages 走 x-api-key,Gemini 原生走 x-goog-api-key),生态登录 token 不能代替模型 Key,见认证

计费口径

各模型的单价见 GET /v1/models 返回的 price_config,或控制台「模型市场」。单次调用的实际花费见响应里的 usage.cost 以下规则适用于全部文本模型,模型之间的差异见各厂商表格与表下的「模型备注」。
  • 售价来源:按官方标准价九折或原价制定,不高于官方;不使用 Batch、Flex、Priority 等特殊价。具体单价见 GET /v1/modelsprice_config
  • 输入总量含缓存prompt_tokens 是输入总量,其中实际报告的缓存命中 / 缓存写入 token 按对应缓存价计费,其余按普通输入价;缓存部分是输入的组成部分,不在总量之外再加一次。
  • 思考含在输出里completion_tokens 已包含 completion_tokens_details.reasoning_tokens,思考 token 按输出价计费一次,不再叠加。
  • 两项计价模型:计费方式为「输入输出两项」的模型没有缓存价,响应里的缓存统计按普通输入价计,显式 cache_control 会返回 400。
  • 长上下文分档:有分档的模型以输入总量(含缓存)判断档位,达到阈值后整单(输入、缓存、输出)切换到高档价,不是只对超出部分加价。阈值与「恰好等于阈值」的归属见各厂商段落。
  • 时段价:DeepSeek V4 按请求开始时刻的 UTC 时段定价,见 DeepSeek 段落。
  • 额度换算:分项费用合计后换算成整数 quota,500,000 quota = 1 USD;有正用量但不足 1 quota 的请求按 1 quota 计,再应用账户分组倍率并取整。响应里的 usage.cost 就是这个整数 quota,不是美元
各项单价的单位是 USD / 100 万 token:
最终扣款以控制台账单中的文本账务记录为准,状态含义如下:
没有收到完整 usage、连接中断或响应缺少费用字段,都不代表本次调用免费。先到控制台核对已有用量记录,不要自动重发。

缓存

缓存能力按模型分四档,取决于该模型配了哪几项缓存价。 缓存读写按各自单价替代对应的普通输入费用,不在输入之外另加一笔。

自动缓存与显式缓存

自动缓存由上游决定是否命中,调用方不传任何参数:命中的 token 出现在 usage.prompt_tokens_details.cached_tokens 里,按该模型的缓存读价计费。是否命中不做保证,成本预估不应假定必定命中。 显式缓存在请求里用 cache_control 标出可复用的前缀,按模型放行: 不支持的请求返回 400,不计费。
首次接入时,建议先用小请求确认控制台用量记录里的缓存分项符合预期,再放量。

Claude 显式缓存写法

OpenAI 兼容接口:content 必须是内容块数组,字符串形式的 content 带不了 cache_control, 标记会被忽略、整段按普通输入计费。
原生 Messages 接口把前缀放在 system 数组里,写法相同。 ttl 省略时为 5 分钟;要用 1 小时档,请求里写 "cache_control": {"type": "ephemeral", "ttl": "1h"} 并带上 anthropic-beta: extended-cache-ttl-2025-04-11 请求头——该头由网关原样透传到上游。

命中条件与读数

  • 前缀长度:通常至少约 1,024 token,更短的前缀不会产生缓存。
  • 前缀逐字节一致:文本、空格、换行、内容块顺序有任何差异都不算命中。
  • 在 TTL 内复用:5 分钟或 1 小时从最近一次命中重新计时。
Chat 响应里 usage.prompt_tokens_details.cached_tokens 是命中量;原生 Messages 用 cache_read_input_tokenscache_creation_input_tokens,并且原生的 input_tokens 不含这两项,总输入是三者相加(Chat 的 prompt_tokens 则已经含在内)。写入量按缓存写价计费,高于普通输入价,因此显式缓存适用于前缀稳定、且会在 TTL 内被复用的场景。

当前不支持

以下请求会返回 400,不计费:
  • 厂商内置工具——tools 里出现 function / custom 之外的类型(内置联网、托管搜索、托管执行等)。由调用方自己执行的函数工具不在此列,正常使用。
  • web_search_options
  • service_tierstandard / default 以外的值。
  • 显式缓存——见上文的放行表。
每个模型只服务它支持的协议(Chat / Responses / Claude Messages / Gemini 原生)。把请求发到模型不支持的协议,或者在不支持工具、结构化输出的模型上传 toolstool_choiceresponse_format,同样返回 400。各模型支持的协议与能力见下方模型目录。

模型目录

怎么读表:所有模型都支持非流式与流式文本输出,因此不单列。「JSON / 工具」一列左为 JSON Schema 结构化输出、右为函数调用——平台只返回函数名和参数,工具由你的应用执行 表示支持, 表示不支持。「计费方式」一列说明该模型按哪些维度计费,单价见目录接口。带长上下文分档的模型以输入总量(含缓存)判断档位,达到阈值后整单切换,阈值写在表下的「模型备注」里。「模型备注」还写各模型的输入输出上限与专有限制;上限是接口允许的最大值,输入和输出不能同时用到上限。

OpenAI

模型备注
  • gpt-6-astra — 272K 长上下文分档;有独立缓存写入价;最大输入 922K、最大输出 12.8K;不支持工具调用;reasoning_effort"low",不支持 "none";不接受 temperaturetop_plogprobs
  • gpt-5.6-luna — 272K 长上下文分档;有独立缓存写入价;最大输入 922K、最大输出 128K;支持自动缓存命中
  • gpt-5.6-terra — 272K 长上下文分档;有独立缓存写入价;最大输入 922K、最大输出 12.8K
  • gpt-5.6-sol — 272K 长上下文分档;有独立缓存写入价;最大输入 922K、最大输出 12.8K
  • gpt-5.5 — 272K 长上下文分档;最大输入 1M、最大输出 12.8K;无独立缓存写入价
  • gpt-5.4 — 272K 长上下文分档;最大输入 1M、最大输出 12.8K;无独立缓存写入价
  • gpt-5.4-pro — 272K 长上下文分档;仅 /v1/responses
  • gpt-5.3-codex — 仅 /v1/responses
  • gpt-5.2-pro — 仅 /v1/responses
  • gpt-5-pro — 仅 /v1/responses
  • o3-pro — 仅 /v1/responses
GPT-5 及之后的模型用 max_completion_tokens 限制输出、用 reasoning_effort 选推理档位(GPT-6 Astra 只支持 "low")。max_tokens 会被拒绝。gpt-5-pro / gpt-5.2-pro / gpt-5.4-pro / gpt-5.3-codex / o3-pro 只能走 Responses 接口,发到 Chat 会返回 400。272K 分档以输入总量判断:恰好 272,000 用普通档,超过则整单(含缓存与输出)切到长上下文档。GPT-5.6 的缓存写入价是本档输入价的 1.25 倍,替代普通输入计费而不是叠加;GPT-5.4 / 5.5 没有独立缓存写入价。

Anthropic

模型备注
  • claude-fable-5-1 — 缓存写入分 5 分钟 / 1 小时两档;最大输入 1M、最大输出 128K;不支持 JSON Schema 结构化输出;tool_choice 只接受 "auto""required" 与指定函数名会返回 400
  • claude-fable-5 — 缓存写入分 5 分钟 / 1 小时两档;最大输入 1M、最大输出 128K;不支持 JSON Schema 结构化输出;tool_choice 只接受 "auto"
  • claude-opus-5 — 缓存写入分 5 分钟 / 1 小时两档;最大输入 128K、最大输出 16K;不支持 JSON Schema 与 json_object;可用原生 /v1/messages 接口
  • claude-sonnet-5 — 缓存写入分 5 分钟 / 1 小时两档;最大输入 1M、最大输出 128K;不支持 JSON Schema 与 json_object;可用原生 /v1/messages 接口
Chat 接口用 max_tokens 限制输出;GPT 专用的 reasoning_effortmax_completion_tokens 不适用于 Claude 模型。Claude 5 与 Fable 四个模型是三段缓存价(读 / 5 分钟写 / 1 小时写),也是目前唯一放行显式 cache_control 的一组,写法见缓存;这四个模型不支持结构化输出response_formatjson_schemajson_object 会返回 400。Fable 系列的 tool_choice 只接受 "auto""required" 或指定函数名会返回 400。4.x 系列只有输入 / 输出两项计价,不支持 cache_control。已有 Anthropic SDK 的应用可走原生 Messages 接口,但只有 claude-sonnet-5claude-opus-5 支持这个接口;其余 Claude 模型走 Chat 接口,发到 /v1/messages 会返回 400。

Google Gemini

模型备注
  • gemini-3.8-flash — 最大输入 1M、最大输出 65K;支持 Gemini 原生接口
  • gemini-3.7-flash — 最大输入 1M、最大输出 65K;支持 Gemini 原生接口
  • gemini-3.6-flash — 最大输入 1M、最大输出 65K;支持 Gemini 原生接口
  • gemini-3.5-flash — 支持 Gemini 原生接口
  • gemini-3.1-pro-preview — 200K 长上下文分档;支持 Gemini 原生接口
  • gemini-3-flash-preview — 支持 Gemini 原生接口
  • gemini-2.5-pro — 200K 长上下文分档;支持 Gemini 原生接口
  • gemini-2.5-flash-lite — 支持 Gemini 原生接口
OpenAI 兼容接口之外,下列模型还可以走 Gemini 原生接口:gemini-2.5-flash-lite gemini-2.5-pro gemini-3-flash-preview gemini-3.1-pro-preview gemini-3.5-flash gemini-3.6-flash gemini-3.7-flash gemini-3.8-flashgemini-3.5-flash-lite 只走 Chat)。原生入口是 POST /v1beta/models/{model}:generateContent(流式 :streamGenerateContent?alt=sse),见 Gemini 原生接口。原生响应用 usageMetadata 报告用量、不带 usage.costcandidatesTokenCountthoughtsTokenCount 分开报告,计费输出是两者之和。Pro 模型(gemini-2.5-pro / gemini-3.1-pro-preview)有 200K 长上下文分档,超过 200,000 输入总量后整单切换。3.6 / 3.7 / 3.8 Flash 有隐式缓存读价,是否命中由上游决定;其余模型两项计价。Gemini 全系只支持自动缓存,显式缓存(cache_control / cachedContent)会返回 400;内置工具、web_search_options 以及 standard / default 以外的 service_tier 同样返回 400。

DeepSeek

模型备注
  • deepseek-v4-pro — 最大输入 1M、最大输出 393K;支持自动缓存命中;按时段计价,见本节末表
  • deepseek-v4-flash — 最大输入 128K、最大输出 16K;支持自动缓存命中;按时段计价,见本节末表
  • deepseek-v3.2-exp — 不提供严格 JSON Schema;与 deepseek-v3.2 是两个独立模型(2025-09-29 实验版)
  • deepseek-v3.1-terminus — 不提供严格 JSON Schema;官方主 API 已不再列出该版本
V4 Pro / Flash 按请求开始时刻的 UTC 时段计价(北京时间加 8 小时)。价格在请求开始时确定,响应费用与最终结算都用这一份,即使响应跨过时段边界也不重新选价。传 thinking: {"type": "disabled"} 可关闭思考。V4 缓存命中价替代对应输入,不提供独立缓存写入。V3.x / R1 两项计价;deepseek-v3.2-expdeepseek-v3.1-terminus 不提供严格 JSON Schema,需要 schema 约束时用 deepseek-v3.2deepseek-r1-0528 北京时间加 8 小时。Pro 与 Flash 各时段的输入 / 输出 / 缓存读单价,见公开模型详情 GET /v1/modelsprice_config.text_schedule——该字段是完整的时段价表,也是结算依据。

Qwen(阿里云)

模型备注
  • qwen3.8-max — 最大输入 983K、最大输出 131K;支持自动缓存命中;不支持显式 cache_controltool_choice"auto"
  • qwen3.7-plus — 256K 长上下文分档
  • qwen3.6-plus — 256K 长上下文分档
  • qwen3.6-flash — 256K 长上下文分档
Qwen3.8 Max 只支持自动缓存,是否命中由上游决定;显式缓存的 cache_control 会返回 400。Plus / Flash 有 256K 分档,按输入总量整单切换。思考 token 占用输出预算,且无法关闭。

Kimi(Moonshot)

模型备注
  • kimi-k3 — 最大输入 1M、最大输出 105K;支持自动缓存命中;tool_choice"auto";函数调用建议给 512 以上的输出预算
Kimi K3 支持自动缓存;tool_choice"auto",函数调用需要足够的输出预算,建议 512 以上。K2.x 只有输入 / 输出两项计价。

Grok(xAI)

模型备注
  • grok-4.6 — 200K 长上下文分档;最大输入 500K、最大输出 12.8K;支持自动缓存命中;不支持工具调用;max_tokens 不是硬上限,思考可使 completion_tokens 超出
  • grok-4.5 — 200K 长上下文分档;不支持工具调用
  • grok-4.3 — 200K 长上下文分档
  • grok-4.20-0309-reasoning — 200K 长上下文分档
  • grok-4.20-0309-non-reasoning — 200K 长上下文分档
  • grok-build-0.1 — 200K 长上下文分档
Grok 全系 200K 分档:输入总量(含缓存)达到 200,000 时,输入、缓存读和输出整单切到高档,不是只对超出部分加价。Grok 4.6 支持自动缓存。全系不支持工具调用,传 tools 会返回 400。max_tokens 对思考模型不是硬上限——completion_tokens 含思考 token,可能超过设定值,可用 Key 额度控制预算上限。

GLM(Z.ai)

只有输入 / 输出两项计价,不支持 cache_control

MiniMax

只有输入 / 输出两项计价,不支持 cache_control

其他

模型备注
  • mimo-v2.5-pro — 小米 MiMo
  • step-3.7-flash — 阶跃星辰 Step
只有输入 / 输出两项计价,不支持 cache_control

目录接口

模型的实时可用性、价格配置与能力字段以目录接口为准:
单个模型:GET /v1/models/{model}。返回的 price_config 就是本页表格的来源:input / output 是基础单价,cache_read / cache_write / cache_write_1h 表示该模型开放到哪一档缓存,input_tier_threshold*_above_price 是长上下文分档,cache_billing: "input_output" 表示只有输入输出两项计价。 目录接口返回的模型即为当前已上架的全部文本模型,未出现在返回结果中的模型不可调用。