Skip to main content

概述

文本生成端点支持 Server-Sent Events (SSE) 流式输出,设置 stream: true 即可逐 token 接收结果。

支持流式的端点

  • /v1/chat/completions — OpenAI 兼容
  • /v1/messages — Claude Messages
  • /v1/responses — OpenAI Responses API

使用示例

以下示例、choices、[DONE] 和末帧 usage.cost 均针对 /v1/chat/completions。Claude Messages 与 OpenAI Responses 的事件结构不同,请按各自接口说明处理。将 YOUR_MODEL 替换为账户可用的文本模型名称。

SSE 数据格式

Chat Completions 的每个 chunk 是一个 data: {json} 格式的 SSE 事件:
流结束时会收到 data: [DONE]。

末帧 usage 与计费(cost)

Chat Completions 启用 usage 输出时,[DONE] 之前的最后一个 usage 帧携带本次调用的用量与计费额度。该帧的 choices 可以是空数组,因此先检查数组是否为空,再读取 choices[0]:
  • usage.cost 是本次调用的计费额度(quota,整数),不是美元(USD);150 表示 150 quota
  • 默认就会下发;显式传 stream_options: {"include_usage": false} 时不下发
  • 使用 OpenAI SDK 时,末帧的 chunk.usage 即为该数据
  • 若连接中断或未收到 usage 帧,不要将缺失的 cost 当作 0;请到控制台用量记录核对