Responses 与 Compact 是两套独立的 OpenAI-compatible JSON 契约。模型 ID、能力与可用性以 Models API 和 Model Market 当前配置为准。
https://api.tokensapi.cn/v1POST /responses请求地址固定,请根据当前页面的参数说明替换模型 ID 和业务输入。
${base_url}/responses${base_url}/responses/compactResponses 支持完整输入、会话、工具和输出控制。建议 background:false;不承诺公开 retrieve、cancel 或 delete 生命周期。
| 参数 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
model | string | 是 | — | 精确模型 ID。 |
input | string | array | 是 | — | 字符串或 Responses 输入项数组。 |
instructions | string | 否 | — | 本次请求的系统指令。 |
conversation | string | object | 否 | — | 协议支持时关联已有对话。 |
include | string[] | 否 | — | 需要额外返回的协议字段。 |
max_output_tokens | integer | 否 | — | 输出 token 上限。 |
metadata | object | 否 | — | 请求元数据。 |
reasoning | object | 否 | — | 模型支持时的推理配置。 |
context_management | object | 否 | — | 模型支持时的上下文管理配置。 |
max_tool_calls | integer | 否 | — | 模型支持时允许的最大工具调用次数。 |
moderation | object | string | 否 | — | 模型支持时的内容审核控制。 |
parallel_tool_calls | boolean | 否 | — | 是否允许并行工具调用。 |
previous_response_id | string | 否 | — | 关联前一个 Responses 响应。 |
prompt | string | object | 否 | — | 复用模型支持的提示模板。 |
prompt_cache_key | string | 否 | — | 提示缓存键。 |
prompt_cache_options | object | 否 | — | 提示缓存选项。 |
prompt_cache_retention | string | 否 | — | 提示缓存保留策略。 |
safety_identifier | string | 否 | — | 安全标识符。 |
service_tier | string | 否 | — | 模型支持时的服务等级。 |
store | boolean | 否 | — | 是否按协议存储响应。 |
stream_options | object | 否 | — | 流式输出选项。 |
temperature | number | 否 | — | 采样温度。 |
tool_choice | string | object | 否 | — | 工具选择策略。 |
top_logprobs | integer | 否 | — | 返回的候选 token 对数概率数量。 |
top_p | number | 否 | — | 核采样阈值。 |
truncation | string | 否 | — | 上下文超过限制时的截断策略。 |
user | string | 否 | — | 已弃用的终端用户标识。 可选值 / 约束:Deprecated。 |
text | object | 否 | — | 文本格式和结构化输出配置。 |
tools | array | 否 | — | 模型支持时可调用的工具。 |
stream | boolean | 否 | — | 设为 true 启用 SSE。 |
background | boolean | 否 | false | 建议显式设为 false。 |
Compact 只接受独立的 JSON 请求体;不使用 Session 路由,也不承诺后台任务生命周期。
| 参数 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
model | string | 是 | — | 精确模型 ID。 |
input | string | array | 是 | — | 要压缩的输入。 |
instructions | string | 否 | — | 压缩要求或输出指令。 |
previous_response_id | string | 否 | — | 关联前一个 Responses 响应。 |
prompt_cache_key | string | 否 | — | 提示缓存键。 |
prompt_cache_retention | string | 否 | — | 提示缓存保留策略。 |
service_tier | string | 否 | — | 模型支持时的服务等级。 |
extra_body.provider | object | 否 | — | 可选的 provider 路由配置。 |
本接口支持路由和软粘性 Session。Session ID 最长 256 个字符,读取顺序为顶层 session_id、extra_body.session_id、X-Session-Id。
| 参数 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
extra_body.provider | object | 否 | — | 服务商过滤、范围、排序和优先顺序的容器。 可选值 / 约束:ignore、*_range、only、sort、order、allow_fallbacks。 |
session_id | string | 否 | — | 顶层 Session ID;适用于同一模型的连续对话或任务。 可选值 / 约束:最长 256 个字符。 |
extra_body.session_id | string | 否 | — | 顶层 session_id 未提供时使用的 Session ID。 可选值 / 约束:最长 256 个字符。 |
X-Session-Id | string | 否 | — | body 中未提供 Session ID 时使用的请求 Header。 可选值 / 约束:最长 256 个字符。 |
extra_body.provider.allow_fallbacks | boolean | 否 | — | 非空 only 时默认 false;否则默认 true。 可选值 / 约束:true 可放宽 only、ranges、sort、order;不会放宽 ignore、权限、端点能力或通道可用性。 |
以下字段属于 HTTP 响应 Header,不属于 JSON、SSE 事件或二进制响应 body。网络层失败而未进入网关时不保证返回。
| 参数 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
X-Client-Request-Id | string | 否 | — | 调用方在请求中提供时回显;未提供时网关不会自动生成。 |
X-Upstream-Request-Id | string | 否 | — | 通常用于网关请求追踪,不代表 provider 的原始 request ID。 |
错误 body 遵循所选协议。HTTP 400 表示 invalid_request,HTTP 402 表示可用余额或配额不足,HTTP 429 表示限流。
| 参数 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
error.code | string | 否 | — | 协议定义的机器可读错误码。 |
error.message | string | 否 | — | 可读错误说明。 |
正常的 OpenAI Responses 流发送协议终止事件后以 data: [DONE] 结束。客户端应处理增量、usage 和流内错误;异常断流时不保证收到终止事件或 data: [DONE]。
示例使用占位符,请替换为模型详情页中当前可用的 model ID,并将 API Key 保存在服务端环境变量中。
curl https://api.tokensapi.cn/v1/responses \
-H "Authorization: Bearer $TOKEN_MARKET_API_KEY" \
-H "Content-Type: application/json" \
-H "X-Session-Id: conversation-<UUID>" \
-d '{
"model": "<MODEL_ID>",
"input": "Summarize the attached policy in three bullets.",
"instructions": "Use concise language.",
"stream": true,
"extra_body": {"provider": {"sort": ["latency"]}}
}'