AudioOpenAI1 家上游
whisper-1
OpenAI whisper-1 · AUDIO 模型
模型概览
- 这是一个音频处理模型,适合语音识别、转写或相关媒体处理任务。
- 它属于 OpenAI 路线,通常更适合直接接入现有 OpenAI SDK、工具调用和结构化输出工作流。
适用场景
- 做语音转写、字幕、会议纪要或音频理解时
- 先验证文件上传与返回结构,再接入正式媒体工作流时
- 需要把音频能力和现有 OpenAI 风格工具统一起来时
接入说明
- 标准 API 使用 Base URL https://api.gpt88.cc,再按工具类型使用对应 endpoint。
- 第一次接入时,建议先用一条最小请求验证 API Key、模型名 whisper-1 和当前线路是否匹配。
- 媒体类模型通常先验证上传 / 返回结构,再扩展到正式的素材或媒体管线。
使用提醒
- 价格、限速、SLA、上下文长度、是否开放多模态等动态值以 gpt88.cc 控制台为准。
- 如果请求延迟偏高或连接不稳定,请先检查 API Key、模型、endpoint 和请求格式。
能力标签
该模型的能力标签以 gpt88.cc 控制台为准。本页只展示协议字段与请求示例,具体能力 / 推荐场景 / 上下文长度等信息会随上游版本变更,请在 gpt88.cc 控制台 查看实时清单。
推荐场景
该模型的推荐场景以 gpt88.cc 控制台为准。本页只展示协议字段与请求示例,具体能力 / 推荐场景 / 上下文长度等信息会随上游版本变更,请在 gpt88.cc 控制台 查看实时清单。
接口路径
POSThttps://api.gpt88.cc/v1/audio/transcriptions
该路径由模型分类决定:Chat / Image / Video / Audio 使用不同 endpoint,同一分类内通常只需要替换 model 字段。
请求需在 Header 中携带 Authorization: Bearer <API_KEY>。 完整字段说明见 当前模型页的 Audio API 文档 。
API 文档
Endpoint
POST /v1/audio/transcriptions
Model ID
whisper-1
Content-Type
multipart/form-data
接口类型
音频转写接口,使用文件上传
Base URL
媒体类接口使用 https://img.gpt88.cc,并按对应 endpoint 提交请求。
Headers / 鉴权
| 字段 | 类型 | 必填 | 说明 |
|---|---|---|---|
Authorization | string | 必填 | 使用 Bearer <GPT88_API_KEY>。API Key 在 gpt88.cc 控制台创建。 |
Content-Type | string | 必填 | 请求体格式。音频转写上传文件时使用 multipart/form-data。默认值: multipart/form-data |
Accept | string | 可选 | 非流式接口返回 JSON;Chat 流式请求会返回 SSE 数据流。 默认值: application/json |
Authorizationstring必填使用Bearer <GPT88_API_KEY>。API Key 在 gpt88.cc 控制台创建。Content-Typestring必填请求体格式。音频转写上传文件时使用multipart/form-data。默认值:multipart/form-dataAcceptstring非流式接口返回 JSON;Chat 流式请求会返回 SSE 数据流。默认值:application/json
请求参数
以下字段按当前模型分类生成。价格、上下文长度、限速、可用线路等动态信息以 gpt88.cc 控制台为准。
| 字段 | 类型 | 必填 | 说明 |
|---|---|---|---|
model | string | 必填 | 当前模型 ID:whisper-1。复制时请保持大小写一致。 |
file | File | 必填 | 要转写的音频文件,使用 multipart/form-data 上传。 |
language | string | 可选 | 音频语言提示,例如 zh、en。不传时由模型自动判断。 |
prompt | string | 可选 | 可选上下文提示,用于专有名词、会议主题或人名纠偏。 |
response_format | string | 可选 | 返回格式,例如 json、text、verbose_json。默认值: json |
modelstring必填当前模型 ID:whisper-1。复制时请保持大小写一致。fileFile必填要转写的音频文件,使用multipart/form-data上传。languagestring音频语言提示,例如zh、en。不传时由模型自动判断。promptstring可选上下文提示,用于专有名词、会议主题或人名纠偏。response_formatstring返回格式,例如json、text、verbose_json。默认值:json
响应字段
响应结构保持 OpenAI 兼容风格;媒体类模型可能返回异步任务 ID 或资源 URL。
| 字段 | 类型 | 必填 | 说明 |
|---|---|---|---|
text | string | 必填 | 完整转写文本。 |
language | string | 可选 | 识别到或指定的语言。 |
duration | number | 可选 | 音频时长,单位秒。是否返回取决于响应格式。 |
segments | array<Segment> | 可选 | 分段时间轴,仅在 verbose_json 等详细格式中返回。 |
textstring必填完整转写文本。languagestring识别到或指定的语言。durationnumber音频时长,单位秒。是否返回取决于响应格式。segmentsarray<Segment>分段时间轴,仅在 verbose_json 等详细格式中返回。
状态码
| 字段 | 类型 | 必填 | 说明 |
|---|---|---|---|
200 | OK | 必填 | 请求成功,响应体结构见上方响应字段。 |
400 | Bad Request | 可选 | 请求字段不合法,例如缺少必填字段、图片尺寸格式错误或文件格式不支持。 |
401 | Unauthorized | 可选 | API Key 缺失、无效或格式错误。 |
404 | Not Found | 可选 | Endpoint 或模型不存在。请确认路径为 /v1/audio/transcriptions,模型 ID 为 whisper-1。 |
429 | Rate Limited | 可选 | 触发限速、并发限制或余额不足。控制台会展示当前账号可用额度。 |
5xx | Upstream Error | 可选 | 上游或请求异常。保持统一 Base URL 重试,并保留请求 ID 便于排查。 |
200OK必填请求成功,响应体结构见上方响应字段。400Bad Request请求字段不合法,例如缺少必填字段、图片尺寸格式错误或文件格式不支持。401UnauthorizedAPI Key 缺失、无效或格式错误。404Not FoundEndpoint 或模型不存在。请确认路径为/v1/audio/transcriptions,模型 ID 为whisper-1。429Rate Limited触发限速、并发限制或余额不足。控制台会展示当前账号可用额度。5xxUpstream Error上游或请求异常。保持统一 Base URL 重试,并保留请求 ID 便于排查。
错误与排查
401:检查Authorization是否为Bearer <API_KEY>,以及 Key 是否仍有效。404:检查 endpoint 是否为/v1/audio/transcriptions,以及模型名whisper-1是否在控制台可见。429:触发限速或余额不足时,降低并发、缩短请求,或到控制台查看额度。5xx:保持统一 Base URL 重试,并记录请求 ID 方便排障。
请求示例
curl https://api.gpt88.cc/v1/audio/transcriptions \
-H "Authorization: Bearer $GPT88_API_KEY" \
-F "model=whisper-1" \
-F "[email protected]" \
-F "response_format=verbose_json"期望响应(精简示例):
200 OKjson
{
"text": "完整识别文本……",
"language": "zh",
"duration": 124.6,
"segments": [
{ "id": 0, "start": 0.0, "end": 4.2, "text": "..." }
]
}