现象
POST https://zenmux.ai/api/v1/audio/transcriptions
Content-Type: application/json
Authorization: Bearer $ZENMUX_API_KEY
{
"model": "qwen/qwen3-asr-flash",
"input_audio": {
"data": "<base64 音频字节>",
"format": "wav" // wav/mp3/flac/m4a/ogg/webm/aac
},
"language": "zh", // 可选,省略时自动检测
"enable_itn": true // 可选
}
响应:
{
"text": "转写结果",
"model": "qwen/qwen3-asr-flash",
"usage": { "input_tokens": 120, "output_tokens": 11, "total_tokens": 131, "seconds": 3 }
}
影响
- 已经在用 ZenMux 做 LLM 润色的用户(OpenAI 兼容 chat completions 可直接接入)无法复用同一个 API Key 做语音识别,需要额外注册并维护第二家服务的 Key。
- ZenMux 聚合的 Qwen3-ASR-Flash / Doubao-Seed-ASR-2.0 恰好是 OpenLess 目标用户(中文为主、中英混合)最合适的云端引擎档位,接不上比较可惜。
建议接受标准
- ASR 引擎列表新增「ZenMux」provider(或实现一个可配置请求格式的通用自定义 ASR provider,把 ZenMux 作为预设之一),可配置 base_url(默认
https://zenmux.ai/api/v1)、API Key、模型 slug。
- 录音停止后走
POST /audio/transcriptions(JSON + base64 input_audio)完成转写,language 跟随 OpenLess 的语言设置,响应 text 进入现有润色/插入链路。
- 转写失败时按现有云端 ASR 的错误提示口径处理(含 4xx 错误信息透出)。
补充说明:本条由 Claude Code 协助调研与撰写,格式细节来自 ZenMux 官方文档,如与最新文档有出入以官方为准。
现象
响应:
{ "text": "转写结果", "model": "qwen/qwen3-asr-flash", "usage": { "input_tokens": 120, "output_tokens": 11, "total_tokens": 131, "seconds": 3 } }qwen/qwen3-asr-flash、bytedance/doubao-seed-asr-2.0、xiaomi/mimo-v2.5-asr,均为中文/中英混合场景的主流选择。影响
建议接受标准
https://zenmux.ai/api/v1)、API Key、模型 slug。POST /audio/transcriptions(JSON + base64input_audio)完成转写,language跟随 OpenLess 的语言设置,响应text进入现有润色/插入链路。补充说明:本条由 Claude Code 协助调研与撰写,格式细节来自 ZenMux 官方文档,如与最新文档有出入以官方为准。