Skip to content

[asr] 接入 ZenMux 语音转写接口(JSON + base64 私有格式)作为可选云端 ASR #837

Description

@GeorgeJin1230

现象

POST https://zenmux.ai/api/v1/audio/transcriptions
Content-Type: application/json
Authorization: Bearer $ZENMUX_API_KEY

{
  "model": "qwen/qwen3-asr-flash",
  "input_audio": {
    "data": "<base64 音频字节>",
    "format": "wav"   // wav/mp3/flac/m4a/ogg/webm/aac
  },
  "language": "zh",     // 可选,省略时自动检测
  "enable_itn": true    // 可选
}

响应:

{
  "text": "转写结果",
  "model": "qwen/qwen3-asr-flash",
  "usage": { "input_tokens": 120, "output_tokens": 11, "total_tokens": 131, "seconds": 3 }
}

影响

  • 已经在用 ZenMux 做 LLM 润色的用户(OpenAI 兼容 chat completions 可直接接入)无法复用同一个 API Key 做语音识别,需要额外注册并维护第二家服务的 Key。
  • ZenMux 聚合的 Qwen3-ASR-Flash / Doubao-Seed-ASR-2.0 恰好是 OpenLess 目标用户(中文为主、中英混合)最合适的云端引擎档位,接不上比较可惜。

建议接受标准

  • ASR 引擎列表新增「ZenMux」provider(或实现一个可配置请求格式的通用自定义 ASR provider,把 ZenMux 作为预设之一),可配置 base_url(默认 https://zenmux.ai/api/v1)、API Key、模型 slug。
  • 录音停止后走 POST /audio/transcriptions(JSON + base64 input_audio)完成转写,language 跟随 OpenLess 的语言设置,响应 text 进入现有润色/插入链路。
  • 转写失败时按现有云端 ASR 的错误提示口径处理(含 4xx 错误信息透出)。

补充说明:本条由 Claude Code 协助调研与撰写,格式细节来自 ZenMux 官方文档,如与最新文档有出入以官方为准。

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions