
カテゴリ別に AI モデル API を探す
音声・スピーチモデル API
文字起こし、音声、リアルタイム体験向けの音声認識、音声合成、オーディオモデルです。
10 件の利用可能なモデル
モデル API の料金と機能を比較
モデルページで最新料金、エンドポイント、コンテキスト上限、関連 API を確認できます。
Xiaomi
mimo-v2.5-tts-voicedesign
无需参考音频,一句话描述即可生成全新音色。多维度语义理解,覆盖口音、年龄、气质与录音质感。
コンテキスト —
トークンベース
サプライヤー 1
無料
Xiaomi
mimo-v2.5-asr
中英双语 + 多方言语音识别,无需语言标签,自动识别语码混用中的各语言内容。支持歌词转写,适应强噪声等复杂声学场景。
コンテキスト —
リクエストごと
サプライヤー 1
リクエスト$0.01/リクエスト
Alibaba
qwen3-omni-flash-realtime
千问实时音视频对话模型,可理解文本、图像和音视频输入,并流式输出文本与语音。
コンテキスト —
トークンベース
サプライヤー 2
入力$3.584/1M出力$7.168/1M
