← 模型库

Qwen/Qwen/Qwen3-TTS

持续维护
发布日期 未标注·最后更新 08-09·数据来源 社区补充·待核实
这是你发布的模型吗?认领后可标注官方身份并长期维护主页信息。
入选场景榜🎧 语音 27.0
任务类型多模态
参数规模暂无可靠数据
上下文长度暂无可靠数据
开源协议暂无可靠数据
商用情况暂无可靠数据
推荐显存暂无可靠数据
主要语言暂无可靠数据
本地部署未标注

模型介绍

中文速览

发布方 Qwen

资料来源:DeepInfra 模型库,以下正文为官方原始说明。

本条目的官方说明为英文,以下内容保留原文,关键章节标题已中文标注。

Qwen/Qwen3-TTS

Qwen3-TTS is an advanced text-to-speech model by Alibaba’s Qwen team, delivering stable, expressive, and low-latency speech generation across 10 languages. Key capabilities: – 9 preset voices — Vivian, Serena, Uncle_Fu, Dylan, Eric, Ryan, Aiden, Ono_Anna, Sohee — covering diverse genders, ages, and accents – Voice cloning — clone any voice from a short (~3s) audio sample via the voice_id parameter – Instruction control — adjust tone, emotion, and speaking style with natural language (e.g. “speak slowly and calmly”, “excited tone”) – 10 languages — English, Chinese, Japanese, Korean, German, French, Russian, Spanish, Italian, Portuguese – Streaming support — real-time PCM streaming with ~97ms first-byte latency – Multiple output formats — WAV, MP3, FLAC, PCM Built on a 1.7B parameter architecture using discrete multi-codebook language modeling for end-to-end speech synthesis without cascading errors. Uses a custom 12Hz acoustic tokenizer that preserves paralinguistic information and environmental audio details.

  • 上下文长度:未知
  • 最大输出:未知
  • 标签:tts
  • 提供方:Qwen
  • 来源:DeepInfra

适合场景

暂无可靠数据。

已知限制

  • 本站未登记确切发布日期,版本时间线可能不完整。
  • 本站未登记上下文长度,长文本能力请以官方文档为准。
  • 本页评测与硬件数据为区间估算,未做统一环境实测,不能替代官方评测报告。

评测

暂无可靠数据。本站只收录标注了「评测来源、模型版本、是否官方数据、测试日期」的成绩, 不混合不同设置下的分数,也不把单一 Benchmark 解释为整体能力。