Qwen-Audio-3.0-TTS: что в релизе Alibaba уже работает, а что пока обещание

Wait 5 sec.

Команда Qwen выкатила Qwen-Audio-3.0-TTS - облачную модель Alibaba для синтеза речи, сразу в двух версиях: Flash под низкую задержку и Plus под качество тембра. В анонсе много громких чисел: 16 языков с русским, первое место в Artificial Analysis, клонирование по шумной записи, три минуты аудио за один проход. Ниже - разбор релиза так, как его стоит читать перед внедрением: где заявленная возможность уже подтверждена документацией и API, а где это пока маркетинговая формулировка, за которой не стоит готовой инфраструктуры. Читать далее