Qwen-Audio-3.1-Realtime: голосовой агент стал реже перебивать
Команда Qwen представила Qwen-Audio-3.1-Realtime — апдейт голосового агента с архитектурой Think, Act, Speak and Coordinate. Модель лучше выполняет задачи и почти перестала реагировать на постороннюю речь.
- На адаптации τ-Voice успешность задач выросла с 78,4% у версии 3.0 до 82,0% у 3.1
- На бенчмарке Full-Duplex-Bench v1.5 реакция на фоновую речь снизилась с 73,0% до 13,0%
- Обучение Act построено на GRPO с самоэволюционирующими средами и мультигранулярными роллаутами

Команда Qwen опубликовала технический отчёт о Qwen-Audio-3.1-Realtime — обновлении голосового ассистента, который должен рассуждать по ходу разговора, вызывать инструменты и соблюдать правила диалога. Работа выложена на arXiv 25 сентября 2026 года, объём отчёта — 25 страниц.
Три блока вместо одной модели
Авторы описывают систему через четыре роли: Think, Act, Speak и Coordinate. Блок Think сочетает supervised fine-tuning Core-Cocktail с дистилляцией Multimodality and Multi-Teacher On-Policy Distillation (M²-OPD) — так языковые способности переносятся в модель, а поверх них развиваются собственно аудионавыки.
Блок Act отвечает за действия: модель учится пользоваться инструментами, читать обратную связь и доводить задачу до конца. Для этого применяют самоэволюционирующие исполняемые среды, мультигранулярные роллауты и Group Relative Policy Optimization (GRPO). Блок Speak and Coordinate решает, когда ассистенту говорить, когда действовать и в каком порядке.
Что показали замеры
Оценка шла по нескольким направлениям: аудиореasoning, мультиязычное понимание, работа с инструментами, поведение в диалоге, full-duplex взаимодействие и безопасность. На полудуплексной адаптации бенчмарка τ-Voice для распознавания речи Qwen-Audio-3.1-Realtime подняла общую успешность задач с 78,4% до 82,0% по сравнению с версией 3.0.
Заметнее всего разница в поведении при фоновом шуме. На speech-to-speech бенчмарке Full-Duplex-Bench v1.5 доля ответов на постороннюю речь упала с 73,0% до 13,0% — ассистент стал реже встревать в разговор, который его не касается.
Отдельно авторы упоминают прототип Voice Harness, построенный на Qwen-Audio-3.0-Realtime в качестве foreground-модели. Он расширяет голосовое взаимодействие до длительных задач за счёт координации foreground и background и памяти.
Для профиТехнические детали: архитектура, цифры, ссылки
Методы обучения: Core-Cocktail SFT + Multimodality and Multi-Teacher On-Policy Distillation (M²-OPD) в блоке Think; GRPO с самоэволюционирующими исполняемыми средами и мультигранулярными роллаутами в блоке Act.
Бенчмарки:
- τ-Voice (полудуплексная адаптация speech-to-text): успешность задач 78,4% → 82,0% относительно Qwen-Audio-3.0-Realtime.
- Full-Duplex-Bench v1.5 (speech-to-speech): доля ответов на фоновую речь 73,0% → 13,0%.
Дополнительно: прототип Voice Harness на базе Qwen-Audio-3.0-Realtime как foreground-модели, с координацией foreground–background и памятью для持久ных задач.
Отчёт: arXiv:2609.25176 (v2 от 24 сентября 2026), 25 страниц, DOI 10.48550/arXiv.2609.25176. Категории: eess.AS, cs.AI, cs.CL, cs.SD. Лицензия и цены API в источнике не указаны.
Вопросы и ответы
- Насколько Qwen-Audio-3.1-Realtime лучше предыдущей версии?
- На полудуплексной адаптации τ-Voice успешность задач выросла с 78,4% до 82,0% относительно Qwen-Audio-3.0-Realtime.
- Как модель ведёт себя при фоновом шуме?
- На Full-Duplex-Bench v1.5 доля ответов на фоновую речь снизилась с 73,0% до 13,0%.


