Qwen-Audio-3.1-Realtime: голосовой агент стал реже перебивать

Команда Qwen представила Qwen-Audio-3.1-Realtime — апдейт голосового агента с архитектурой Think, Act, Speak and Coordinate. Модель лучше выполняет задачи и почти перестала реагировать на постороннюю речь.

Главное
  • На адаптации τ-Voice успешность задач выросла с 78,4% у версии 3.0 до 82,0% у 3.1
  • На бенчмарке Full-Duplex-Bench v1.5 реакция на фоновую речь снизилась с 73,0% до 13,0%
  • Обучение Act построено на GRPO с самоэволюционирующими средами и мультигранулярными роллаутами
Иллюстрация к новости о голосовом ИИ-агенте Qwen-Audio-3.1-Realtime
Фото: arXiv cs.CL

Команда Qwen опубликовала технический отчёт о Qwen-Audio-3.1-Realtime — обновлении голосового ассистента, который должен рассуждать по ходу разговора, вызывать инструменты и соблюдать правила диалога. Работа выложена на arXiv 25 сентября 2026 года, объём отчёта — 25 страниц.

Три блока вместо одной модели

Авторы описывают систему через четыре роли: Think, Act, Speak и Coordinate. Блок Think сочетает supervised fine-tuning Core-Cocktail с дистилляцией Multimodality and Multi-Teacher On-Policy Distillation (M²-OPD) — так языковые способности переносятся в модель, а поверх них развиваются собственно аудионавыки.

Блок Act отвечает за действия: модель учится пользоваться инструментами, читать обратную связь и доводить задачу до конца. Для этого применяют самоэволюционирующие исполняемые среды, мультигранулярные роллауты и Group Relative Policy Optimization (GRPO). Блок Speak and Coordinate решает, когда ассистенту говорить, когда действовать и в каком порядке.

Что показали замеры

Оценка шла по нескольким направлениям: аудиореasoning, мультиязычное понимание, работа с инструментами, поведение в диалоге, full-duplex взаимодействие и безопасность. На полудуплексной адаптации бенчмарка τ-Voice для распознавания речи Qwen-Audio-3.1-Realtime подняла общую успешность задач с 78,4% до 82,0% по сравнению с версией 3.0.

Заметнее всего разница в поведении при фоновом шуме. На speech-to-speech бенчмарке Full-Duplex-Bench v1.5 доля ответов на постороннюю речь упала с 73,0% до 13,0% — ассистент стал реже встревать в разговор, который его не касается.

Отдельно авторы упоминают прототип Voice Harness, построенный на Qwen-Audio-3.0-Realtime в качестве foreground-модели. Он расширяет голосовое взаимодействие до длительных задач за счёт координации foreground и background и памяти.

Для профиТехнические детали: архитектура, цифры, ссылки

Методы обучения: Core-Cocktail SFT + Multimodality and Multi-Teacher On-Policy Distillation (M²-OPD) в блоке Think; GRPO с самоэволюционирующими исполняемыми средами и мультигранулярными роллаутами в блоке Act.

Бенчмарки:

  • τ-Voice (полудуплексная адаптация speech-to-text): успешность задач 78,4% → 82,0% относительно Qwen-Audio-3.0-Realtime.
  • Full-Duplex-Bench v1.5 (speech-to-speech): доля ответов на фоновую речь 73,0% → 13,0%.

Дополнительно: прототип Voice Harness на базе Qwen-Audio-3.0-Realtime как foreground-модели, с координацией foreground–background и памятью для持久ных задач.

Отчёт: arXiv:2609.25176 (v2 от 24 сентября 2026), 25 страниц, DOI 10.48550/arXiv.2609.25176. Категории: eess.AS, cs.AI, cs.CL, cs.SD. Лицензия и цены API в источнике не указаны.

Вопросы и ответы

Насколько Qwen-Audio-3.1-Realtime лучше предыдущей версии?
На полудуплексной адаптации τ-Voice успешность задач выросла с 78,4% до 82,0% относительно Qwen-Audio-3.0-Realtime.
Как модель ведёт себя при фоновом шуме?
На Full-Duplex-Bench v1.5 доля ответов на фоновую речь снизилась с 73,0% до 13,0%.