Nvidia выпустила бесплатную модель Nemotron 3 Diarization на 100 млн параметров

Nvidia представила Nemotron 3 Diarization — бесплатную ИИ-модель, которая определяет, кто говорит в каждый момент разговора. Она различает до восьми голосов, работает с записями и живым аудио и лидирует в бенчмарке VoiceArena.

Главное
  • Модель Nemotron 3 Diarization содержит около 100 млн параметров, её веса находятся в свободном доступе.
  • Она различает до восьми говорящих и определяет моменты, когда несколько человек говорят одновременно.
  • В бенчмарке VoiceArena Diarization Benchmark v1 модель показала DER 14,7% и обошла предшественника Streaming Sortformer на 41%.
Схематичное изображение диаризации речи: аудиоволна с цветными метками разных говорящих
Фото: The Decoder

Nvidia выпустила Nemotron 3 Diarization — модель для диаризации речи, которая определяет, кто говорит в каждый момент разговора. Веса модели находятся в свободном доступе, а число параметров составляет около 100 млн. Модель различает до восьми говорящих и умеет определять наложение речи, когда несколько человек говорят одновременно.

Точность падает при большем числе участников, сильном фоновом шуме и реверберации. В паре с системой распознавания речи, например Parakeet, модель позволяет получать транскрипты с метками говорящих, но только анонимными — вроде «speaker_2». Она работает как с записями, так и с живым аудио.

Результаты в бенчмарке

В VoiceArena Diarization Benchmark v1 свободно доступная Nemotron 3 лидирует с показателем DER 14,7% и обходит предшественника Streaming Sortformer на 41%. На Diarization-Bench от VoiceArena модель сейчас занимает первое место с ошибкой 14,72% — у следующей системы 19,3%. Бенчмарк строгий: перекрывающаяся речь учитывается, и даже небольшие смещения на переходах между говорящими считаются ошибками. По сравнению с Streaming Sortformer новая модель снижает ошибку в среднем на 41% в восьми тестовых сценариях при буфере 1,04 секунды.

Аудиобуфер можно настроить на четырёх уровнях — от 30,4 до 0,32 секунды. Более короткие буферы, как правило, снижают точность.

Для профиТехнические детали: архитектура, цифры, ссылки
  • Модель: Nemotron 3 Diarization, ~100 млн параметров, веса в свободном доступе.
  • Возможности: до 8 говорящих, детекция наложения речи, работа с записями и live-аудио.
  • Бенчмарк: VoiceArena Diarization Benchmark v1 — DER 14,7%; Diarization-Bench — 14,72% (первое место, у следующей системы 19,3%).
  • Улучшение: на 41% ниже ошибка, чем у Streaming Sortformer, в среднем по восьми сценариям при буфере 1,04 с.
  • Буфер: 4 уровня от 30,4 до 0,32 с; короче буфер — ниже точность.
  • Совместимость: работает в паре с ASR-системой Parakeet для транскриптов с анонимными метками говорящих.

Вопросы и ответы

Сколько параметров у Nemotron 3 Diarization?
Около 100 млн параметров, веса модели находятся в свободном доступе.
Сколько говорящих различает модель?
До восьми, а также определяет моменты, когда несколько человек говорят одновременно.
Какие ограничения у модели?
Точность снижается при большем числе участников, сильном фоновом шуме и реверберации, а также при коротком аудиобуфере.