Nvidia выпустила бесплатную модель Nemotron 3 Diarization на 100 млн параметров
Nvidia представила Nemotron 3 Diarization — бесплатную ИИ-модель, которая определяет, кто говорит в каждый момент разговора. Она различает до восьми голосов, работает с записями и живым аудио и лидирует в бенчмарке VoiceArena.
- Модель Nemotron 3 Diarization содержит около 100 млн параметров, её веса находятся в свободном доступе.
- Она различает до восьми говорящих и определяет моменты, когда несколько человек говорят одновременно.
- В бенчмарке VoiceArena Diarization Benchmark v1 модель показала DER 14,7% и обошла предшественника Streaming Sortformer на 41%.

Nvidia выпустила Nemotron 3 Diarization — модель для диаризации речи, которая определяет, кто говорит в каждый момент разговора. Веса модели находятся в свободном доступе, а число параметров составляет около 100 млн. Модель различает до восьми говорящих и умеет определять наложение речи, когда несколько человек говорят одновременно.
Точность падает при большем числе участников, сильном фоновом шуме и реверберации. В паре с системой распознавания речи, например Parakeet, модель позволяет получать транскрипты с метками говорящих, но только анонимными — вроде «speaker_2». Она работает как с записями, так и с живым аудио.
Результаты в бенчмарке
В VoiceArena Diarization Benchmark v1 свободно доступная Nemotron 3 лидирует с показателем DER 14,7% и обходит предшественника Streaming Sortformer на 41%. На Diarization-Bench от VoiceArena модель сейчас занимает первое место с ошибкой 14,72% — у следующей системы 19,3%. Бенчмарк строгий: перекрывающаяся речь учитывается, и даже небольшие смещения на переходах между говорящими считаются ошибками. По сравнению с Streaming Sortformer новая модель снижает ошибку в среднем на 41% в восьми тестовых сценариях при буфере 1,04 секунды.
Аудиобуфер можно настроить на четырёх уровнях — от 30,4 до 0,32 секунды. Более короткие буферы, как правило, снижают точность.
Для профиТехнические детали: архитектура, цифры, ссылки
- Модель: Nemotron 3 Diarization, ~100 млн параметров, веса в свободном доступе.
- Возможности: до 8 говорящих, детекция наложения речи, работа с записями и live-аудио.
- Бенчмарк: VoiceArena Diarization Benchmark v1 — DER 14,7%; Diarization-Bench — 14,72% (первое место, у следующей системы 19,3%).
- Улучшение: на 41% ниже ошибка, чем у Streaming Sortformer, в среднем по восьми сценариям при буфере 1,04 с.
- Буфер: 4 уровня от 30,4 до 0,32 с; короче буфер — ниже точность.
- Совместимость: работает в паре с ASR-системой Parakeet для транскриптов с анонимными метками говорящих.
Вопросы и ответы
- Сколько параметров у Nemotron 3 Diarization?
- Около 100 млн параметров, веса модели находятся в свободном доступе.
- Сколько говорящих различает модель?
- До восьми, а также определяет моменты, когда несколько человек говорят одновременно.
- Какие ограничения у модели?
- Точность снижается при большем числе участников, сильном фоновом шуме и реверберации, а также при коротком аудиобуфере.


