23 сентября 2026 г.
NVIDIA представила Nemotron 3 Diarization для разметки речи восьми собеседников
Модель с открытыми весами определяет интервалы речи восьми участников, учитывает одновременные реплики и работает с потоковым аудио. Для полной расшифровки ее нужно объединять с системой распознавания речи.

NVIDIA представила Nemotron 3 Diarization, модель с открытыми весами для определения того, кто и в какой момент говорит в аудиозаписи. Система рассчитана на живые и записанные разговоры с участием до восьми человек и умеет отмечать одновременную речь нескольких собеседников.
Модель содержит 100 млн параметров. В тесте VoiceArena Diarization-Bench она получила показатель ошибки диаризации DER 14,72%. Разработчики позиционируют ее как основу для расшифровки встреч, интервью, подкастов и других записей, где важно связать реплики с конкретными участниками.
Модель сохраняет разметку между фрагментами аудио
Nemotron 3 Diarization присваивает голосам анонимные обозначения в порядке их появления. Первый обнаруженный голос получает первый канал, следующий голос второй. Такой подход помогает сохранять последовательную разметку при потоковой обработке небольших фрагментов.
| Параметр | Подтвержденное значение |
|---|---|
| Число параметров | 100 млн |
| Максимум каналов | 8 собеседников |
| Входной звук | 16 кГц, один канал |
| Минимальная рекомендуемая буферизация | 0,32 секунды |
| Формат результата | Вероятности активности и временные метки |
Предусмотрены рекомендуемые режимы буферизации 30,4, 1,04, 0,64 и 0,32 секунды. Сокращение буфера ускоряет получение результата, но уменьшает объем контекста, доступного модели. Сетевые задержки, вычисления и распознавание текста добавляют время к общей задержке приложения.
Имена участников модель не определяет
Система сообщает, когда говорил условный `speaker_2`, но не устанавливает личность человека. Для сопоставления каналов с именами разработчикам потребуется использовать сведения о встрече, профили пользователей или отдельную проверку голоса.
Nemotron 3 Diarization также не расшифровывает слова. Для подготовки протокола, интервью или исследовательской транскрипции ее результат необходимо объединить с ASR-системой. Ошибки двух компонентов следует оценивать раздельно: диаризация может перепутать говорящих или границы реплик, а распознавание речи может исказить текст.
Перед использованием нужна проверка на собственных записях
Разработчики предупреждают о возможном снижении качества на очень длинных материалах, при сильном шуме, эхе, удаленном микрофоне и заметном отличии аудио от обучающих данных. Обучение включало открытые и лицензированные записи, а также смоделированные смеси речи на 21 языке.
Студентам и исследователям, работающим с интервью или фокус-группами, стоит сначала проверить несколько типичных записей: сопоставить временные метки с голосами, отдельно измерить точность текста и посмотреть, как система обрабатывает перебивания.