6 октября 2026 г.
Falcon-Emirati-7B адаптировали к эмиратскому диалекту арабского языка
Разработчики Falcon представили языковую модель на 7 млрд параметров, обученную распознавать лексику, интонации и культурный контекст эмиратского диалекта.
Разработчики семейства Falcon представили Falcon-Emirati-7B, языковую модель на 7 млрд параметров для понимания и генерации текста на эмиратском диалекте арабского языка. Модель должна точнее учитывать разговорную лексику, тон, устойчивые выражения и культурные отсылки, которые часто теряются при обработке текста моделями, ориентированными на современный литературный арабский.
Основой стала арабская модель Falcon-H1
Falcon-Emirati-7B построена на 7-миллиардной версии Falcon-H1-Arabic. Базовое семейство использует гибридную архитектуру: механизмы Mamba и Transformer работают параллельно внутри каждого блока, после чего их результаты объединяются.
Разработчики выбрали версию на 7 млрд параметров как компромисс между качеством, стоимостью обучения и требованиями к инфраструктуре. Более крупная модель на 34 млрд параметров потребовала бы больше ресурсов, а версия на 3 млрд, по оценке команды, оставляла меньше возможностей для глубокой диалектной адаптации.
| Параметр | Подтвержденная характеристика |
|---|---|
| Размер | 7 млрд параметров |
| Базовая модель | Falcon-H1-Arabic |
| Специализация | Эмиратский диалект и культурный контекст |
| Контрольная выборка Alyah | 1 173 задания |
| Результат Falcon-Emirati-7B | 84,83% |
В обучение включили живую речь и культурные материалы
Команда собрала тексты с эмиратских сайтов и форумов, где диалект использовался естественно, а не получался переводом с литературного арабского. Корпус дополнили материалами о местных обычаях, наследии, нормах общения, пословицах и поэзии набати.
Для расширения тематического охвата разработчики также создали синтетические примеры. Их генерацию ограничивали словарями и правилами эмиратской грамматики. Соотношение естественных и синтетических данных подбирали экспериментально, чтобы снизить риск появления формально правильных, но неестественных фраз.
Качество оценивали носители диалекта
Ответы модели проверяли носители эмиратского диалекта. Они оценивали естественность речи, тон и соответствие культурному контексту. Количественную проверку проводили с помощью Alyah, набора из 1 173 заданий о повседневном общении, этикете, образных выражениях, наследии и поэзии.
Студентам и исследователям, работающим с арабскими диалектами, стоит рассматривать результат как заявленную разработчиками оценку. Перед использованием модели в курсовой или исследовании следует отдельно проверить методику Alyah, условия доступа, лицензию, модельную карточку и качество ответов на собственной выборке с участием носителя языка.
