Нейросеть, говорящая по-армянски: Интервью о пути к собственной языковой модели в эпоху данных

18:33    18 сентября, 2025

В последние месяцы языковые модели вроде ChatGPT стали неотъемлемой частью повседневной жизни многих людей. Но для малых языков, таких как армянский, доступ к таким технологиям ограничен. На недавнем DataFest Yerevan Спартак Бугдарян, старший NLP-инженер в компании Metric, поделился опытом создания открытой армянской языковой модели. Это не просто технический проект — это шаг к независимости от глобальных гигантов, с акцентом на безопасность данных и локальные нужды.

«Мы работаем над большой языковой моделью, подобной известному ChatGPT. Хотим иметь полностью бесплатную и открытую версию нейросети, которая хорошо говорит по-армянски», — рассказал Бугдарян в беседе с NEWS.am Tech.

Зачем Армении своя языковая модель?

Армянский язык, с его уникальной грамматикой и относительно небольшим объемом цифровых текстов, относится к низкоресурсным языкам. По данным исследований, таких как от Hugging Face, для английского доступны триллионы токенов данных, в то время как для армянского — на порядки меньше. Это делает стандартные модели, обученные в основном на английском, менее эффективными для армянского.

«По сравнению с английским, где данных несоизмеримо больше, армянский требует специального подхода», — отмечает Бугдарян.

Ключевой мотив разработки нейросети, понимающей армянский, — безопасность. Многие организации, особенно в банковском секторе, не могут использовать облачные сервисы вроде ChatGPT из-за рисков утечки данных.

«Часто данные не могут покинуть страну, особенно личные и финансовые. Для организаций вроде банков это критично», — подчеркивает инженер.

Собственная модель позволяет запускать ИИ локально, на серверах компании или организации, без передачи информации за границу. Это может решить целый ряд проблем. Кроме того, открытый код делает технологию доступной для всех — от разработчиков до малого бизнеса.

На практике такая модель может применяться в чат-ботах, переводчиках, анализе текстов и даже помощи программистам.

«Банки смогут использовать ее вместо ChatGPT для внутренних задач, без риска утечек», — добавляет Бугдарян.

Это особенно актуально для Армении, где IT-сектор растет, но зависимость от иностранных сервисов создает определенные уязвимости.

Процесс создания: от сбора данных к обучению

Создание LLM — это многоэтапный процесс, и команда Metric не начинает с нуля.

«Создать языковую модель полностью с нуля — это миллионы долларов. Мы берем готовые модели от других исследователей и дообучаем их на армянском», — рассказывает Бугдарян.

Базой для проекта служат открытые модели, такие как LLaMA или Mistral, которые уже прошли базовое обучение.

Первый этап — сбор и очистка данных. Команда ищет все доступные армянские тексты: из Википедии, книг, новостей.

«Мы собираем, чистим и приводим в форму, чтобы модель могла их использовать», — объясняет он.

Объем критичен: для качественного обучения нужны миллиарды токенов, но для армянского их приходится "выжимать" из ограниченных источников.

Далее — дообучение. Один метод — просто "кормить" модель текстами, чтобы она училась языку. Другой — fine-tuning с задачами: «Мы даем инструкции с правильными и неправильными ответами, например, 'напиши пять предложений, начинающихся на А'». Это помогает модели не только понимать, но и генерировать связный текст.

Пока у команды есть прототипы: не полноценные чат-боты, а embeddings-модели.

«Это часть, которая сравнивает тексты на сходство. Она уже открыта и бесплатна», — говорит Бугдарян.

Этические вызовы: борьба с предвзятостями в ИИ

Одна из самых сложных частей проекта — оценка модели.

«Нужно понять, хороша ли модель. Иногда она кажется умной, но скрывает предвзятости», — предупреждает инженер.

Проблема предвзятости в ИИ — действительно глобальная проблема: модели перенимают предубеждения из данных, созданных людьми. «Данные всегда имеют уклон. Люди имеют предпочтения, и они передаются в данные».

Примеры предвзятостей: модель может "предпочитать" белых людей черным, или руководствоваться в ответах гендерными стереотипами. Mожет быть I культурный bias.

Чтобы бороться с предвзятостью нейросетей, команда использует тесты: «Представляем сценарии с разными людьми — чернокожим и белым, получаем какой-то ответ. Потом меняем героев местами, чтобы увидеть, меняется ли ответ нейросети». Если да, это сигнал о том, что модель, возможно, нуждается в определенных корректировках.

Методы смягчения проблемы: анализ данных на ранних этапах, удаление вредных паттернов, использование техник вроде RLHF (Reinforcement Learning from Human Feedback), как в OpenAI. «Чем раньше заметить уклон, тем лучше. Мы осматриваем данные и корректируем. Мы не хотим модель, которая кажется умной, но на деле расистская», — делится Бугдарян.

Исследования, такие как от AI Index Стэнфорда, показывают, что без этого модели усиливают социальные неравенства.



© NEWS.am Medicine