Новости

cover

19 июня 2026 г.

ISSAI призывает казахстанские компании и организации открыто делиться датасетами и моделями для казахского языка

Английский язык остаётся основным языком цифрового пространства и занимает почти половину всего общедоступного контента в Интернете, тогда как многие другие языки представлены в цифровой среде значительно слабее. Несмотря на то, что на казахском языке говорит население страны численностью более 21 миллиона человек, его доля в мировом веб-контенте составляет всего 0,035%, согласно данным Common Crawl 2026.

Небольшая численность населения не обязательно является препятствием для формирования сильного цифрового присутствия. Ярким примером является Эстония: при населении всего около 1,3 миллиона человек эстонский язык составляет 0,168% общедоступного веб-контента. Если учитывать численность населения, объём общедоступных цифровых данных на душу населения в Эстонии примерно в 76 раз выше, чем в Казахстане.

Доступность общедоступных веб-данных имеет особое значение, поскольку именно с данных начинается развитие современных технологий искусственного интеллекта. Большие языковые модели (LLM) и другие генеративные AI-системы обучаются на данных, собираемых из открытого Интернета. Поэтому языки, имеющие более широкое цифровое представительство, находятся в более выгодном положении для участия в стремительно развивающейся экосистеме искусственного интеллекта и получения преимуществ от её развития.

В Институте умных систем и искусственного интеллекта (ISSAI) Назарбаев Университета мы работаем над сокращением этого разрыва, расширяя доступность качественных цифровых ресурсов на казахском языке — моделей и наборов данных. Эти усилия получили признание не только в Казахстане, но и со стороны международного научного сообщества. На конференции Association for Computational Linguistics (ACL) Казахстан был отмечен как «The Rising Star» за расширение своего цифрового присутствия и развитие разнообразных мультимодальных наборов данных, при этом ISSAI был признан ключевым участником этого прогресса.

Публичные репозитории ISSAI на Hugging Face и GitHub, которые в совокупности представляют крупнейшую коллекцию открытых AI-моделей и наборов данных в Центральной Азии, включают 18 моделей и 50 датасетов с открытым исходным кодом.

В их числе — KazLLM, первая большая языковая модель для казахского языка; бенчмарки для оценки LLM и Vision-Language моделей на казахском языке, включая MMBench-Kazakh, MMLU_Redux_2.0_Kazakh и Beynele-Bench; технологии распознавания речи и машинного перевода, такие как Tilmash, KazakhTTS и KazakhTTS2; а также мультимодальные модели Qolda-AVL и Beynele и многие другие разработки.

Эти ресурсы делают казахский язык всё более доступным для мирового цифрового сообщества и способствуют укреплению его присутствия в цифровую эпоху.

Модели и датасеты ISSAI уже были скачаны более 500 000 раз организациями и исследовательскими учреждениями из 38 стран и успешно интегрируются в продукты и сервисы как международных технологических компаний, включая Meta, OpenAI, Qwen и DeepSeek, так и ведущих казахстанских компаний, среди которых Kaspi, Freedom, Beeline, Astana Hub и Halyk.

Ресурсы ISSAI также используются ведущими казахстанскими университетами, включая Назарбаев Университет, Казахский национальный университет имени аль-Фараби, Astana IT University и Satbayev University, а также зарубежными университетами, в том числе National University of Singapore, Queen Mary University of London и MBZUAI.

ISSAI продолжит вносить вклад в цифровизацию казахского языка, разрабатывая AI-модели и наборы данных и открыто предоставляя их исследовательскому и технологическому сообществу в соответствии с принципами «AI for Good» и «AI for Kazakhstan».

В конечном счёте будущее казахского языка в цифровую эпоху зависит от коллективных усилий. В связи с этим ISSAI призывает технологические компании, научно-исследовательские организации и других заинтересованных участников в Казахстане открыто делиться наборами данных, моделями и другими цифровыми ресурсами на казахском языке.

Такие инициативы в области открытого исходного кода станут фундаментом для будущих исследований, разработки новых AI-моделей, а также инновационных продуктов и сервисов, которые будут приносить пользу жителям Казахстана и способствовать укреплению цифрового будущего страны.

« из 3 »