Соның бір дәлелі – қазақ тілін жасанды интеллектіге бейімдеу, сапалы цифрлық қор қалыптастыру, аудио мен мәтінді тану жүйелерін жетілдіру және әлемдік білім платформаларындағы қазақша контенттің үлесін арттыруға бағытталған жобалар. Халықаралық «Қазақ тілі» қоғамы мен OpenAI компаниясының бірлескен бастамасы бұл бағыттағы жұмысты жаңа деңгейге көтеріп отыр.
Соның нақты нәтижелері Астанада өткен арнайы жиында таныстырылып, қазақ тілін цифрлық кеңістікте дамытуға бағытталған жобаның бүгінге дейінгі жетістіктері сараланды. Astana Hub-та ұйымдастырылған жиынға халықаралық «Қазақ тілі» қоғамының президенті Рауан Кенжеханұлы, «Қазақтелеком» АҚ басқарма төрағасы Бағдат Мусин, қоғам құрылтайшылары, орталық кеңес мүшелері, депутаттар, IT-сарапшылар мен тіл мамандары қатысты. Бұл бастама Халықаралық «Қазақ тілі» қоғамы мен OpenAI арасында 2025 жылғы 7 қарашада Вашингтонда жасалған келісім аясында жүзеге асып келеді. Жобаның негізгі мақса-ты – сапалы цифрлық контент пен сенімді деректер қорын қалыптастыру арқылы үлкен тіл модельдерінің қазақ тіліндегі жұмыс сапасын арттыру.
Жиында сөз алған «Қазақ тілі» қоғамының президенті Рауан Кенжеханұлы қазақ тілінің жасанды интеллект дәуірінде толыққанды қолданылуы үшін тілдің бай қорын цифрлық кеңістікке енгізу жеткіліксіз екенін атап өтті. Оның айтуынша, жасанды интеллект қазақ тілін тек сөзбе-сөз түсініп қана қоймай, оны табиғи қолдануы, ұлттық мәдени контексті ескеруі керек.
– Біз қазақ тілінің қолданысы, оны зерттеу және оқыту әдістемесін жетілдіру мәселесін ғылыми ортада да, тіл жанашырлары арасында да жиі талқылаймыз. Мемлекеттік қызмет саласында да бұл тақырып аз айтылып жүрген жоқ. Енді қазақ тілінің бизнес пен технологиядағы қолданысын кеңейтуге ерекше мән беруіміз керек. Кез келген қолға алынған іс жолда қалып қоймай, тұрақты дамып, нәтижелері өсіп келеді. Осы бағытта OpenAI компаниясымен тығыз ынтымақтастық орнаттық. Жұмыс барысында оларға қазақ тіліндегі үлкен көлемдегі деректер қажет болды. Оның ішінде мәтіндер, аудиофайлдар және басқа да материалдар бар. Біз осы жұмысты өз мойнымызға алдық. Техникалық тілмен айтқанда, 10 млрд-тан астам токен жиналды. Олардың қатарында қазақ тіліндегі сан алуан мәтіндер, аудиофайлдар мен суреттер бар. Енді осы деректердің негізінде ChatGPT-ді қайта оқытып жатырмыз, – деді Рауан Кенжеханұлы.
ЖИ қазақ мәдениетін қаншалықты біледі?
Халықаралық «Қазақ тілі» қоғамы мен OpenAI компаниясының бірлескен жобасының жетекшісі Анар Құрманжанқызы қазақ тілінің цифрлық қоры едәуір кеңейгенін жеткізді. Жоба аясында мәтіндік корпус, аудиодеректер қоры, транскрипция модельдері, Document AI және NLP құралдары әзірленіп жатыр. Сонымен қатар жасанды интеллектінің қазақ халқының тарихы мен мәдениетін қаншалықты білетінін тексеруге арналған арнайы бағалау жүйесі де жасалған.
– Қазақ тілінің мәтіндік корпусы 14 миллиард токенге жетті. Ондағы материалдар тақырып, жанр және жас ерекшеліктері бойынша жіктелген. Корпусқа қазақ тілінің тарихи даму кезеңдерін қамтитын мазмұнмен бірге шетелдегі қазақ диаспорасының тілдік мұрасы да енгізілді. Қор білім, ғылым, технология, экономика, құқық, медицина, тарих, этнография, медиа және балалар контентін түгел қамтиды. Қазақ тіліндегі аудиодеректер қоры 12 мың сағатқа жетті. Барлық жазба сыртқы шу, музыка және басқа да артық дыбыстардан тазартылған. Сонымен қатар қазақ тіліне бейімделген транскрипция модельдері қолданысқа енгізіліп, мәтінге айналдыру дәлдігі 85%-дан 98%-ға дейін жетті, – деді Анар Құрманжанқызы.
Ол қазақ тіліне арналған цифрлық құралдардың мүмкіндігіне де тоқталып, бұл бағыттағы жұмыс тек мәтін мен дыбысты жинақтаумен шектелмейтінін айтты. Спикердің айтуынша, қазақ тіліндегі мәтінді жоғары дәлдікпен танитын OCR жүйесі, газет, кітап және PDF құжаттарының құрылымын ажырату, көпбағанды беттерді дұрыс ретпен оқу, сондай-ақ деректерді тазарту тетіктері әзірленген. Сонымен қатар жасанды интеллектінің қазақ тілінде дұрыс сөйлеуі ғана жеткіліксіз екенін, оның қазақ халқының тарихын, дәстүрін, тұрмыс-тіршілігі мен мәдени ерекшеліктерін де түсінуі маңызды екенін жеткізді. Осыны тексеру үшін 500 сұрақтан тұратын арнайы тапсырмалар жинағы әзірленген. Жоба аясында осының бәріне үлкен тілдік модельдердің білім деңгейін бағалауға мүмкіндік беретін AI Evaluation Benchmark Suite атты жеке жүйе де әзірленді.
– Сұрақтар қазақ халқының тарихы, салт-дәстүрі, мәдениеті мен этнографиясына қатысты. Осы сынақтан GPT-5.6 Terra моделі де өтті. Оның дұрыс жауап беру көрсеткіші 35,92%-ды құрады. Жасанды интеллектіні тексеруге арналған жүйеде бұдан бөлек қазақ тіліндегі мәтінді түсіну, грамматиканы дұрыс қолдану, табиғи сөйлеу, мақал-мәтелдер мен тұрақты тіркестерді пайдалану, аударма жасау және қауіпсіз жауап беру қабілеті де бағаланады. Бағалау жүйесі ағылшын тілінен аударылмай, қазақ тілінің тілдік және мәдени ерекшеліктерін ескере отырып, тікелей қазақ тілінде құрастырылды, – деді жоба жетекшісі.
Алдағы уақытта 500 сұрақтан тұратын бұл сынақ жүйесін ғалымдар мен зерттеушілерге қолжетімді ету жоспарланып отыр.
Coursera-да қазақ тілінің аясы ұлғайды
Жиында цифрлық білім беру кеңістігіндегі қазақ тілінің үлесі де сөз болды. Bilim Upskill компаниясының атқарушы директоры Әсел Мұхамеджанова Coursera платформасында қазақ тілінде қолжетімді курстар саны 8 мыңнан асқанын айтты. Бұл платформадағы барлық курстың шамамен 40 пайызын құрайды. «Coursera – қазақ тілінде» жобасы 2023 жылы «Қазақстан халқына» қоғамдық қорының қолдауымен басталған. Алғашында оған өңірлердегі 25 университет қосылса, бүгінде жобаға 100 университет қатысып отыр.
– Біздің басты мақсатымыз – студенттерге әлемнің үздік университеттері мен компаниялары әзірлеген сапалы білімді қазақ тілінде алуға мүмкіндік жасау. Біз тек Алматы мен Астанамен шектелмей, барлық облысты қамтыдық. Себебі сапалы білім адамның тұратын жеріне байланысты болмауы керек. Жобаның алғашқы жылында 102 курс қазақ тіліне аударылып, 4,5 мыңға жуық курсқа қазақша субтитр қосылды. 2024 жылы бастамаға Ғылым және жоғары білім министрлігі қолдау көрсетіп, жобаға қатысатын жоғары оқу орындарының саны 93-ке жетті. Сол жылы тағы 20 курс қазақ тіліне аударылды. 2025 жылдан бастап Coursera курстарына қазақ тіліндегі дубляж енгізілді. Сондай-ақ қазақ тілі платформадағы контент аударылатын 40 тілдің қатарына қосылды. Бұл нені білдіреді? Енді қазақ тіліндегі контентті тек біздің команда ғана аудармайды. Жаңа курстар Coursera технологиялары арқылы да қазақ тілінде қолжетімді болады, – деді Әсел Мұхамеджанова.
Компания өкілінің айтуынша, жобаның мақсаты курстарды қазақшаға аударумен ғана шектелмейді. Coursera курстары қазақстандық университеттердің оқу бағдарламаларына енгізіліп, студенттердің нәтижесі академиялық кредит ретінде есептеледі. Үш жылда 267 мыңнан астам адам кемінде бір курсты аяқтап, 600 мыңға жуық сертификат алған. Оның 140 мыңнан астамы қазақ тіліндегі курстар бойынша берілген. Сонымен қатар Coursera курстары бойынша 211 мыңнан астам академиялық кредит есептелген. Қазір 18 отандық университеттің 40 авторлық курсы платформада жарияланған. Оның жартысы қазақ тілінде. Бұл курстарға 15 мыңнан астам студент тіркеліп, 11 мыңнан астам сертификат берілген.
Технология тілге бейімделуі керек
«Қазақтелеком» АҚ басқарма төрағасы Бағдат Мусин қазақ тілінде жасанды интеллектіні пайдалану тиімділігі әлі де шешуді қажет ететін мәселе екенін айтты. Оның айтуынша, қазақ тілінде қойылған сұраққа жауап алу ағылшын және орыс тілдерімен салыстырғанда қымбатқа түседі. Бұл айырмашылықты азайту үшін инфрақұрылымдық және технологиялық шешімдер қажет. Сондай-ақ қазір қазақ тілінде жасанды интеллектіні пайдалану тиімділігі жағынан мәселе бар. Ол мәселе мынау: қазақ тілінде қойылған сұраққа жауап алу ағылшын тілімен салыстырғанда үш есе, ал орыс тілімен салыстырғанда екі есе қымбатқа түседі. Сондықтан қазір осы айырмашылықты азайтып, қазақ тіліндегі жасанды интеллектінің тиімділігін арттыру бағытында бір топ азамат жұмыс істеп жатыр. Бұдан бөлек, ол «Қазақтелеком» компаниясының жасанды интеллектідегі қазақ тілінің сапасын жақсартуға өз үлесін қосуға дайын екенін жеткізді. Осы ретте Екібастұзда салынып жатқан үлкен деректер орталығының мүмкіндіктерін қазақ тілін дамыту үшін пайдалануға әзір екенін де жеткізді. Ол қазақстандықтардың жаңа технологияларды тез игеретінін, бұл қазақ тіліндегі жасанды интеллект құралдарының сапасына да ықпал ететінін назардан тыс қалдырмады.
– Қазақ халқының бір жақсы жері – біз технологияны игеру жағынан өте икемдіміз. Кез келген технологияны тез пайдаланып кетеміз. WhatsApp, Telegram, қазір, міне, ChatGPT келіп жатыр. Оны құрал ретінде көп қолданғандықтан, сапасы да жақсара түседі. Күнделікті пайдалануға ChatGPT мүмкіндігі жеткілікті. Алайда технологиялық тақырыптарды, қазақ мәдениетіне қатысты мазмұнды немесе Абайдың қара сөздерін талдау кезінде мағына басқа жаққа ауытқып кетуі мүмкін. Сондықтан қазақ тілін терең меңгерген мамандар мен технология саласы өкілдерінің бірлесіп жұмыс істеуі маңызды. Бізде «AI-әріптес» деген жоба бар. Бұл әр департаментте, құжат айналымында чат-бот ретінде жұмысты меңгеріп, көмектесетін құрал болмақ. Оны біртіндеп «Самұрық-Қазынаның» барлық компаниясына енгізу жоспарланып отыр. Сондай-ақ министрліктерге де енгізуге болады, бірақ бұл бағытта ЖИ министрлігі де жұмыс істеп жатыр деп ойлаймын. Ал біз әкімдіктерге де, министрліктерге де ұсынып көреміз, – деді Бағдат Мусин.
Жиында айтылған деректер қазақ тілінің жасанды интеллект кеңістігіндегі орны біртіндеп нығайып келе жатқанын көрсетті. Мамандардың пікірінше, тілдің цифрлық қорын кеңейту, оны технологияға бейімдеу және ұлттық мәдени контексті сақтай отырып дамыту – алдағы жылдардағы маңызды міндеттердің бірі. Өйткені жасанды интеллект дәуірінде тілдің өміршеңдігі оның күнделікті қолданысымен де, цифрлық жүйелердегі сапалы көрінісімен де өлшенбек.
Сымбат БАУЫРЖАНҚЫЗЫ









