Google Research-ի հետազոտողները մշակել են արհեստական բանականության համակարգերի համար հիշողության սեղմման նոր ալգորիթմ՝ TurboQuant: Տեխնոլոգիան թույլ է տալիս զգալիորեն նվազեցնել օպերատիվ հիշողության ծավալը, որն օգտագործում են նեյրոցանցերն աշխատանքի ժամանակ՝ առանց ճշգրտության և արտադրողականության կորստի:
Այս մասին հայտնում է TechCrunch պարբերականը՝ հղում անելով Google Research-ի պաշտոնական բլոգին: Ալգորիթմն ուղղված է ժամանակակից մեծ լեզվական մոդելների գլխավոր խնդիրներից մեկի լուծմանը՝ աշխատանքային հիշողության բարձր սպառմանը, մասնավորապես այսպես կոչված KV-քեշի (key-value cache), որը պահպանում է միջանկյալ հաշվարկները, որպեսզի մոդելը պատասխանը գեներացնելիս դրանք նորից չհաշվարկի:
TurboQuant-ը հիմնված է առաջադեմ վեկտորային քվանտացման վրա՝ տվյալների սեղմման դասական մեթոդ: Այն օպտիմալացնում է քեշում բանալիների և արժեքների պահպանումը՝ վերացնելով տիպիկ հավելյալ ծախսերը (overhead), որոնք առաջանում են սովորական քվանտացման ժամանակ:
Gemma և Mistral բաց մոդելների վրա կատարված թեստերում ալգորիթմը թույլ է տվել սեղմել KV-քեշը մինչև 3 բիթ՝ մեկ արժեքի համար: Ընդ որում, մոդելի ճշգրտությունը մնացել է լիովին չսեղմված տարբերակի մակարդակին՝ առանց որևէ որակական անկման հարց ու պատասխանի, կոդի գեներացման և ամփոփման առաջադրանքներում:
Google-ը հայտարարում է, որ տեխնոլոգիան ապահովում է հիշողության սպառման նվազեցում առնվազն 6 անգամ: Բացի այդ, NVIDIA H100-ի նման սարքավորումների վրա որոշ սցենարներում նկատվում է ուշադրության հաշվարկների (attention logits) արագացում մինչև 8 անգամ:
Եթե հաջողվի TurboQuant-ը ներդնել իրական արտադրանքներում, դա կարող է էապես նվազեցնել ԱԲ համակարգերի շահագործման ծախսերը և թույլ տալ մոդելներին աշխատել ավելի երկար կոնտեքստի հետ՝ նույն ռեսուրսների պարագայում: Ալգորիթմը հատկապես օգտակար է ինֆերենսի (պատրաստի մոդելի կատարման) փուլի համար, թեև չի լուծում ուսուցման փուլի հսկայական ծախսերի խնդիրը:
Մշակումն առայժմ գտնվում է լաբորատոր հետազոտությունների փուլում: TurboQuant-ի (ինչպես նաև հարակից PolarQuant և Quantized Johnson-Lindenstrauss ալգորիթմների) ամբողջական շնորհանդեսը նախատեսված է հեղինակավոր ICLR 2026 կոնֆերանսում:
Համացանցում տեխնոլոգիան արդեն կատակով համեմատում են «Սիլիկոնային հովիտ» սերիալի Pied Piper սեղմիչի հետ՝ նշելով, որ այն ապահովում է էքստրեմալ սեղմում գրեթե առանց որակի կորստի:
Կարճ ասած
Google Research-ը ներկայացրել է TurboQuant ալգորիթմը, որը բարելավված վեկտորային քվանտացման միջոցով կրճատում է ԱԲ-ի աշխատանքային հիշողությունը (KV-քեշը) առնվազն 6 անգամ՝ առանց ճշգրտության կորստի: Թեստերում արձանագրվել է նաև մինչև 8x արագացում: Տեխնոլոգիան լուծում է ժամանակակից մոդելների հիմնական խոչընդոտը ինֆերենսի փուլում, կարող է նվազեցնել ԱԲ-ի շահագործման արժեքը և կներկայացվի ICLR 2026 կոնֆերանսում: Առայժմ սա լաբորատոր մշակում է, բայց դրա պոտենցիալը շատ բարձր է գնահատվում:
month
week
day