Google представила TurboQuant — алгоритм, сокращающий потребление памяти ИИ в шесть раз

27 марта, 2026  12:50

Исследователи Google Research разработали новый алгоритм сжатия памяти для систем искусственного интеллекта под названием TurboQuant. Технология позволяет значительно уменьшить объём оперативной памяти, который используют нейросети во время работы, без потери точности и производительности.

Об этом сообщает издание TechCrunch со ссылкой на официальный блог Google Research. Алгоритм направлен на решение одной из главных проблем современных больших языковых моделей — высокого потребления рабочей памяти, в частности так называемого KV-кэша (key-value cache), который хранит промежуточные вычисления, чтобы модель не пересчитывала их заново при генерации ответа.

Как работает TurboQuant

TurboQuant основан на продвинутой векторной квантизации — классическом методе сжатия данных. Он оптимизирует хранение ключей и значений в кэше, устраняя типичные overhead (дополнительные затраты памяти), которые возникают при обычной квантизации.

В тестах на открытых моделях, таких как Gemma и Mistral, алгоритм позволил сжать KV-кэш до 3 бит на значение. При этом точность модели осталась на уровне полностью несжатой версии — без какого-либо снижения качества в задачах вопрос-ответ, генерации кода и суммаризации.

Google заявляет, что технология обеспечивает снижение потребления памяти как минимум в шесть раз. Кроме того, на аппаратном обеспечении вроде NVIDIA H100 в некоторых сценариях наблюдается ускорение вычислений внимания (attention logits) до восемь раз.

Перспективы и ограничения

Если TurboQuant удастся успешно внедрить в реальные продукты, это может существенно снизить стоимость эксплуатации ИИ-систем и позволить моделям работать с более длинным контекстом при тех же ресурсах. Алгоритм особенно полезен для этапа инференса (выполнения готовой модели), хотя не решает проблему огромных затрат на этапе обучения.

Разработка пока находится на стадии лабораторных исследований. Полная презентация TurboQuant (а также связанных алгоритмов PolarQuant и Quantized Johnson-Lindenstrauss) запланирована на престижной конференции ICLR 2026.

В интернете технологию уже шутливо сравнивают с «компрессором» из сериала «Силиконовая долина» — Pied Piper, отмечая, что она даёт экстремальное сжатие почти без потерь качества.

Вкратце

Google Research представила алгоритм TurboQuant, который с помощью улучшенной векторной квантизации сокращает рабочую память ИИ (KV-кэш) минимум в шесть раз без потери точности. В тестах также зафиксировано ускорение до 8x. Технология решает ключевой bottleneck современных моделей на этапе инференса, может снизить стоимость эксплуатации ИИ и будет представлена на конференции ICLR 2026. Пока это лабораторная разработка, но её потенциал оценивают очень высоко.


 
 
 
 
  • Archive