25 марта 2026 г.
TurboQuant
TurboQuant
Похоже, у обладателей топовых макбуков появилась возможность запускать пригодные для кодинга модели локально.
Google Research опубликовали статью, описывающую алгоритм квантизации для сжатия KV-кэша без потерь в качестве (по крайней мере, на приведенных бенчмарках), а сообщество уже реализовало его для MLX и во всю квантует модели. Полагаю, сегодня-завтра увидим их на Hugging Face.
Обещают экономию памяти в ~6 раз и 8-кратное ускорение инференса.
Начинаю задумываться, не поменять ли ноут по такому поводу.
Кто там переживал, что токены подорожают? :)