Канал

25 марта 2026 г.

TurboQuant

TurboQuant

Похоже, у обладателей топовых макбуков появилась возможность запускать пригодные для кодинга модели локально.

Google Research опубликовали статью, описывающую алгоритм квантизации для сжатия KV-кэша без потерь в качестве (по крайней мере, на приведенных бенчмарках), а сообщество уже реализовало его для MLX и во всю квантует модели. Полагаю, сегодня-завтра увидим их на Hugging Face.

Обещают экономию памяти в ~6 раз и 8-кратное ускорение инференса.

Начинаю задумываться, не поменять ли ноут по такому поводу.

Кто там переживал, что токены подорожают? :)

@devspotting