Канал

16 апреля 2026 г.

Говорить мало. Экономить токен.

Говорить мало. Экономить токен.

Сегодня в рубрике #ЭкономимТокены хочу поговорить про завирусившийся скилл caveman.

Он заставляет модель отвечать как пещерный человек: без вводных конструкций и прочей воды, сохраняя техническую суть. По бенчмаркам самого проекта экономия на выходных токенах составляет 22–87% в зависимости от типа запроса (важно: это именно ответы модели, не входящий контекст).

Из примера в README:

🗣️ Клод по умолчанию (69 токенов):

The reason your React component is re-rendering is likely because you're creating a new object reference on each render cycle...

🪨 Caveman-Клод (19 токенов):

New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo.

Ответ тот же. Слов в 3,5 раза меньше.

Есть три уровня краткости (`lite` / full / ultra`) и неожиданный режим `文言文 — сжатие на классическом китайском. Отдельные скиллы: /caveman-commit (коммиты в духе «fix: null user L42») и /caveman-review (ревью одной строкой). Ещё есть caveman-compress — утилита для сжатия самого CLAUDE.md, чтобы меньше тратить уже на входе.

Установка
npx skills add JuliusBrussee/caveman

А еще @veged сделал форк с поддержкой русского языка. Серега, не хочешь для еще большей экономии удалить англоязычную часть и переименовать скилл в «Чехов» или «Ильяхов»? :)

Что говорит наука
Авторы ссылаются на мартовскую статью с arxiv «Brevity Constraints Reverse Performance Hierarchies in Language Models».

Исследователи проверили 31 модель (от 0.5B до 405B параметров) на 1485 задачах из пяти разных бенчмарков. Обнаружили странный эффект: на ~8% задач большие модели стабильно проигрывали маленьким — причём с разрывом в 28 процентных пунктов.

Причина оказалась структурной: крупные модели при подробных ответах начинают «переобъяснять» — дообрабатывают правильный промежуточный результат и в итоге приходят к неверному финальному. Мозг большой, но болтает лишнее.

Когда тем же большим моделям добавили ограничение «отвечай кратко» — точность выросла на 26 процентных пунктов, а разрыв с маленькими сократился до двух третей. На математике и точных науках иерархия перевернулась полностью: большие модели получили преимущество в 8–16 пунктов там, где раньше проигрывали.

Иными словами: brevity constraint — это не просто «меньше токенов», это потенциально «более правильный ответ».

Но есть нюанс

На мой взгляд, нет смысла ради краткости тащить целый отдельный скилл с кучей режимов вместо того, чтобы добавить одну строку прямо в AGENTS.md:

Отвечай максимально сжато, но без потери смысла. Никогда не сокращай код, сообщения о безопасности или необратимых действиях, или если я запутался.

С точки зрения механики это ровно то же самое — brevity constraint через системный промпт.

@devspotting