3 апреля 2026 г.
Когда подорожают токены?

Когда подорожают токены?
В комментариях в этом канале и среди коллег часто звучит теория, что вот сейчас ушлые корпораты подсадят всех на иглу дешевого инференса, а потом (когда нас заменят на нейронки), ка-а-а-ак поднимут цены!
Предлагаю по случаю пятницы обсудить эту перспективку.
Самый популярный аргумент звучит так: подписки дотируются, чтобы захватить рынок и подсадить. И это правда. Исследователь под ником she-llac выяснил: Claude Max ($200/мес) дает эквивалент API вплоть до $3 600+ в месяц при теплом кэше. Claude Pro ($20) — в 16–37 раз дешевле, чем платить по API. То есть да — лаборатории сейчас банчат нейро-стафф по дешману.
Дальше — парадокс Джевонса: чем дешевле ресурс, тем больше его потребляют. Дешевые токены порождают новые SaaS, агентные пайплайны и прочие сценарии использования — спрос растет быстрее, чем падает цена. В результате у компаний появляется возможность для поднятия цен.
Наконец, более сложные модели объективно дороже, а дальнейшее масштабирование требует железа на порядки больше — квадратичный рост вычислений ради линейного прироста качества.
И что же? Остается срочно навайбкодить себе единорога, пока лавочка не закрылась?
Почему я в это не верю
Для начала такой факт: с 2023 по 2026 год цена за токен упала в 1000+ раз. GPT-4 стоил $30/60 за 1M токенов — сегодня Qwen3.5 или Gemma 3n дают сопоставимые возможности за $0.02–0.03. И тенденция скорее ускоряется:
- Железо — H100 → Blackwell → Rubin: каждое поколение дает 2–3x токенов/доллар. HBM4 поднимает утилизацию чипов до 90%.
- Альтернативные чипы — TPU, специализированный AI-silicon: Midjourney уже сэкономил $16M/год, просто сменив железо.
- Алгоритмы — дистилляция снижает затраты в 10–100x, модели становятся меньше и умнее одновременно. TurboQuant, придуманный для оптимизации KV-кэша, в сообществе уже пробуют применять для сжатия весов.
- Инфраструктура — batch API дает скидку 50%, кэширование контекста режет реальные расходы в разы. Stateless/elastic инференс убивает idle-costs.
Общий тренд: снижение цены на порядок ежегодно — быстрее, чем в PC или интернете в эпоху доткома.
Открытые модели и локальный инференс
Уже сейчас на пусть и недешевом, но все еще бытовом железе можно запустить Gemma 4, Nemotron, gpt-oss и целый зоопарк от китайских лабораторий.
Судя по всему, к моменту, когда пессимисты ожидают повышения цен, на средних ноутбуках можно будет запускать модели уровня Claude Sonnet 4.5.
Конкуренция между OpenAI, Anthropic, Google, DeepSeek и прочими китайцами — структурная. Ни один из них не может поднять цены, не потеряв рынок. А с открытыми весами у корпоративных пользователей появляется полноценная альтернатива.
В конце концов, на интернет ведь тоже всех подсадили, но мы спокойно берем безлимитные мобильные пакеты и смотрим 4k-видео в метро (не в Москве, конечно, откуда тут мобильный интернет в 2026?).
Так что я ожидаю, что для бытовых задач мы получим модели в разы мощнее нынешних SOTA за пренебрежительно дешевую подписку, а для промышленного использования стоимость токенов будет иметь примерно такое же значение, как сейчас стоимость трафика для SaaS-компаний — да, петабайты стоят денег, но это точно не фактор, который определяет финмодель.
Разубедите?