6 мая 2026 г.
Subquadratic Selective Attention: запихнуть в контекст весь репозиторий и не разориться

Subquadratic Selective Attention: запихнуть в контекст весь репозиторий и не разориться
UPD: есть мнение, что это скам. Добавился в их дискорд, наблюдаю.
Малоизвестный (по крайней мере для меня) стартап Subquadratic опубликовал технические детали по своей модели на базе новой архитектуры Subquadratic Selective Attention. И это звучит как очередной прорыв: 12М контекста и 52x ускорение по сравнению с FlashAttention на 1M токенов.
Проблема
Классический аттеншн — квадратичный. Удвоил контекст — получи в четыре раза больше вычислений. Поэтому топовые модели биллят длинный контекст заметно дороже. При этом качество на длинном контексте ощутимо деградирует. FlashAttention эффективнее по памяти, но вычислительная сложность никуда не девается.
Что такое SSA
Subquadratic Selective Attention — вместо вычисления для всех пар токенов подряд, алгоритм сначала определяет, какие позиции вообще релевантны по смыслу, и работает только с ними. Content-dependent routing — модель смотрит туда, где что-то есть, а не туда, куда велит позиция в последовательности.
Итого
- Линейная сложность — растёт с числом выбранных позиций, а не со всей длиной контекста
- Смысловой роутинг — важное достаётся независимо от того, где оно лежит
- Точное извлечение — конкретный факт из начала контекста не «размазывается»
Кстати, DeepSeek Sparse Attention (DSA), которую мы обсуждали в посте про DeepSeek V4, — тоже разреженная, но квадратичная: там lightning-индексер честно перебирает все пары query-key с теми же O(n²).
Цифры
Prefill speedup над стандартным dense attention (с FlashAttention-2) на B200:
- 128K токенов → 7.2×
- 256K → 13.2×
- 512K → 23.0×
- 1M токенов → 52.2×
По качеству — на MRCR v2 (это не «найди иголку в стоге», а «собери и свяжи несколько разбросанных фактов»): SubQ набирает 65.9%. Для сравнения: Opus 4.6 — 78%, GPT 5.4 — 39%, Gemini 3.1 Pro — 23%. Да, они опережают два из трёх флагманов на самом жёстком long-context бенче.
На SWE-Bench Verified 81.8% — лучше Opus 4.6 и Gemini 3.1 Pro, но уступает Opus 4.7 (87.6%).
При этом обещают цену в 5% от цены на Opus!
Заявления смелые, стартап новый, model card еще нет. Но если всё правда — вскоре можно ожидать условно безграничный контекст и у ключевых игроков!
Поменяется ли ваш подход к разработке, если в каждый запрос можно будет смело закидывать весь проект целиком?