Канал

6 марта 2026 г.

Исследуем границы возможностей нейросетей. Часть про поэзию.

Исследуем границы возможностей нейросетей. Часть про поэзию.

Как мы выяснили, предел возможностей генераторов изображений находится на рогах у оленей.

Но тема еще не раскрыта сполна. В пятницу люди хотят поэзии, на!

Стихи — это про язык и опыт, а LLM — языковые модели, впитавшие через текст опыт человечества.

Значит, они просто обязаны хорошо справляться с написанием стихов (излияние чувств оставим для слезных желез и кушетки психоаналитика, поговорим о поэзии как мастерстве, которому можно научиться)?

Увы, дьявол даже не в деталях. Дьявол в архитектуре.

Поэзия строится на нарушении ожиданий, свежих метафорах и неочевидных связях. Или, как сказал бы, возможно, Иосиф Бродский:

Поэзия — это когда вероятность следующего слова по всем законам логики и статистики стремится к нулю, но после того, как оно произнесено, оно кажется единственно возможным.

Архитектура же современных языковых моделей базируется на авторегрессии — стремлении предсказать статистически наиболее вероятный следующий токен.

Второе проклятие — фонетическая глухота, как следствие токенизации.
Языковые модели не воспринимают слова по буквам или слогам, а разбивают текст на токены, из-за чего полностью теряют понимание звукового облика языка. Поскольку рифма, ритм и аллитерация являются фонетическими свойствами, нейросети вынуждены опираться на механическое заучивание, а не на акустическое чутье. Именно из-за особенностей токенизации LLM испытывают огромные трудности со сложными неточными рифмами и не могут интуитивно улавливать ударения.

И, наконец, несмотря на то, что LLM регулярно помогает нам в планировании чего угодно, от путешествий до разработки ПО, авторегрессионные модели генерируют текст строго слева направо и не могут заглянуть даже в конец строки, чтобы заранее спланировать идеальное совпадение формы и смысла.
Так что написание стихотворения с жестким метром и схемой рифмовки при удержании глобального замысла LLM не под силу.

А поверх архитектурных проблем ложится лоботомия цензура посттрейна.

Полагаю, что признаком хорошего поэта может быть его пападение в список иноагентов репрессированных. Но модели приторно-оптимистичны и запредельно политкорректны (что не спасает их от репрессий, но ожидать острых формулировок не приходится).

Это не значит, что нейросети принципиально неспособны писать поэзию. Речь лишь о том, что текущая архитектура сильно ограничивает возможности.

Несмотря на то, что в развитие LLM инвестируются астрономические суммы, некоторые эксперты (например, Ян Лекун) убеждены, что это в принципе тупиковая ветвь развития и AGI мы с таким подходом не достигнем. Вероятно, и для написания стихов нужно смотреть в сторону альтернативных нейронок.

Существуют эксперименты с диффузионными архитектурами (как для картинок), неавторегрессионными методами (которые видят и редактируют весь текст целиком) и фонетическим кодированием (похоже на то, как музыкальные ИИ работают с аудио-токенами).
Эти подходы обходят ограничения LLM, но все еще не Бродский.

Так что пока — учитываем ограничения и калибруем ожидания. Несколько вполне удачных примеров оставлю в комментариях.

@devspotting