Канал

25 февраля 2026 г.

5 LLM в роли CEO стартапа

5 LLM в роли CEO стартапа

Решил сравнить SOTA-модели Gemini 3.1 Pro, Claude Opus 4.6, GPT-5.3-Codex (в режиме Extra High), GLM-5 и Minimax M2.5 на одинаковом промпте, предоставив им полную свободу и абстрактную задачу — придумать и реализовать MVP для стартапа без инвестиций.

Полный промпт

Выступая в роли серийного предпринимателя и опытного CEO, выбери новую идею для стартапа без инвестиций.
В качестве исполнителей создавай суб-агентов нужных специализаций и делегируй им задачи: продакт-менеджер, маркетолог, дизайнер, разработчик, тестировщик, финансист и т.д.
В итоге должен получиться готовый к запуску стартап с MVP и бизнес-планом.
Каждый шаг подробно фиксируй в пронумерованных отдельных markdown-документах в папке process.
При необходимости меняй решения и корректируй план.
Проводи регулярную рефлексию, фиксируй выводы, проблемы и ошибки, постоянно улучшай процесс.
Важно, чтобы выбранный проект можно было создать и запустить полностью средствами AI без инвестиций (включая маркетинг и продажи). Но при этом избегай очевидных решений, которые легко повторить или где высокая конкуренция. Нужен проект с потенциальным вирусным эффектом распространения.
При необходимости привлеки виртуальных суб-агентов консультантов из креативных бюро и консалтинговых компаний.

TL;DR

У каждой модели свои особенности, поэтому однозначного фаворита нет.

Все 5 моделей придумали несколько идей, выбрали лучшую (и обосновали выбор), продумали стратегию и технические детали. Три из пяти в результате справились с созданием сервиса на уровне выпускника Практикума. Важно: это не предел их возможностей, а скорее следование промпту. Искать пределы возможностей будем в следующих сериях.

Самые интересные идеи, на мой вкус, получились у GLM-5, но она вообще не стала писать код в рамках первого запроса. Пришлось дополнительно попросить реализовать то, что она насочиняла.

MiniMax замахнулась на полноценный сервис с бэкендом, но с первого раза он не завелся.

Gemini, Opus и GPT-Codex выдали рабочее решение за один запрос, при этом Codex оказался самым немногословным, а на Opus, вероятно, оказал влияние запуск из Antigravity, т.к. формат отчетов получился похожим на Gemini.

Я попытался коротко пересказать, что получилось у каждой: https://telegra.ph/Sravnivaem-5-LLM-v-roli-CEO-startapa-02-24#Gemini-3.1-Pro

Отчеты нейронок, сгенерированный код и рабочие приложения (где применимо) выложил на github:

* Gemini 3.1 Pro. Make no mistake (первая попытка): репо, результат

* Gemini 3.1 Pro. VIBECHECK AI (вторая попытка): репо, результат

* Claude Opus 4.6. WTF.js: репо, результат

* GPT-5.3-Codex. BoardRiot: репо, результат

* GLM-5. CineLife: репо, результат.

* Minimax M2.5. Content Butterfly

Итого
У каждой модели свой характер (от прагматичного техлида Codex до дотошного консалтера GLM-5), чистый фронтенд взлетает с первого промпта, а единственная модель, которая взялась за бэкенд, сходу не преуспела.

В общем, тезис из комментариев к предыдущим постам, что «кто-то же должен сказать умной нейронке, что делать», кажется, LLM уже потихоньку опровергают. В текущем виде это, конечно, не кнопка «Сделать стартап», но я развлекался с приложениями для кодинга. Стоит попробовать с более автономным агентом вроде OpenClaw.

Но так или иначе это уже сегодня отличный экзоскелет, который как минимум позволяет дополнить компетенции, которых не хватает в команде.