25 февраля 2026 г.
5 LLM в роли CEO стартапа
5 LLM в роли CEO стартапа
Решил сравнить SOTA-модели Gemini 3.1 Pro, Claude Opus 4.6, GPT-5.3-Codex (в режиме Extra High), GLM-5 и Minimax M2.5 на одинаковом промпте, предоставив им полную свободу и абстрактную задачу — придумать и реализовать MVP для стартапа без инвестиций.
Полный промпт
Выступая в роли серийного предпринимателя и опытного CEO, выбери новую идею для стартапа без инвестиций.
В качестве исполнителей создавай суб-агентов нужных специализаций и делегируй им задачи: продакт-менеджер, маркетолог, дизайнер, разработчик, тестировщик, финансист и т.д.
В итоге должен получиться готовый к запуску стартап с MVP и бизнес-планом.
Каждый шаг подробно фиксируй в пронумерованных отдельных markdown-документах в папке process.
При необходимости меняй решения и корректируй план.
Проводи регулярную рефлексию, фиксируй выводы, проблемы и ошибки, постоянно улучшай процесс.
Важно, чтобы выбранный проект можно было создать и запустить полностью средствами AI без инвестиций (включая маркетинг и продажи). Но при этом избегай очевидных решений, которые легко повторить или где высокая конкуренция. Нужен проект с потенциальным вирусным эффектом распространения.
При необходимости привлеки виртуальных суб-агентов консультантов из креативных бюро и консалтинговых компаний.
TL;DR
У каждой модели свои особенности, поэтому однозначного фаворита нет.
Все 5 моделей придумали несколько идей, выбрали лучшую (и обосновали выбор), продумали стратегию и технические детали. Три из пяти в результате справились с созданием сервиса на уровне выпускника Практикума. Важно: это не предел их возможностей, а скорее следование промпту. Искать пределы возможностей будем в следующих сериях.
Самые интересные идеи, на мой вкус, получились у GLM-5, но она вообще не стала писать код в рамках первого запроса. Пришлось дополнительно попросить реализовать то, что она насочиняла.
MiniMax замахнулась на полноценный сервис с бэкендом, но с первого раза он не завелся.
Gemini, Opus и GPT-Codex выдали рабочее решение за один запрос, при этом Codex оказался самым немногословным, а на Opus, вероятно, оказал влияние запуск из Antigravity, т.к. формат отчетов получился похожим на Gemini.
Я попытался коротко пересказать, что получилось у каждой: https://telegra.ph/Sravnivaem-5-LLM-v-roli-CEO-startapa-02-24#Gemini-3.1-Pro
Отчеты нейронок, сгенерированный код и рабочие приложения (где применимо) выложил на github:
* Gemini 3.1 Pro. Make no mistake (первая попытка): репо, результат
* Gemini 3.1 Pro. VIBECHECK AI (вторая попытка): репо, результат
* Claude Opus 4.6. WTF.js: репо, результат
* GPT-5.3-Codex. BoardRiot: репо, результат
* GLM-5. CineLife: репо, результат.
* Minimax M2.5. Content Butterfly
Итого
У каждой модели свой характер (от прагматичного техлида Codex до дотошного консалтера GLM-5), чистый фронтенд взлетает с первого промпта, а единственная модель, которая взялась за бэкенд, сходу не преуспела.
В общем, тезис из комментариев к предыдущим постам, что «кто-то же должен сказать умной нейронке, что делать», кажется, LLM уже потихоньку опровергают. В текущем виде это, конечно, не кнопка «Сделать стартап», но я развлекался с приложениями для кодинга. Стоит попробовать с более автономным агентом вроде OpenClaw.
Но так или иначе это уже сегодня отличный экзоскелет, который как минимум позволяет дополнить компетенции, которых не хватает в команде.