Выпуск #5 · 9 сентября 2026 г. · 39:51
AI-агенты: почему лучшие практики противоречат друг другу | ИИ — не новости
Описание
— Почему одна и та же нейронка сначала уверенно говорит, что задача не решается, а потом сама чинит её за 20 минут — и почему иногда «сделай хорошо» работает лучше подробной инструкции? — Одна дорогая модель или умный оркестратор и рой дешёвых агентов: как два исследования получили противоположные результаты — и почему оба могут быть правы? — Когда высокий reasoning помогает, а когда модель начинает сомневаться, ходить кругами и просто жечь токены? — Почему AI-разработку почти невозможно нормально забенчмаркать и как работать в мире, где сегодняшняя best practice через две недели может оказаться анти-паттерном? — И заодно: неужели нейронки всё-таки научились шутить?
В выпуске
- Почему одна и та же нейронка сначала уверенно говорит, что задача не решается, а потом сама чинит её за 20 минут — и почему иногда «сделай хорошо» работает лучше подробной инструкции?
- Одна дорогая модель или умный оркестратор и рой дешёвых агентов: как два исследования получили противоположные результаты — и почему оба могут быть правы?
- Когда высокий reasoning помогает, а когда модель начинает сомневаться, ходить кругами и просто жечь токены?
- Почему AI-разработку почти невозможно нормально забенчмаркать и как работать в мире, где сегодняшняя best practice через две недели может оказаться анти-паттерном?
- И заодно: неужели нейронки всё-таки научились шутить?
Тайм-коды
00:00 — ИИ — не новости
00:47 — Codex сказал, что это невозможно. А потом взял и сделал
04:14 — 2 миллиарда токенов и борьба за токен-эффективность
07:31 — Одна дорогая модель или дешёвые исполнители?
11:59 — Cursor посчитал то же самое — и получил противоположный результат
14:47 — Как передавать контекст между агентами
19:18 — Умный оркестратор или тупой роутер
25:31 — Когда слишком высокий reasoning только мешает
30:40 — Почему AI-разработку так сложно измерять
35:20 — Нейронки наконец научились шутить?
39:21 — Почему накопленный опыт нужно регулярно ставить под сомнение
Материалы и ссылки
- Stencil — “You only need the frontier model for one single edit” — https://stencil.so/blog/prewalk
- Cursor — “Agent swarms and the new model economics” — https://cursor.com/blog/agent-swarm-model-economics
- OpenAI — Codex Subagents — https://learn.chatgpt.com/docs/agent-configuration/subagents
- OpenAI — reasoning effort — https://developers.openai.com/api/docs/guides/latest-model
- OpenAI Evals — Software Engineering — https://evals.openai.com/
- OpenAI — “Separating signal from noise in coding evaluations” — https://openai.com/index/separating-signal-from-noise-coding-evaluations
- Pi Agent Harness — https://github.com/earendil-works/pi, https://pi.dev/docs/latest
- Пост про LLM и юмор — https://t.me/devspotting/89
Связанные выпуски
- LLM и мышление | философ Андрей Морозов — https://youtu.be/WswHn_mJo8I
- ИИ и IT конференции, когда знания бесплатны | Алексей Федоров, JUG Ru Group — https://youtu.be/VhQPchnlwo8
Продолжить тему
Смотреть следующим
Смотреть и слушать