Все выпуски

Выпуск #16 · 6 июля 2026 г. · 1:31:20

AI-агент в продакшне: браузер, тулы и эвалы | Андрей Мелихов, DataLens, Yandex Cloud

AI в продакшне ИИ-агенты Андрей Мелихов ИИ-агенты Тестирование и evals Безопасность и доверие MCP и интеграции Spec-driven разработка

Разработчик DataLens · Yandex Cloud

Описание

Обсуждаем создание AI-агента для BI-системы с Андреем Мелиховым, автором https://t.me/melikhov_dev и разработчиком DataLens: почему агент живёт в браузере, как он вызывает тулы, строит чарты, работает с данными, проверяет себя через eval harness и почему просто прикрутить LLM в продакшне быстро превращается в большую инженерную задачу.

В выпуске

  • почему готовых фреймворков не хватает;
  • как устроены AI-агенты в браузере;
  • SSE-стриминг, BFF, tool calling и agent loop;
  • проблемы разных моделей и инференсов;
  • evals, LLM-as-a-judge и железного пользователя;
  • доверие к числам в BI и проверяемые чарты;
  • заменит ли GenBI аналитиков;
  • MCP, серверные агенты и будущие API;
  • как Claude Code, Codex, OpenCode и другие coding agents меняют разработку;
  • почему AI ускоряет разработчика в 3–5 раз, но задач становится только больше;
  • безопасность, permissions, sandboxing и корпоративные ограничения;
  • AI вне работы: ремонт, ресёрч, медицина, презентации, NotebookLM и новостные боты;
  • bus factor, spec-driven development и контекст для агентов.

Тайм-коды

01:24 — Андрей Мелихов
03:30 — Почему собрать агента за 15 минут не работает в продакшне
05:08 — Что такое DataLens и GenBI
06:29 — Почему нейронке нельзя просто скормить все данные
07:45 — Что значит «фронтендер» в Яндексе
09:31 — Браузерный state, сессии и Responses API
13:38 — Разные модели, инференсы и проблемы tool calling
16:14 — Первые ошибки: Vercel AI SDK, OpenAI SDK и свой слой
18:28 — Почему без evals нельзя развивать агента
20:33 — Eval harness, LLM-судья и железный пользователь
24:52 — Архитектура агента: BFF, SSE, тулы и agent loop
28:59 — Как агент строит интерактивные чарты в чате
31:06 — Классификатор запросов и отсечение не-BI вопросов
34:55 — Заменит ли GenBI аналитиков
38:51 — Доверие к цифрам: почему LLM не должна считать сама
41:38 — Тула-судья и проверка фильтров
43:38 — Стоимость диалогов и оптимизация контекста
47:55 — MCP, API и перенос агента на сервер
51:14 — Как AI-агенты меняют работу разработчика
54:35 — Flow: план → ревью → реализация → ревью второй моделью
56:46 — Автоматизация багрепортов и тикетов
59:07 — Дежурства, логи и нейронка как третья линия поддержки
01:04:46 — Безопасность coding agents: permissions, sandboxing, open source
01:09:49 — Родные harness’ы, универсальные агенты и бенчмарки
01:14:51 — Ускорение разработки в 3–5 раз
01:18:44 — AI вне работы: ремонт, медицина, презентации
01:21:07 — NotebookLM, подкасты и подготовка к докладам
01:22:09 — Бот для AI/Frontend-новостей
01:24:01 — Что будет с разработкой через 1–2 года
01:25:26 — Bus factor, spec-driven development и контекст для агентов
01:30:28 — Финал

Материалы и ссылки

DataLens: https://datalens.ru/
OpenAI Responses API: https://developers.openai.com/api/docs/guides/migrate-to-responses
OpenAI Chat Completions: https://developers.openai.com/api/reference/chat-completions/overview/
LangGraph: https://docs.langchain.com/oss/python/langgraph/overview
Vercel AI SDK: https://ai-sdk.dev/docs/introduction
Langfuse: https://langfuse.com/docs
Playwright: https://playwright.dev/
NotebookLM: https://notebooklm.google/

Продолжить тему

Смотреть следующим

Выпуск #19 · 1:29:52 AI-разработка в продакшне: обвязка важнее моделей | Алексей Ярошевич, Яндекс Банк

Смотреть и слушать

Там, где вам удобно