Все выпуски

Выпуск #2 · 4 мая 2026 г. · 1:30:55

Локальные нейросети на MacBook: зачем, как выбрать, MLX, квантование, Dense vs MoE | Кир Белевич

Устройство LLM Кир Белевич Образование и навыки Карьера и найм Контекст и промптинг

Технический руководитель, Автор SVGO · ex-Яндекс

Описание

Обсуждаем локальные большие языковые модели (LLM) с Киром Белевичем — техническим руководителем, ex-Яндекс и автором SVGO.

В выпуске

Если вы хотите понять, как работают локальные LLM, убьет ли ИИ джунов и стоит ли покупать Mac Studio ради домашнего инференса — этот выпуск для вас!

⏱ Тайм-коды

Тайм-коды

00:37 - Вступление
02:40 - Кто такой Кир Белевич?
03:21 - Как MacBook (M2 Max) справляется с LLM: шум, нагрев и сценарии использования
06:36 - Почему локальные модели, а не облачные гиганты (Anthropic/OpenAI)?
10:21 - Self-host философия: зачем нужна независимость от корпораций
11:32 - Главный минус Vibe-coding: ИИ не должен заменять мозг разработчика
14:10 - Сравнение качества открытых моделей с проприетарными
16:31 - Как ИИ помогает продакт-менеджерам в быстром прототипировании
20:17 - Деградация индустрии: почему зумеры становятся новыми скрипт-кидди
21:57 - Локальная база знаний (RAG), векторные БД и DeepSeek для ресёрча
25:23 - Практика: как выбрать модель на Hugging Face?
28:43 - Что такое квантование моделей и как оно влияет на «ум» нейросети
36:36 - Как измеряют деградацию ИИ: Perplexity и KLD
41:13 - MLX, GGUF и победа динамического квантования Unsloth
42:16 - Почему бенчмарки (SWE-bench) больше не работают
49:26 - Движки инференса: Llama.cpp как Linux в мире ИИ
51:54 - Speculative Decoding и битва за размер контекста
01:00:39 - Архитектуры моделей: Dense vs MoE (Mixture of Experts)
01:14:12 - Можно ли файн-тюнить на маке?
01:19:26 - Снятие цензуры
01:21:32 - Будущее разработчиков: почему на вакансию CTO присылают 1000 ИИ-откликов
01:28:40 - ИИ никуда не уйдет: ищите свое место под солнцем

Материалы и ссылки

Смотреть и слушать

Там, где вам удобно