3 июня 2026 г.
Бенчмарки, которым можно верить

Бенчмарки, которым можно верить
Наблюдения Михаила Парахина подтвердились сегодняшними замерами Toloka Arena (замеры на закрытом наборе задач) — Claude 4.8 показывает лучший результат среди всех моделей, правда и жжет больше токенов, чем GPT-5.5 в режиме XHigh, у которого второе место.
Впрочем, высока вероятность, что до конца недели случится новый релиз от OpenAI :)