Модели Видео Цены Блог FAQ API Войти

OpenAI показала, как две настройки утроили результат GPT-5.6 Sol на ARC-AGI-3

OpenAI показала, как две настройки утроили результат GPT-5.6 Sol на ARC-AGI-3

OpenAI выпустила необычно полезный разбор для всех, кто работает с AI-агентами через API. Компания утверждает, что на бенчмарке ARC-AGI-3 модель GPT-5.6 Sol показала заметно более высокий результат не из-за новой версии модели, а из-за двух настроек рантайма: retained reasoning и compaction.

По данным OpenAI, в официальном harness для ARC-AGI-3 GPT-5.6 Sol набирала 13,3% на public set. После включения retained reasoning и compaction результат вырос до 38,3%, а объём выходных токенов сократился примерно в 6 раз.

Что произошло

29 июля OpenAI опубликовала материал о том, почему GPT-5.6 Sol выглядела слабее ожидаемого на ARC-AGI-3 — бенчмарке, где агенту нужно разбираться в незнакомых 2D-играх без явных инструкций.

Команда пришла к выводу, что проблема была не только в самой модели, а в устройстве тестового контура:

После этого OpenAI перепроверила задачу через свой Responses API с двумя настройками:

Именно в такой конфигурации, по заявлению компании, GPT-5.6 Sol поднялась с 13,3% до 38,3% на public set ARC-AGI-3. OpenAI отдельно отмечает, что средний человеческий результат по их оценке находится около 48%. Ещё один важный эффект: модель стала тратить существенно меньше выходных токенов, потому что ей не приходилось заново «понимать игру» почти на каждом шаге.

Почему это важно

Главный вывод тут шире одного бенчмарка. OpenAI фактически говорит рынку простую, но неприятную вещь: оценки AI-агентов зависят не только от модели, но и от того, как устроен agentic harness.

Для разработчиков это важно сразу по нескольким причинам:

Проще говоря, новость не в том, что OpenAI «снова улучшила GPT-5.6», а в том, что компания всё громче продвигает идею: побеждает не отдельная модель, а связка модель + память + orchestration.

Что дальше

Скорее всего, после этого кейса рынок ещё активнее сместится в сторону более «памятливых» агентных рантаймов.

Можно ожидать как минимум три последствия:

  1. Responses API и похожие подходы станут стандартом для сложных агентных сценариев, где нужно сохранять ход мыслей между действиями.
  2. Публичные сравнения моделей начнут чаще критиковать за неудачный harness, особенно если он не отражает реальную продовую конфигурацию.
  3. Фокус сместится с сухих benchmark-score на стоимость полного цикла задачи: сколько агент думает, сколько шагов делает, сколько токенов тратит и насколько стабильно держит стратегию на длинной дистанции.

Для рынка AI это хороший маркер зрелости: обсуждение постепенно уходит от гонки «у кого выше IQ в одном промпте» к более практичному вопросу — какой стек реально лучше работает в длинных автономных задачах.

Источник: официальный материал OpenAI от 29 июля 2026 года.

Нейросети для текста, картинок, видео и музыки

Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.

Начать бесплатно
← Все статьи