OpenAI выпустила необычно полезный разбор для всех, кто работает с AI-агентами через API. Компания утверждает, что на бенчмарке ARC-AGI-3 модель GPT-5.6 Sol показала заметно более высокий результат не из-за новой версии модели, а из-за двух настроек рантайма: retained reasoning и compaction.
По данным OpenAI, в официальном harness для ARC-AGI-3 GPT-5.6 Sol набирала 13,3% на public set. После включения retained reasoning и compaction результат вырос до 38,3%, а объём выходных токенов сократился примерно в 6 раз.
Что произошло
29 июля OpenAI опубликовала материал о том, почему GPT-5.6 Sol выглядела слабее ожидаемого на ARC-AGI-3 — бенчмарке, где агенту нужно разбираться в незнакомых 2D-играх без явных инструкций.
Команда пришла к выводу, что проблема была не только в самой модели, а в устройстве тестового контура:
- private reasoning между шагами не сохранялся;
- старые действия со временем выпадали из контекста из-за rolling truncation;
- модель фактически теряла собственные промежуточные выводы и часть истории.
После этого OpenAI перепроверила задачу через свой Responses API с двумя настройками:
- retained reasoning — сохранение внутренней цепочки рассуждений между ходами;
- compaction — сжатие длинного контекста вместо грубого отбрасывания старых сообщений.
Именно в такой конфигурации, по заявлению компании, GPT-5.6 Sol поднялась с 13,3% до 38,3% на public set ARC-AGI-3. OpenAI отдельно отмечает, что средний человеческий результат по их оценке находится около 48%. Ещё один важный эффект: модель стала тратить существенно меньше выходных токенов, потому что ей не приходилось заново «понимать игру» почти на каждом шаге.
Почему это важно
Главный вывод тут шире одного бенчмарка. OpenAI фактически говорит рынку простую, но неприятную вещь: оценки AI-агентов зависят не только от модели, но и от того, как устроен agentic harness.
Для разработчиков это важно сразу по нескольким причинам:
- Бенчмарки могут недооценивать модель. Если рантайм обнуляет рассуждения и режет историю слишком грубо, агент выглядит слабее, чем в реальной продовой среде.
- Память агента становится частью качества. В задачах, где нужно учиться по ходу работы, помнить прошлые шаги и не терять стратегию, настройка контекста влияет почти так же сильно, как выбор самой модели.
- Экономика API становится лучше. По версии OpenAI, retained reasoning и compaction не только подняли результат, но и снизили расход токенов. Для продуктов с длинными многошаговыми сценариями это уже вопрос денег и задержки, а не только качества.
- Это прямой сигнал для экосистемы агентов. Если Codex и ChatGPT Work уже опираются на такой подход, то разработчики внешних AI-агентов будут всё чаще сравнивать не просто модели, а целые execution-стеки.
Проще говоря, новость не в том, что OpenAI «снова улучшила GPT-5.6», а в том, что компания всё громче продвигает идею: побеждает не отдельная модель, а связка модель + память + orchestration.
Что дальше
Скорее всего, после этого кейса рынок ещё активнее сместится в сторону более «памятливых» агентных рантаймов.
Можно ожидать как минимум три последствия:
- Responses API и похожие подходы станут стандартом для сложных агентных сценариев, где нужно сохранять ход мыслей между действиями.
- Публичные сравнения моделей начнут чаще критиковать за неудачный harness, особенно если он не отражает реальную продовую конфигурацию.
- Фокус сместится с сухих benchmark-score на стоимость полного цикла задачи: сколько агент думает, сколько шагов делает, сколько токенов тратит и насколько стабильно держит стратегию на длинной дистанции.
Для рынка AI это хороший маркер зрелости: обсуждение постепенно уходит от гонки «у кого выше IQ в одном промпте» к более практичному вопросу — какой стек реально лучше работает в длинных автономных задачах.
Источник: официальный материал OpenAI от 29 июля 2026 года.
Нейросети для текста, картинок, видео и музыки
Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.
Начать бесплатно