← Блог

20 июля 2026 г. · OpenAI

GPT-5.6: экономика интеллекта и агенты с длинным горизонтом

Вадим Барсов · Growth / Marketing / Adtech / LLM / ML · barsov-growth.ru

Источник: OpenAI

01020304050GPT-5.6 SolGPT-5.6 TerraGPT-5.6 LunaGPT-5.5Claude Opus 4.8Claude Fable 5Gemini 3.1 Pro Preview
Результат, %
Agents' Last Exam, % (длинный горизонт, 55 областей)

Контекст

OpenAI выпустила семейство GPT-5.6 — не одну модель, а линейку из нескольких конфигураций: старшую Sol, средние Terra и Luna, плюс режимы с разным уровнем «рассуждений». Ключевой посыл релиза — не в том, что модель стала «умнее вообще», а в том, что она извлекает больше полезной работы из каждого токена. Это смещение акцента с абстрактного интеллекта на экономику интеллекта — сколько стоит единица результата.

Главный полигон, на котором OpenAI меряет себя в этот раз, — Agents' Last Exam: набор длительных профессиональных рабочих процессов, охватывающий 55 областей. Это уже не «ответь на вопрос», а «пройди сценарий с длинным горизонтом»: последовательность шагов, где ошибка на пятом действии рушит весь результат. Именно такие задачи ближе всего к реальной работе AI-агентов внутри компаний.

Что произошло

По данным OpenAI, GPT-5.6 Sol устанавливает новый рекорд на Agents' Last Exam — 53,6 в максимальной конфигурации, обгоняя Claude Fable 5 (с адаптивным рассуждением) на 13,1 пункта. Даже на среднем уровне рассуждений Sol опережает Fable 5 на 11,4 пункта — и делает это примерно за четверть оценочной стоимости.

Самое интересное происходит в младших моделях. GPT-5.6 Terra и Luna, по заявлению компании, превосходят Fable 5 примерно за одну шестнадцатую стоимости. То есть выигрыш в эффективности не остаётся привилегией флагмана — он спускается вниз по линейке, туда, где решается вопрос массовой доступности интеллекта.

Если смотреть на сводную таблицу, картина неоднородная:

  • Agents' Last Exam: Sol 52,7%, Terra 50,4%, Luna 50,3% против Fable 5 40,5% и Opus 4.8 45,2%. Здесь GPT-5.6 доминирует по всей линейке.
  • GDPval-AA v2: тут Claude Fable 5 впереди (1759,6 Elo) против Sol (1747,8). Разрыв невелик, но лидерство не абсолютное.
  • Задачи управленческого консалтинга (внутренний тест OpenAI): Sol 43,2% — заметно выше конкурентов.
  • Big Finance Bench: Sol 53%, Terra 51% — уверенно в финансовых задачах.
  • Индекс интеллекта Artificial Analysis v4.1: Fable 5 держит 59,9 против Sol 58,9 — снова близкий, но не в пользу OpenAI результат.

Вывод из цифр честнее, чем маркетинговый заголовок: GPT-5.6 не выигрывает всё подряд. Он выигрывает там, где важен длинный горизонт агентной работы и соотношение цена/результат, и идёт вровень или чуть уступает в широких индексах интеллекта.

Почему это важно

Угол здесь — экономика ИИ, а не «ещё один рекорд на бенчмарке». Когда младшие модели за одну шестнадцатую стоимости обходят вчерашнего лидера, меняется вся юнит-экономика продуктов на генеративных моделях ИИ.

Раньше архитектурный выбор был бинарным: либо дорогой флагман для сложных задач, либо дешёвая модель, которая заметно проигрывает в качестве. GPT-5.6 предлагает третий сценарий — младшая модель с приемлемым качеством на агентных задачах при радикально низкой цене. Для продукта это значит, что можно закладывать AI-агентов в массовые пользовательские сценарии, а не только в премиум-фичи.

Второй момент — «больше работы из токена». Для тех, кто считает себестоимость фич на LLM, стоимость токена и число токенов на задачу — это две главные переменные. Улучшение эффективности бьёт сразу по обеим: меньше токенов на тот же результат плюс более дешёвые модели. В продуктовой аналитике это прямо переводится в снижение COGS на ИИ-функциях и в изменение точки безубыточности целых сценариев.

Третье — длинный горизонт. Agents' Last Exam меряет именно устойчивость на многошаговых процессах. Это тот класс задач, который отделяет демо от продакшена: чат-ассистент прощает ошибку, а агент, который сам ведёт финансовый ресёрч или консалтинговый анализ, — нет. Рост на 13 пунктов здесь важнее, чем доля процента в общем индексе.

Как это читать из РФ

Прямого легального доступа к GPT-5.6 из РФ по-прежнему нет — это надо держать в голове как базовое ограничение, а не как деталь. Поэтому релиз для российского специалиста ценен в первую очередь как ориентир, а не как инструмент «на завтра».

Что из этого реально забирать:

Методология оценки. Agents' Last Exam и подход «55 профессиональных областей, длинный горизонт» — это шаблон, по которому стоит тестировать любые доступные модели, включая российские и open-source. Не «ответь на вопрос», а «пройди процесс до конца». Внутренние бенчмарки под свои задачи (аналог Big Finance Bench или консалтинговых кейсов) дают куда больше, чем чужие публичные цифры.

Экономика вместо гонки за флагманом. Главный урок GPT-5.6 — не «берите самую сильную модель», а «считайте стоимость единицы результата». Для команд в РФ, работающих на доступных моделях (в том числе отечественных или self-hosted), это означает: сначала считайте токены на задачу и цену за результат, а уже потом гонитесь за баллами в индексах. Часто средняя модель с грамотным пайплайном выигрывает у топовой по деньгам.

Инфраструктурный риск. Ставка на конкретный зарубежный API — это риск отключения и валютных платежей. Логика линейки GPT-5.6 (флагман + дешёвые младшие модели) полезна как архитектурный принцип: закладывайте абстракцию над моделью, чтобы менять её без переписывания продукта. Тогда переход между поставщиками и локальными моделями становится вопросом конфигурации, а не переработки.

Осторожность с цифрами. Многие показатели — внутренние тесты OpenAI. В независимом индексе Artificial Analysis лидерство уже не такое однозначное. Это здоровый повод не принимать релизные графики за истину и проверять модели на своих данных.

Что взять в работу

  • Соберите свой мини-бенчмарк по образцу «длинного горизонта»: 5–10 реальных многошаговых процессов из вашей области, а не отдельные вопросы.
  • Введите в продуктовую аналитику метрику «стоимость единицы результата» по каждой ИИ-фиче — токены на задачу × цена модели.
  • Проверяйте, где вместо флагмана достаточно младшей модели: тренд GPT-5.6 показывает, что разрыв в качестве сокращается быстрее, чем кажется.
  • Заложите абстракцию над LLM в архитектуре, чтобы снизить зависимость от одного поставщика и валютных рисков.
  • Не доверяйте одному источнику метрик — сверяйте релизные цифры с независимыми индексами.

Читайте также

Смежные материалы на сайте:

Источник

OpenAI

https://openai.com/index/gpt-5-6

генеративный ииai агентыэкономика иипродуктовая аналитика

На сайте работает Яндекс Метрика: считаю визиты и поведение на страницах. Оставаясь здесь, вы соглашаетесь с этим.