OpenAI выпустила линейку GPT-5.6 9 июля 2026 года. Теперь компания рассказала, кто её оптимизировал: сама GPT-5.6.
Речь про версию GPT-5.6 Sol. После запуска в продакшен модель применили к инфраструктуре, на которой она же и работает. Итог — обслуживание подешевело на 20%, эффективность генерации токенов выросла на 15%.
Основная экономия пришла из ядер. Ядро — это низкоуровневый код, который выполняет вычисления непосредственно на GPU. В OpenAI их пишут на языках Triton и Gluon. GPT-5.6 Sol обучена приёмам записи, которые делают такой код быстрее, и ядра она переписала сама. Двадцать процентов от сквозной стоимости сервиса — результат только этой работы.
Второе направление — спекулятивное декодирование. Приём такой: маленькая «черновая модель» быстро угадывает следующие токены, а большая только проверяет её догадки. Это быстрее, чем генерировать всё по одному токену. GPT-5.6 Sol улучшила черновую модель — плюс 15% к скорости генерации.
Дальше модель самостоятельно взялась за работу с KV-кэшем и за систему распределения вычислений по видеокартам.
Отдельно OpenAI переделала харнесс — обвязку, через которую агент работает с инструментами. Изменений три: MCP-серверы и скиллы подгружаются только в момент, когда реально нужны; вывод инструмента по умолчанию обрезается на 10 000 токенов, больше — только если модель сама попросит; порядок вызова инструментов зафиксирован. Всё это повышает попадание в кэш: повторяющаяся часть контекста не пересчитывается заново, а берётся готовой.
«GPT-5.6 внесла большой вклад в улучшение инференса и харнесса, поэтому мы уверены, что темп оптимизации будет ускоряться», — заявили в OpenAI.
Новую архитектуру модель не придумала. Она переписала код, на котором крутится сама, — и счёт за GPU упал на пятую часть.