Бенчмарки GPT-5.6: лидерство в коде и новая тарификация кэша

В тестах Artificial Analysis семейство моделей GPT-5.6 обновило границу Парето. Версия GPT-5.6 Sol на максимальном уровне размышлений набрала 59 баллов в индексе интеллекта. Это на один балл ниже Claude Fable 5. При этом стоимость упала втрое — до $1.04 за задачу. Младшая модель Luna лидирует в бюджетном сегменте. На высоких настройках размышлений она обходит GLM-5.2 и Gemini 3.5 Flash при меньших затратах.
В программировании OpenAI вернула первенство. Связка GPT-5.6 Sol и агента Codex получила 80 баллов в Coding Agent Index. Она обошла конкурентов во всех профильных тестах. Стоимость написания кода на 40% ниже показателей Claude Fable 5. В сложной аналитике лидерство пока держит Anthropic. Однако Sol выдает лучшие результаты в форматировании данных. Модель получила высший рейтинг Presentation Elo за генерацию структуры PowerPoint и Excel.
Разработчики впервые ввели тарификацию записи в кэш. Сохранение токенов в память теперь стоит с коэффициентом 1.25 от цены ввода. Для GPT-5.6 Sol базовые тарифы составляют $5 на вход и $30 на выход. Чтение из кэша сохранило скидку в 90%. Стратегия выбора моделей под API изменилась. Тесты показывают, что комбинация Sol и Luna закрывает почти все потребности бизнеса. Промежуточная версия Terra оказывается менее выгодной для внедрения.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад