HDHai, Мобильные технологии

Калькулятор батареи смартфонов и планшетов

GPT-6 Astra уступила флагманам Anthropic в первых независимых тестах

OpenAI представила флагманскую модель GPT-6 Astra, заявив о начале эпохи AGI, однако первые независимые тесты компании Artificial Analysis дают более сдержанную оценку. В мета-бенчмарке Intelligence Index новая модель получила столько же баллов, сколько GPT-5.6 Sol, и уступила ведущим моделям Anthropic и Meta (запрещена на территорри РФ). При этом в задачах для программных агентов Astra показала более сильный результат и заметно сократила расход токенов.

GPT-6 Astra уступила флагманам Anthropic в первых независимых тестах
Источник изображения: Grok

Бенчмарк оценивает модели по двум основным индексам. Intelligence Index объединяет тесты по математике, естественным наукам, программированию, работе с длинными документами и фактическими знаниями, а Coding Agent Index проверяет модели непосредственно в средах для программных агентов.

В первом индексе GPT-6 Astra набрала 61 балл. Это тот же результат, что у GPT-5.6 Sol, тогда как Claude Fable 5.1 получила 66 баллов, а Muse Spark 1.3 также оказалась выше новой модели OpenAI.

В Coding Agent Index Astra выступила заметно лучше. В среде Codex она получила 67 баллов, приблизившись к Claude Opus 5 и Fable 5 в Claude Code, а также Muse Spark 1.3 в Muse Code. Модель Fable 5.1 при этом сохранила первое место с 70 баллами.

При такой производительности Astra использует значительно меньше токенов. В Codex её расход составляет примерно треть от GPT-5.6 Sol и около пятой части от Claude Opus 5, что имеет значение при работе программных агентов.

Одновременно OpenAI существенно повысила стоимость API. Цена входных токенов выросла с $4 до $10 за миллион, а выходных с $20 до $50. Скидка на чтение кеша и надбавка за его запись остались прежними.

Экономия токенов частично компенсирует рост цен. При максимальном уровне усилий Astra обходится примерно в ту же сумму за задачу, что GPT-5.6 Sol, но получает на два пункта больше в индексе программных агентов, а при одинаковом результате стоит менее половины стоимости Claude Fable 5.

В тесте Intelligence Index преимущество по эффективности выражено слабее. Astra использует примерно на 10% меньше выходных токенов, чем GPT-5.6 Sol при максимальном уровне усилий, но стоимость выполнения отдельной задачи всё равно оказывается примерно на 75% выше.

Отдельно Artificial Analysis отметила результат AA-Omniscience, где проверяются знания и склонность модели к галлюцинациям. Их доля снизилась с 92% до 51%.

В задачах, связанных с многоэтапной работой, картина оказалась неоднозначной. В AA-Briefcase Astra прибавила около 80 баллов Elo и улучшила несколько показателей качества, но уступила GPT-5.6 Sol по качеству презентаций. В GDPval-AA v2 новая модель потеряла около 80 баллов Elo.

Другие тесты также дали смешанные результаты. В частности, в Humanity’s Last Exam Astra набрала на шесть баллов больше, но в τ³-Banking, SciCode и AA-LCR её показатели снизились на два-три балла. Таким образом, независимое тестирование пока не подтверждает заявления о начале эпохи AGI, а модель особенно убедительно выглядит именно в задачах программирования. API GPT-6 Astra доступен по цене $10 за миллион входных токенов и $50 за миллион выходных.

Добавьте Hdhai в избранное и вы будете чаще видеть наши последние новости на главной Дзена и в разделе «Новости партнёров» или читайте нас в Telegram в привычном для вас формате.