В независимом тестировании OpenAI GPT-6 Astra оказалась почти не лучше предшественницы - «Новости сети»

  • 14:30, 05-сен-2026
  • Новости мира Интернет
  • Геннадий
  • 0

OpenAI сообщила о выпуске новой модели искусственного интеллекта Muse Spark 1.3. Artificial Analysis тестирует модели по единой открытой методологии без участия разработчиков и формирует на основе этих тестов рейтинги: Intelligence Index включает задачи по математике, естественнонаучным дисциплинам, программированию, анализу длинных документов и по фактическим знаниям; оценка Coding Agent Index отражает работу моделей в соответствующих агентских системах Codex, Claude Code или Muse Code. Регистрируются объёмы потребления токенов, стоимость задачи и скорость работы.


В Intelligence Index модель OpenAI GPT-6 Astra набрала 61 балл — столько же, сколько предыдущая GPT-5.6 Sol. Для сравнения, Anthropic Claude Fable 5.1 набрала 66 баллов, а Meta Muse Spark 1.3 — 62 балла. В Coding Agent Index новая GPT-6 Astra в среде Codex показала 67 баллов, выступив примерно наравне с Claude Opus 5 и Fable 5 в Claude Code, а также Muse Spark 1.3 в Muse Code — лидерство сохранила Fable 5.1 в Claude Code с 70 баллами. По сравнению с GPT-5.6 Sol новая GPT-6 Astra подорожала в 2,5 раза: с $4 до $10 за 1 млн входных и с $20 до $50 за 1 млн выходных токенов; скидка на 90 % за чтение из кеша и надбавка на 25 % на запись в кеш остались прежними.




Источник изображения: artificialanalysis.ai



Рост цен компенсировал заметный скачок в эффективности токенов: GPT-6 Astra генерирует примерно треть от объёма GPT-5.6 Sol и примерно пятую часть от Claude Opus 5. При работе с программным кодом это значит, что при максимальных усилиях работа с ней обходится на уровне предшественницы, при этом новая модель оказывается на два пункта выше в рейтинге, а при равном показателе становится вдвое дешевле, чем Claude Fable 5. В Intelligence Index картина получается несколько иной: Astra экономит лишь 10 % выходных токенов по сравнению с предшественницей, лишь отчасти компенсируя разницу в цене; в расчёте на задачу она оказывается на 75 % дороже, чем Claude Fable 5.


Тест AA-Omniscience показал снижение частоты галлюцинаций с 92 % до 51 %. В тесте AA-Briefcase модель GPT-6 Astra стала лучше справляться с объёмными проектами, где задействуются тысячи исходных файлов, и прибавила около 80 баллов Elo, но по качеству презентаций работы она пока уступает GPT-5.6 Sol. А вот в тесте GDPval-AA v2 на практические задачи в 44 профессиях она, наоборот, потеряла 80 баллов Elo. В тесте Humanity’s Last Exam с акцентом на математику, написание кода и гуманитарные дисциплины модель прибавила шесть баллов; а также показала снижение на два–три балла в тестах τ³-Banking (поддержка клиентов), SciCode (задачи Python в естественнонаучной области) и AA-LCR (анализ больших документов).


Таким образом, новая OpenAI GPT-6 Astra стала выгоднее в задачах на написание кода, но пока не смогла побить конкурентов от Anthropic в области чистого интеллекта.



Было интересно?
Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

OpenAI сообщила о выпуске новой модели искусственного интеллекта ✴ Muse Spark 1.3. Artificial Analysis тестирует модели по единой открытой методологии без участия разработчиков и формирует на основе этих тестов рейтинги: Intelligence Index включает задачи по математике, естественнонаучным дисциплинам, программированию, анализу длинных документов и по фактическим знаниям; оценка Coding Agent Index отражает работу моделей в соответствующих агентских системах Codex, Claude Code или Muse Code. Регистрируются объёмы потребления токенов, стоимость задачи и скорость работы. В Intelligence Index модель OpenAI GPT-6 Astra набрала 61 балл — столько же, сколько предыдущая GPT-5.6 Sol. Для сравнения, Anthropic Claude Fable 5.1 набрала 66 баллов, а Meta✴ Muse Spark 1.3 — 62 балла. В Coding Agent Index новая GPT-6 Astra в среде Codex показала 67 баллов, выступив примерно наравне с Claude Opus 5 и Fable 5 в Claude Code, а также Muse Spark 1.3 в Muse Code — лидерство сохранила Fable 5.1 в Claude Code с 70 баллами. По сравнению с GPT-5.6 Sol новая GPT-6 Astra подорожала в 2,5 раза: с $4 до $10 за 1 млн входных и с $20 до $50 за 1 млн выходных токенов; скидка на 90 % за чтение из кеша и надбавка на 25 % на запись в кеш остались прежними. Источник изображения: artificialanalysis.ai Рост цен компенсировал заметный скачок в эффективности токенов: GPT-6 Astra генерирует примерно треть от объёма GPT-5.6 Sol и примерно пятую часть от Claude Opus 5. При работе с программным кодом это значит, что при максимальных усилиях работа с ней обходится на уровне предшественницы, при этом новая модель оказывается на два пункта выше в рейтинге, а при равном показателе становится вдвое дешевле, чем Claude Fable 5. В Intelligence Index картина получается несколько иной: Astra экономит лишь 10 % выходных токенов по сравнению с предшественницей, лишь отчасти компенсируя разницу в цене; в расчёте на задачу она оказывается на 75 % дороже, чем Claude Fable 5. Тест AA-Omniscience показал снижение частоты галлюцинаций с 92 % до 51 %. В тесте AA-Briefcase модель GPT-6 Astra стала лучше справляться с объёмными проектами, где задействуются тысячи исходных файлов, и прибавила около 80 баллов Elo, но по качеству презентаций работы она пока уступает GPT-5.6 Sol. А вот в тесте GDPval-AA v2 на практические задачи в 44 профессиях она, наоборот, потеряла 80 баллов Elo. В тесте Humanity’s Last Exam с акцентом на математику, написание кода и гуманитарные дисциплины модель прибавила шесть баллов; а также показала снижение на два–три балла в тестах τ³-Banking (поддержка клиентов), SciCode (задачи Python в естественнонаучной области) и AA-LCR (анализ больших документов). Таким образом, новая OpenAI GPT-6 Astra стала выгоднее в задачах на написание кода, но пока не смогла побить конкурентов от Anthropic в области чистого интеллекта. Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект
Цитирование статьи, картинки - фото скриншот - Rambler News Service.
Иллюстрация к статье - Яндекс. Картинки.
Есть вопросы. Напишите нам.
Общие правила  поведения на сайте.

Другие новости


Рекомендуем

Комментарии (0)




Уважаемый посетитель нашего сайта!
Комментарии к данной записи отсутсвуют. Вы можете стать первым!