FrontierMath Tier 4: что это за бенчмарк и как на нём выступили GPT-6 Astra и Fable 5.1

FrontierMath — набор чрезвычайно сложных математических задач от Epoch AI, включая нерешённые исследовательские проблемы. Бенчмарк делится на тиры сложности, Tier 4 — самый трудный: задачи требуют математического рассуждения на уровне, недоступном большинству экспертов.

FrontierMath Tier 4: что это за бенчмарк и результаты GPT-6 Astra и Fable 5.1

Результаты по Tier 4: GPT-6 Astra набрал 97.6–98%, Claude Fable 5.1 — 87.8%, Claude Opus 5 — 73.2%.

Что такое FrontierMath и зачем нужны тиры?

FrontierMath разработан исследовательской организацией Epoch AI совместно с математиками-экспертами. Задачи делятся на тиры по уровню сложности:

  • Tier 1–2 — олимпиадная математика, с которой современные LLM постепенно справляются.
  • Tier 3 — задачи уровня PhD, требующие нескольких шагов нетривиального вывода.
  • Tier 4 — открытые или почти открытые исследовательские задачи; до 2025 года ни одна модель не решала их стабильно.

По заявлению OpenAI, GPT-6 Astra помог решить несколько давних открытых математических задач — впервые для ИИ-системы.

Результаты: GPT-6 Astra против Fable 5.1

МодельFrontierMath Tier 4
GPT-6 Astra97.6–98%
Claude Fable 5.187.8%
Claude Opus 573.2%

Разрыв между Astra и Fable 5.1 составляет около 10 процентных пунктов. Это единственный крупный домен, где Astra опережает Fable с явным отрывом: по нейтральному Artificial Analysis Intelligence Index Fable 5.1 набирает 66 против 61 у Astra.

Близкую картину рисует GPQA Diamond (вопросы уровня PhD по физике, химии, биологии): Astra — 96.0%, Fable 5.1 — 93.7%. Подробнее этот тест разобран в материале GPQA Diamond (arxiv.org).

Почему GPT-6 Astra почти сатурировал Tier 4?

Astra — первый релиз, где предыдущие модели OpenAI супервизировали обучение новой. Крупнейший тренинг-ран: 100 000+ GPU на площадке Stargate в Техасе. Математика и формальное рассуждение получили особый акцент в процессе RLHF.

При результате 97.6–98% Astra фактически насыщает Tier 4: разброс уже ниже погрешности. FrontierMath Tier 4 теряет дифференцирующую силу для будущих моделей — как MMLU потерял её раньше.

Критика: конфликт интересов и нечестные сравнения

Аналитики Vellum указывают на два момента:

  1. Конфликт интересов — Epoch AI частично финансируется OpenAI, что создаёт видимость предвзятости при публикации результатов.
  2. Часть замеров Astra шла против GPT-5.6 Sol, а не в очной ставке с Fable 5.1 — это затрудняет прямое сравнение.

Это не отменяет лидерства Astra в математике, но призывает к осторожности при интерпретации точных цифр.

Связь с другими бенчмарками

FrontierMath Tier 4 — часть более широкого математического и научного профиля моделей. Смежные тесты:

  • ARC-AGI-3 (абстрактное рассуждение): Astra ~98.6–99.9% — ARC Prize.
  • GPQA Diamond (наука уровня PhD): Astra 96.0% vs Fable 5.1 93.7%.
  • DeepSWE и Terminal-Bench — инженерный профиль моделей в агентном кодировании.

Полный профиль обеих моделей смотрите в сравнении GPT-6 Astra и Claude Fable 5.1 и в карточке GPT-6 Astra — официальный анонс Fable 5.1 на anthropic.com.

FAQ

Что такое FrontierMath Tier 4?

Это самый трудный уровень бенчмарка FrontierMath от Epoch AI — включает нерешённые и почти нерешённые математические задачи исследовательского уровня.

Сколько набрал GPT-6 Astra на FrontierMath Tier 4?

GPT-6 Astra набрал 97.6–98% — практически насыщает тест. Claude Fable 5.1 — 87.8%, Claude Opus 5 — 73.2%.

Правда ли, что GPT-6 Astra решил давние открытые задачи?

По заявлению OpenAI, да. Но критики указывают на возможный конфликт интересов: Epoch AI частично финансируется OpenAI.

Чем Fable 5.1 лучше Astra, если уступает в математике?

Fable 5.1 лидирует по нейтральному Intelligence Index (66 vs 61), HLE с инструментами (65.0% vs 57.2%) и имеет дешевле кэш. Смотрите профиль GPT-6 Astra.

keyboard_arrow_up