FrontierMath Tier 4: что это за бенчмарк и как на нём выступили GPT-6 Astra и Fable 5.1
FrontierMath — набор чрезвычайно сложных математических задач от Epoch AI, включая нерешённые исследовательские проблемы. Бенчмарк делится на тиры сложности, Tier 4 — самый трудный: задачи требуют математического рассуждения на уровне, недоступном большинству экспертов.

Результаты по Tier 4: GPT-6 Astra набрал 97.6–98%, Claude Fable 5.1 — 87.8%, Claude Opus 5 — 73.2%.
Что такое FrontierMath и зачем нужны тиры?
FrontierMath разработан исследовательской организацией Epoch AI совместно с математиками-экспертами. Задачи делятся на тиры по уровню сложности:
- Tier 1–2 — олимпиадная математика, с которой современные LLM постепенно справляются.
- Tier 3 — задачи уровня PhD, требующие нескольких шагов нетривиального вывода.
- Tier 4 — открытые или почти открытые исследовательские задачи; до 2025 года ни одна модель не решала их стабильно.
По заявлению OpenAI, GPT-6 Astra помог решить несколько давних открытых математических задач — впервые для ИИ-системы.
Результаты: GPT-6 Astra против Fable 5.1
| Модель | FrontierMath Tier 4 |
|---|---|
| GPT-6 Astra | 97.6–98% |
| Claude Fable 5.1 | 87.8% |
| Claude Opus 5 | 73.2% |
Разрыв между Astra и Fable 5.1 составляет около 10 процентных пунктов. Это единственный крупный домен, где Astra опережает Fable с явным отрывом: по нейтральному Artificial Analysis Intelligence Index Fable 5.1 набирает 66 против 61 у Astra.
Близкую картину рисует GPQA Diamond (вопросы уровня PhD по физике, химии, биологии): Astra — 96.0%, Fable 5.1 — 93.7%. Подробнее этот тест разобран в материале GPQA Diamond (arxiv.org).
Почему GPT-6 Astra почти сатурировал Tier 4?
Astra — первый релиз, где предыдущие модели OpenAI супервизировали обучение новой. Крупнейший тренинг-ран: 100 000+ GPU на площадке Stargate в Техасе. Математика и формальное рассуждение получили особый акцент в процессе RLHF.
При результате 97.6–98% Astra фактически насыщает Tier 4: разброс уже ниже погрешности. FrontierMath Tier 4 теряет дифференцирующую силу для будущих моделей — как MMLU потерял её раньше.
Критика: конфликт интересов и нечестные сравнения
Аналитики Vellum указывают на два момента:
- Конфликт интересов — Epoch AI частично финансируется OpenAI, что создаёт видимость предвзятости при публикации результатов.
- Часть замеров Astra шла против GPT-5.6 Sol, а не в очной ставке с Fable 5.1 — это затрудняет прямое сравнение.
Это не отменяет лидерства Astra в математике, но призывает к осторожности при интерпретации точных цифр.
Связь с другими бенчмарками
FrontierMath Tier 4 — часть более широкого математического и научного профиля моделей. Смежные тесты:
- ARC-AGI-3 (абстрактное рассуждение): Astra ~98.6–99.9% — ARC Prize.
- GPQA Diamond (наука уровня PhD): Astra 96.0% vs Fable 5.1 93.7%.
- DeepSWE и Terminal-Bench — инженерный профиль моделей в агентном кодировании.
Полный профиль обеих моделей смотрите в сравнении GPT-6 Astra и Claude Fable 5.1 и в карточке GPT-6 Astra — официальный анонс Fable 5.1 на anthropic.com.
FAQ
Что такое FrontierMath Tier 4?
Это самый трудный уровень бенчмарка FrontierMath от Epoch AI — включает нерешённые и почти нерешённые математические задачи исследовательского уровня.
Сколько набрал GPT-6 Astra на FrontierMath Tier 4?
GPT-6 Astra набрал 97.6–98% — практически насыщает тест. Claude Fable 5.1 — 87.8%, Claude Opus 5 — 73.2%.
Правда ли, что GPT-6 Astra решил давние открытые задачи?
По заявлению OpenAI, да. Но критики указывают на возможный конфликт интересов: Epoch AI частично финансируется OpenAI.
Чем Fable 5.1 лучше Astra, если уступает в математике?
Fable 5.1 лидирует по нейтральному Intelligence Index (66 vs 61), HLE с инструментами (65.0% vs 57.2%) и имеет дешевле кэш. Смотрите профиль GPT-6 Astra.
