Компания OpenAI выпустила новую флагманскую модель. Разработка получила название GPT-6 Astra. Компания называет её сильнейшим продуктом в своей истории. По заявлению OpenAI, модель демонстрирует рекордный уровень интеллекта и согласованности среди генеративных ИИ.
Обучение модели прошло на суперкомпьютерном кластере Stargate в Техасе. Для предобучения задействовали более ста тысяч видеокарт. Этот проект также стал первым, где компания массово применила предыдущую модель. Прежняя версия участвовала в процессе обучения новой флагманской модели.
Насколько мощной оказалась новая разработка? Ответ дало исследование от Epoch AI и Манчестерского университета. Организации опубликовали тест под названием FrontierMath Erdős, или сокращённо FME. По итогам испытания только GPT-6 Astra представила рабочее решение задач.
Тест включал 68 нерешённых математических задач из наследия Эрдёша. Модель сумела справиться сразу с пятью долгоживущими гипотезами. Остальные участники теста, включая GPT-5.6 и Claude Fable 5.1, набрали ровно ноль баллов.
Организаторы специально отобрали задачи без готовых решений в интернете. Такой подход исключает простое воспроизведение ответов из обучающей выборки. От моделей требовали формальное доказательство в системе Lean. Корректность решения проверяло автоматическое ядро без участия человека. Все модели получили одинаковый бюджет в 300 долларов. Организаторы также ограничили время эксперимента 72 часами для честного сравнения.
В рамках стандартного теста GPT-6 Astra решила две задачи. Дополнительный эксперимент с расширенным бюджетом принёс ещё три решения. Среди них оказалась гипотеза о разделяющих множествах, предложенная Эрдёшем ещё в 18 лет. Сам математик называл эту задачу своим первым серьёзным вопросом в науке. Второй значимой победой стала знаменитая гипотеза Эрдёша-Шоша из экстремальной теории графов. Эти проблемы десятилетиями оставались неприступными для ведущих математиков мира.
Среди пяти решённых задач встречаются разные типы доказательств. Модель построила контрпример, опровергающий одну из старых гипотез. В другом случае она представила полное доказательство новой математической теоремы. Уровень сложности этих результатов оценивается как весьма высокий.
Полное прохождение всех пяти задач обошлось в сумму свыше 220 тысяч долларов вычислений. Сам стандартный тест потребовал около 20 тысяч долларов. При стоимости попытки в 300 долларов и успешности около 3 процентов, ожидаемая цена решения одной серьёзной задачи составляет примерно 10 тысяч долларов.
Впрочем, авторы исследования отметили и определённые ограничения теста. Модель порой находит верную идею решения, но не может оформить её как формальное доказательство в Lean. Сам тест оценивает лишь способность решать готовые задачи. Математическая наука не менее ценит умение формулировать новые вопросы. Из 68 исходных задач 63 по-прежнему остаются нерешёнными. Несмотря на заявления OpenAI о наступлении эры AGI, до полного покрытия математики высокого уровня остаётся долгий путь.
