«Ошеломляюще». «Потрясающе». «Беспрецедентно». «Сюрреалистично». «Чистое безумие». Именно такие эпитеты более чем три десятка математиков подбирали в разговорах с The Verge, пытаясь осмыслить поток математических результатов, который OpenAI внезапно обрушил на эту область на этой неделе. Среди восхищения, возбуждения и неопределенности, вызванных масштабом этого наплыва, скрывалась глубокая тревога о том, что всё это означает — и что будет дальше. Несмотря на разные реакции, исследователи сходились в одном: чтобы просто понять, что именно выпустила OpenAI, могут потребоваться годы, не говоря уже о том, чтобы разобраться, какую роль теперь в быстро меняющемся поле займут сами математики. Многие опасались, что OpenAI не станет ждать столь длительного времени, прежде чем перейти к следующему шагу — или выпустить ещё больше результатов.
В общей сложности OpenAI опубликовала почти 400 результатов, сгенерированных ИИ. Они распределены по более чем 700 рукописям и охватывают широкий спектр математических дисциплин, включая комбинаторику, несколько ветвей геометрии, теорию чисел, теоретическую информатику, алгебру, топологию, теорию вероятностей и статистическую механику, а также математическую физику. Коллекция настолько обширна, что OpenAI посчитала нужным выпустить руководство по навигации по разросшемуся репозиторию на GitHub.
Огромный объём работы делает затруднительной даже предварительную оценку того, что именно компания опубликовала. В часы и дни после релиза большинство математиков, с которыми разговаривал The Verge, говорили, что всё ещё пытаются это переварить; несколько человек отметили, что простое просмотрение примерно 40-страничного оглавления и аннотаций заняло у них значительную часть часа. «Просто просмотреть весь список аннотаций — это ошеломляет», — сказал Альваро Лосано-Робледо, профессор математики в Университете Коннектикута.
Среди сотен рукописей встречаются формализации в Lean — языке программирования и помощнике для формальных доказательств, который позволяет проверять результаты вычислительно. Эти формализации оказались ключевыми при оценке некоторых предыдущих математических заявлений OpenAI, давая исследователям уверенность в логической корректности утверждения, даже если они полностью не понимают лежащий за ним аргумент.
Однако степень, в которой каждый результат был верифицирован, сильно варьировалась. На GitHub OpenAI признала, что результаты находятся «на разных стадиях верификации» и что «многие, но не все, рукописи были формализованы». На момент написания статьи формально описаны, по-видимому, менее половины рукописей коллекции. OpenAI заявила, что только 300 основных результатов из 719 рукописей были формализованы, примерно 42 процента, и что она «обновит репозиторий новыми формализациями по мере их получения».
Несколько математиков жаловались The Verge на отсутствие формализации, особенно учитывая огромное число результатов, и подчёркивали, что даже когда к результату прилагается код на Lean, оценка не происходит мгновенно. Исследователям приходится проверять, действительно ли формализация доказывает то, что утверждает результат, — это ещё один трудоёмкий процесс. Несколько людей, просматривших бумаги, сказали, что даже там, где были предоставлены компьютеропроверяемые доказательства, качество было непостоянным, и утверждения, которые эти доказательства верифицировали, не всегда явно соответствовали заявлениям в сопроводительных рукописях.
Кевин Баззард, профессор математики в Имперском колледже Лондона, сказал, что он обнаружил множество теорем в своей области — алгебраической теории чисел — из которых около шести «сразу бросились в глаза». Немногие, если вообще какие-либо, из них казались формально проверенными в Lean. «Следовательно, мне либо придётся читать возможный неверный хлам, либо ждать, пока это сделают другие, либо ждать, пока кто-то не формализует их, прежде чем я смогу с уверенностью сказать, что результаты вообще верны». Беспокойство Баззарда повторяли и многие другие исследователи.
Баззард был далеко не одинок в опасениях по поводу «хлама» от ИИ. Этот термин стал сокращением для обозначения низкокачественных, часто ошибочных материалов, сгенерированных ИИ, которые всё чаще появляются в сети и в реальном мире, включая академические статьи. Как и в других областях, математики рассказали The Verge, что в последние годы заметили резкий рост подобных материалов, созданных с помощью инструментов вроде ChatGPT и Claude. Многое из этого сбивает с толку, трудно читается и демонстрирует слабое понимание предмета; особенно плохо обстоят дела с указанием заслуг и ссылок на других исследователей.
Предыдущие математические публикации OpenAI подвергались широкой критике со стороны экспертов за небрежный характер, в частности за слабое или отсутствующее указание авторства и ссылок. В беседах с The Verge перед релизом несколько исследователей прозвали ожидаемый поток статей «слопокалипсисом» или использовали похожие вариации на эту тему.
Трудно сказать, сбылись ли опасения о «слопокалипсисе», в значительной мере из-за ошеломляющего объёма выпущенного материала. Первые признаки указывают на то, что на этот раз OpenAI проявила большую осторожность в подготовке статей, или по крайней мере в части из них. Несколько математиков сообщили The Verge, что их первые впечатления были гораздо лучше, чем они ожидали, хотя сами они признавали, что ожидания были невысоки после предыдущих небрежных публикаций компании.
Но «лучше» не обязательно значит «хорошо», тем более что материалы должны соответствовать стандартам академической работы такого масштаба. При отсутствии формальной верификации для многих заявлений OpenAI качество сопроводительных статей становится особенно важным; именно через них математики могут подтвердить, понять, подвергнуть сомнению и поместить результаты в контекст.
Создание строгих математических статей — трудная работа даже в лучших условиях. Сделать это в таких масштабах — колоссальная задача. Модели OpenAI генерируют математику с головокружительной скоростью и в широком спектре специализаций, значительно превосходя возможности человеческого персонала компании. У компании просто нет широты экспертных знаний и ресурсов, чтобы должным образом проверять свои находки на переднем крае математики. Исследователи сказали The Verge, что это заметно.
Многие описывали статьи, которые было трудно, а иногда практически невозможно понять. «Описанная проблема, которую я знаю лучше всего, после быстрого прочтения мало о чём говорила», — сказал Брендан Хассетт, профессор математики в Брауновском университете. «Если бы это написал человек, я бы не стал тратить больше времени на попытки понять это. Конечно, теперь остаются ещё 721 препринт!» (Хассетт сказал это до того, как OpenAI отозвала три статьи).
Некоторые исследователи сообщили The Verge, что несколько статей, которые они или их коллеги заметили, казались посвящёнными уже пройденным кем-то территориям, хотя они опасались говорить об этом публично, прежде чем успеют полноценно проверить материалы. Другие указывали на необычную краткость работ: результаты, которые обычно развивались бы на сотнях страниц, сжаты в несколько десятков или даже меньше.
Налини Джоши, профессор математики в Сиднейском университете, сказала, что быстрый просмотр релиза выявил мало пересечений с её работой, но отметила, что некоторые из рассмотренных ею статей «имеют короткие библиографии». Учитывая предыдущую критику практики OpenAI по указанию заслуг, она сказала, что «остерегается, что в бумагах может не хватать полного рассказа об атрибуции».
Но несмотря на весь хлам и неопределённость, в целом согласие следующее: в этом релизе есть действительно впечатляющие работы.
Подчеркивая трудности оценки такого объёма материалов и необходимость должной верификации результатов, многие исследователи, с которыми говорил The Verge, отмечали, что работы выглядят очень высокого уровня, несмотря на недостатки в их представлении. В допандемийном или пред-ИИ мире, по их словам, многие результаты OpenAI явно заслуживали бы публикации в ведущих журналах и могли бы обеспечить своим авторам академическую карьеру. Несколько работ описывали как те, которые могли бы сделать математика серьёзным претендентом на медаль Филдса, одну из высших наград в дисциплине.
Стэнфордский математик Джаред Дукер Лихтман сказал, что есть «десятки» результатов, которые он отнёс бы к этой категории, в том числе прогресс по гипотезе Римана, частный случай гипотезы Ходжа и решение какаеевской задачи в четырёх измерениях. Это крупные проблемы математики. Гипотеза Римана — пожалуй, самая печально известная неразрешённая задача во всей дисциплине — и гипотеза Ходжа обе входят в число семи знаменитых задач тысячелетия. Первая касается распределения простых чисел, вторая — очень грубо говоря, того, как сложные геометрические структуры можно понять через более простые строительные блоки. Какая-же задача Какаея в свою очередь примерно спрашивает, сколько минимального пространства требуется, чтобы повернуть иглу или карандаш во всех направлениях. Доказательство трёхмерной версии задачи Какаея было среди достижений, за которые в этом году Нью-Йоркскому университету математик Хонг Вонг присудили медаль Филдса.
«Дело не в том, что это просто какие-то глупые задачи, о которых никто не слышал», — сказал математик Скотт Армстронг. «Многие из них — это очень известные проблемы, которыми многие пытались заниматься десятилетиями».
Когда пыль стала постепенно оседать, математики столкнулись с ландшафтом, который внезапно изменился вокруг них. Многие только что увидели, как годы работы и тщательно выстроенные исследовательские планы испарились в одно мгновение, или знали коллег, у которых так произошло. По всему полю, независимо от того, были ли реакции переплетены возбуждением, страхом, отчаянием или чем-то между, чувствовалось глубокое дезориентирование.
На следующее утро это настроение особым образом не изменилось. Разговаривая по телефону во время прогулки по Парижу, Армстронг представил, что если бы Сорбонна не была закрыта из-за продолжающихся студенческих протестов и его коллеги собрались у привычного кофейного автомата, атмосфера была бы довольно «торжественно-мрачной».
В Шотландии Колва Рони-Дугал, профессор математики в Университете Сент-Эндрюс, описала схожее мрачное настроение среди коллег и студентов. Она сказала, что наплыв чувствовался несколько «ужасающим», но его появление принесло некоторое облегчение после недель неопределённости. «У меня есть друзья и коллеги, чьи грантовые предложения только что были стёрты», — сказала она.
Армстронг сказал, что знал об одной группе, чья вся исследовательская программа фактически «стерта» релизом. Тристан Бакмастер, математик из NYU, который был в центре более раннего спора с OpenAI по задаче Навье–Стокса, тем временем сказал, что уже слышал о «трёх людях, у которых полностью уничтожены исследовательские программы».
Подобные истории неоднократно всплывали в беседах The Verge с математиками, хотя нарушению подверглись особенно сильно некоторые области. Франческо Фурнье-Фасио, профессор математики в Университете Хериот-Уатт в Шотландии, сказал, что исследователи в областях теории вероятностей, комбинаторики и теоретической информатики кажутся «особенно в шоке», добавив, что некоторые регионы его области, например теория групп, были «бульдозированы».
Армстронг и другие исследователи сказали, что некоторые области, похоже, были нацелены с почти военной точностью. «Определённо были некоторые приоритетные цели», — сказал он. Он выделил работу в области, за которую Вонг получил медаль Филдса в этом году, а также несколько задач тысячелетия. Кластер результатов в математической физике, по его словам, ясно указывает на то, что OpenAI занимается теорией Янга–Миллса — математической основой современной физики элементарных частиц — и её нерешённой проблемой «массового разрыва», одной из семи задач тысячелетия.
В других местах исследователи выражали удивлённое облегчение из-за того, что их собственные работы, похоже, были затронуты мало. Рони-Дугал сказала, что её собственный уголок науки — в основном связанный с теорией групп — оказался относительно не тронутым. Она пошутила, что ей повезло работать в «непопулярной области», хотя позже написала, что чувствует себя «неуверенно», найдя свою работу в списке цитируемых в одной из статей.
Джоши аналогично обнаружила мало пересечений с её работой, которая в значительной степени посвящена интегрируемым системам, сложным системам, которые можно решить точно. Она предположила, что это может быть потому, что её область меньше ориентирована на давние формально сформулированные гипотезы и определения и больше на вопросы, которые меняются в зависимости от развития физики.
Независимо от того, затронуты ли их собственные исследования непосредственно или нет, большинство математиков, с которыми разговаривал The Verge, разделяли чувство, что поле перешло некий порог и уже не такое, каким было ещё день назад. Константин Коглер, исследователь из Института перспективных исследований, назвал это «самым важным единичным моментом в истории математики», в то время как Янг-Хуэй Хе, научный сотрудник Лондонского института математических наук, сравнил произошедшее с публикацией «Начал» Евклида, одной из самых влиятельных работ в истории дисциплины.
Мало кто давал столь громкие оценки, но существовало общее согласие, что математика быстро меняется — и что математикам придётся меняться вместе с ней.
OpenAI знала, что релиз будет дестабилизирующим, и предприняла некоторые шаги, чтобы смягчить удар и взаимодействовать с математическим сообществом. После нескольких болезненных столкновений с исследователями в начале этого года компания обратилась за помощью к самим математикам, работая с недавно сформированной Консультативной группой по математике и искусственному интеллекту (AGMAI) над тем, как ответственно выпустить результаты.
AGMAI уже изложила, что, по её мнению, означаетresponsible взаимодействие. Лаборатории ИИ должны по возможности публиковать работы «которые понимает человек» или иным образом предоставлять необходимую «поддержку для дополнительных математических действий, необходимых людям, чтобы понять и усвоить генерируемые ИИ математические результаты и определить возможные их применения». Группа рекомендовала, где возможно, формализовать доказательства и публиковать, какие модели и подсказки (prompts) использовались для их создания. Она также призвала лаборатории ИИ прекратить рассматривать математические релизы как «маркетинговые инструменты для продвижения своих моделей» и «перестать тестировать сложные математические проблемы на проприетарных моделях», недоступных широкому научному сообществу.
OpenAI последовала некоторым советам группы. Компания заявила, что будет финансировать серию семинаров и конференций по своей работе в математике, чтобы помочь сообществу обработать и понять результаты, хотя не предоставила подробностей о том, как они будут выглядеть и когда пройдут. Компания также раскрыла значительно больше информации, чем в предыдущих релизах — опять же, исследователи отмечали, что это был не слишком высокий стандарт — включая то, что её модель попыталась решить более 4000 задач и что типичный результат использовал около трёх часов вычислительных ресурсов ChatGPT Pro. Она также внедрила «протоколы для пересмотра статей и цитирования» и на GitHub заявила, что «сохранит публичную историю релизов» коллекции. По состоянию на 8 октября в этой истории уже значились многочисленные исправления, включая правки более дюжины рукописей и удаление трёх статей из‑за «ошибки со знаком», которая, по заявлению компании, делает один из аргументов недействительным. OpenAI не ответила на запрос The Verge с просьбой о дальнейшем комментарии.
Это изменение адресует один ключевой источник трений с математиками — некоторые из которых говорят о некоей «паранойе» вокруг опубликованных компанией заявлений. Компания имела привычку тайно изменять пресс-релизы и статьи в ответ на критику, не делая таких изменений явно видимыми.
Однако OpenAI не последовала всем рекомендациям группы — в том числе некоторым из самых важнейших. Она не назвала модель, стоящую за релизом, и не раскрыла подсказки или полный набор задач, которые модель пыталась решить. OpenAI также, по-видимому, признала, что формализаций недостаточно — она заявила, что добавит больше формализаций по мере их получения — и что бумаги уступают идеалу, сказав, что «для будущих релизов мы намерены дальше улучшать качество статей через ссылки, математическую экспозицию и представление результатов для лучшего понимания».
Исследователи, с которыми говорил The Verge, задавались вопросом, почему OpenAI не могла улучшить качество этих статей и выражали разочарование тем, что компания, по-видимому, не удосужилась формализовать — или даже проверить, в случае отозванных статей — многие результаты заранее. Информация вроде использованных подсказок была бы также чрезвычайно полезной для снижения той нагрузки, которую многие ощущали при оценке лавины материалов, внезапно свалившейся на них.
Что ещё важнее, компания заявила, что не планирует прекращать тестирование своих моделей на математических задачах и даже предположила, что видит в этом необходимость. «Мы хотим прямо облегчить работу учёным, предоставив передовые возможности, и работаем над ответственным выпуском модели, которая породила эти результаты», — говорила она, объявляя о своих последних достижениях. «Именно поэтому важно продолжать оценивать наши внутренние форвардные модели на математике и других науках, чтобы мы могли ускорить разработку инструментов для продвижения этих областей».
После того как OpenAI опубликовала свои результаты, AGMAI охарактеризовала публикацию как «первый шаг» и вновь призвала к справедливому доступу к вычислительным ресурсам и исследовательским инструментам. Более фундаментально группа утверждала, что «будущее математических исследований не может состоять только в понимании результатов, порождаемых лабораториями ИИ».
Несмотря на сотни давно стоящих нерешённых задач, которые OpenAI утверждает, что решила, математики говорят, что предстоит невероятный объём работы. Многие оценивали, что осмысление всего того, что компания только что выпустила, может занять сообществу годы.
Армстронг сравнил внезапное появление столь большого объёма новой математики с волнением, которое могло бы последовать за кратковременным визитом инопланетян. «Если бы ИИ исчезли сейчас, как будто пришли какие‑то инопланетяне и тут же уехали, мы бы изучали это следующие 10 лет, пытаясь понять…».





