Почему математический спор вышел за пределы академии
В начале сентября OpenAI заявила, что её внутренняя непубликовавшаяся модель с помощью примерно десяти тысяч взаимодействующих агентов за 88 часов нашла доказательство по уравнениям Навье-Стокса. Речь об одной из задач тысячелетия: за её решение Институт математики Клея обещает миллион долларов, а проверку, по словам президента института Мартина Бридсона, проведут намеренно неспешно.
Рукопись занимает более 160 страниц, формализацией в Lean занималась модель GPT-6 Astra ещё около 17 часов, а суммарные вычислительные затраты оценивают в миллионы долларов. Довольно быстро разговор о самой задаче уступил место спору о том, как к ней пришли.
Первая претензия: маршрут совпал с неопубликованной работой
Профессор Нью-Йоркского университета Тристан Бакмастер и математик Левант Альпёге, работающий в Anthropic, занимались уравнениями Эйлера и Навье-Стокса в личном порядке. Пятнадцатого августа они сообщили о результате по уравнениям Эйлера, промежуточном шаге к полной задаче. В работе им помогали большие языковые модели, включая системы Anthropic, а ход исследований месяцами фиксировался в OpenAI Codex.
По словам Бакмастера, компания начала собственную работу первого сентября, услышав слух о прогрессе другой группы. Позже выяснилось, что слух относился именно к Альпёге и Бакмастеру. В разговоре с представителями OpenAI математик узнал формулировку решения и увидел, что она совпадает с направлением, которое они разрабатывали. Такой маршрут, по его оценке, не выводится за несколько дней из одного условия задачи.
OpenAI настаивает: исследователи и агенты не видели чужих материалов до публикации, конкретные пользовательские данные для решения не привлекались. При этом компания оставила оговорку о том, что не может полностью исключить косвенное влияние обезличенных данных из прошлых обращений к её продуктам.
Вторая претензия: теория групп и переписка в ChatGPT
Отдельный эпизод связан с августовским результатом OpenAI по теории групп. Профессор геометрии Дрезденского технического университета Андреас Том обратил внимание, что доказательство опиралось на его совместную работу с Габором Куном. Насторожило не само обращение к прежним публикациям, а точность, с которой в компании воспроизвели метод, не казавшийся тогда ни очевидным, ни самым перспективным.
До публикации Том месяцами обсуждал с коллегой текущие исследовательские вопросы через ChatGPT. Он написал исследователям OpenAI Марку Селке и Себастьяну Бубеку и спросил прямо: попали ли эти разговоры в обучающие данные и была ли переписка доступна системе во время поиска доказательства. Ответ Селке — «что касается ваших разговоров с ChatGPT, этого не было» — математик счёл недопустимо широким и вводящим в заблуждение. Логика простая: если компания отрицает использование, пусть покажет, какие данные, версии модели и настройки аккаунта лежат в основе этого утверждения.
Ключевой аргумент Тома в том, что удаление имени пользователя ничего не меняет. Имя из переписки убрать можно, сама математическая идея при этом остаётся. Значит, заверение об отсутствии «конкретных пользовательских данных» не отвечает на вопрос, повлияли ли идеи из разговора на обучение.
Почему проверить это почти невозможно
У математиков нет инструментов, чтобы восстановить процесс обучения чужой модели: нужная информация есть только у самой компании. Требование смещается из технической плоскости в этическую. Если лаборатория заявляет, что работы и переписка не использовались, доказывать это должна она.
| Эпизод | Позиция OpenAI | Требование математиков |
|---|---|---|
| Навье-Стокс (Бакмастер, Альпёге) | Чужие материалы не смотрели, конкретные данные не привлекали | Проверить, не обучались ли модели на логах Codex |
| Теория групп (Том, Кун) | Разговоры с ChatGPT не использовались | Раскрыть данные, версии модели и настройки аккаунта |
Острее всего вопрос звучит там, где на кону приоритет. Исследователь мог обсуждать неопубликованный результат с чат-ботом, после чего материал косвенно помог улучшить модель, вступающую с ним же в гонку за первенство публикации. Без согласия автора, указания источника и признания вклада такая схема выглядит неприемлемой.
Что это меняет для отрасли
У истории два практических следствия. Первое касается учёных: если слух о чужом прогрессе запускает гонку с компанией, у которой кратно больше вычислений, делиться промежуточными результатами станут осторожнее. Математика рискует закрыться ровно тогда, когда ИИ начинает играть в ней всё более заметную роль.
Второе касается лабораторий. Требование раскрывать обучающие наборы и правила работы с пользовательскими данными перестаёт быть теоретическим. Компаниям, которые строятся на диалогах пользователей и конкурируют с их авторами, придётся заранее объяснять, где проходит граница между обезличиванием и использованием чужой идеи.
Что делать исследователям и компаниям
- Держать неопубликованное вне публичных чатов. Для закрытых результатов лучше выбирать среду с явными гарантиями по данным, а не обычный аккаунт в массовом сервисе.
- Фиксировать даты и артефакты. Логи, черновики и отметки времени помогают доказать приоритет, когда рядом работает лаборатория с несопоставимыми ресурсами.
- Требовать конкретики вместо формулировок. Ответ «данные не использовались» бесполезен без перечня наборов, версий и настроек, на которых он основан.
- Называть оговорки честно. Если косвенное влияние обезличенных данных исключить нельзя, об этом и стоит писать, а не прятать за общими словами.
Сравните модели перед запуском
Тарифы, лимиты и список моделей — на стороне сервиса. Если что-то разойдётся с описанным здесь, напишите: поправим материал и проставим новую дату проверки.
Открыть каталог моделей«SEO Разум» не продаёт доступ к API и не является поставщиком токенов.