Ещё недавно многие исследователи сомневались, способны ли современные нейросети действительно рассуждать. Затем одна модель решила известную открытую математическую задачу, другие показали результат уровня золотой медали Международной математической олимпиады. Вскоре появились работы, авторы которых усомнились уже не в способностях искусственного интеллекта, а в природе его «мышления». Учёные пытаются понять, как нейросети приходят к правильным ответам и можно ли считать этот процесс рассуждением.
Самые мощные языковые системы всё чаще выделяют в отдельный класс больших рассуждающих моделей, или Large Reasoning Models, LRM. Обычная языковая модель сразу формирует ответ, а LRM сначала генерирует длинную последовательность промежуточных шагов. Такой подход заметно повысил точность при решении сложных математических и программных задач.
Вокруг промежуточных записей разгорелся спор. Часть исследователей считает их рабочим планом, по которому модель последовательно движется к ответу. Другие полагают, что сгенерированный текст почти ничего не рассказывает о вычислениях, которые действительно привели к результату.
Человеческое рассуждение обычно представляют как логическую цепочку, где каждый вывод опирается на предыдущий. У нейросети вместо внутренней речи появляется текст, который называют цепочкой рассуждений . Запись может напоминать подробное объяснение решения, но внешняя связность ещё не доказывает, что модель выполняла вычисления именно в указанном порядке.
Эксперименты всё чаще показывают разрыв между объяснением и реальным способом получения ответа. Нейросеть иногда успешно решает задачу, хотя промежуточные шаги содержат ошибки, ненужные сведения или бессвязные фрагменты.
В одной работе корректные цепочки полностью заменили неверными и случайными последовательностями, однако модель сохранила способность решать формальные задачи. В других опытах вместо осмысленного текста использовали ряды обычных точек, а качество ответов почти не изменилось.
Отдельные исследования показали , что от 30 до 60% промежуточных шагов почти не влияют на итог. После удаления значительной части записей точность решения математических задач снижалась лишь незначительно.
Полученные результаты позволяют предположить, что цепочка рассуждений не всегда служит строгим планом. Возможно, дополнительный текст создаёт контекст, который помогает модели выбрать следующий токен, активировать нужные ассоциации и приблизиться к подходящему решению.
При этом сами возможности нейросетей продолжают расти. В 2026 году одна из моделей OpenAI за один запуск решила известную открытую математическую задачу. Совместная работа Google DeepMind и математика Теренса Тао помогла заново вывести или улучшить решения 67 задач из разных разделов математики.
Спор поэтому касается не качества результатов, а механизма их появления. Учёные выясняют, строит ли модель последовательное доказательство или находит ответ благодаря закономерностям, усвоенным во время обучения.
Одна из обсуждаемых гипотез сводится к тому, что большие рассуждающие модели по своей основе остаются языковыми моделями. Вместо строгого алгоритма система ищет подходящие связи в накопленном наборе знаний, а промежуточный текст помогает добраться до нужной области этого внутреннего представления.
Авторы гипотезы сравнивают работу модели с человеком, который тихо проговаривает обрывки слов, пытаясь что-нибудь вспомнить. Отдельные фразы могут не складываться в точное объяснение, но направляют память к верному ответу.
Такое толкование объясняет, почему ошибочные промежуточные шаги иногда заканчиваются правильным результатом. Сгенерированная цепочка может выполнять роль поисковой подсказки, а не точного отчёта о вычислениях.
Не все специалисты принимают эту версию. Представители OpenAI указывают, что современные модели заметно превосходят системы, на которых проводилась часть критических экспериментов. Разработчики считают цепочки рассуждений важной частью решения задач, хотя компании больше не раскрывают полный внутренний текст. Пользователи и исследователи обычно видят сокращённый и специально подготовленный пересказ.
Большинство участников дискуссии признаёт, что LRM заметно сильнее обычных языковых моделей на сложных задачах. Неясным остаётся источник преимущества: последовательная логика, поиск знакомых структур, дополнительный вычислительный контекст или сочетание нескольких механизмов.
Особенно остро вопрос встаёт там, где результат нельзя быстро проверить. Ошибку в программе часто обнаруживает тест, а математическое доказательство можно разобрать по шагам. В медицине, науке и юриспруденции убедительно сформулированный ложный вывод способен долго оставаться незамеченным. Поэтому одного правильного ответа недостаточно: важно понимать, насколько надёжен путь к нему.
Некоторые специалисты вспоминают ранние годы развития искусственного интеллекта. Разработчики называли отдельные функции «пониманием» и «мышлением», хотя алгоритмы выполняли гораздо более узкие операции. Яркие термины упрощали объяснение, но одновременно создавали ложное впечатление, будто внутренний механизм уже изучен.
С большими рассуждающими моделями может происходить нечто похожее. Нейросети уже справляются с задачами, которые недавно считались недоступными для машин, однако убедительного описания внутренних процессов пока нет. Чтобы называть сгенерированные цепочки настоящим рассуждением, исследователям придётся доказать, что они не просто сопровождают правильный ответ, а действительно ведут модель к нему.