ИИ-боты игнорируют экспериментальные доказательства. Можно ли доверять им в науке?
Опубликованные результаты исследования показали, что ИИ-агенты плохо используют факты, полученные экспериментальным путём, для пересмотра своих выводов и прогнозов.
В качестве примера приводился любопытный тест. Если держать ручку горизонтально двумя руками, а затем отпустить один конец, то он под действием силы тяжести должен опуститься вниз – так считают ChatGPT, Gemini и Grok. Но когда ботам демонстрируется видео, где ручка удерживается горизонтально одной рукой, они оказываются не в состоянии скорректировать свой прогноз.
Проблема здесь не в распознавании изображения – боты прекрасно идентифицируют ручку. Дело в другом: языковые модели не способны по-настоящему «думать» о происходящих событиях так, как это делают люди. Даже если предположить, что разработчики «починят» ответ ботов конкретно про эту ручку, это не решит более общую проблему – неспособность моделей учитывать новые данные, возникающие по ходу рассуждения.
Боты пренебрегают собственными экспериментальными данными
Более строгий тест продемонстрировал неспособность ИИ-агентов мыслить, как учёные-химики, например, определяя состав неизвестных растворов. Конечно, ИИ-агенты могут запускать эксперименты – как симулированные, так и на реальном лабораторном оборудовании.
Однако, результаты теста оказались удручающими: проанализировав 619 научных задач, исследователи обнаружили, что агенты как минимум один раз проигнорировали доказательства в 68% случаев, делали ничем не подтверждённые утверждения в 53% случаев и лишь в 26% случаев действительно меняли свой вывод под влиянием противоречащих данных.
Обращает на себя внимание тот факт, что в отличие от реальных учёных, которые следуют итеративному циклу «гипотеза → эксперимент → пересмотр идеи», ИИ, даже видя явные доказательства ошибочности своей версии, отказывается менять план исследования. Но в науке нельзя доверять результату, если не доверяешь процессу, которым он получен.
Уникальность проведённого исследования состоит в том, что оно выходит за рамки обычных бенчмарков, которые оценивают только конечный ответ, — здесь впервые системно проверялся именно процесс рассуждения.
Могут ли логические модели ИИ рассуждать разумно?
Отдельный вопрос – так называемые reasoning-модели, обученные разбивать задачу на пошаговые рассуждения.
Это LLM, которые автоматически разбивают вопросы на части и следуют итеративному процессу получения окончательного ответа. Их обучают, изучая пошаговые примеры рассуждений. После обучения логические модели могут комментировать каждый этап процесса, предположительно описывающий, как они «обдумывают» ту или иную проблему. Затем они могут быть подключены к ИИ-агентам для доступа к внешним инструментам или могут продолжать своё «рассуждение» автономно.
Они действительно показывают лучшие результаты на некоторых задачах, но, по мнению специалистов, ощущение, что они «думают», — это иллюзия. Её можно сравнить с симуляцией выполнения физических упражнений, издавая характерные звуки, но при этом ничего не делая, в то время как контроль выполнения упражнения осуществляется по телефону.
Исследования показывают: модель может следовать правильному промежуточному ходу рассуждений, но дать при этом неверный итоговый ответ (или наоборот). Как ни странно, модели, обученные на бессмысленных «рассуждениях», иногда выдают правильные ответы. Всё это ставит под сомнение реальность процесса м «машинного рассуждения».
Что это значит для применения ИИ в науке
Учёные считают, что подобные ИИ-системы всё же полезны в науке, но только для чётко очерченных задач, где заранее известно, какой именно результат подразумевается. Однако, для использования в открытых исследовательских научных задачах ИИ пока не готов.
Пессимистический же взгляд вообще отторгает распространяемую технологическими компаниями идею о том, что мы наблюдаем рождение нового вида интеллекта. Отмечается, что ИИ генерирует текст исключительно на основе статистики, безо всякой проверки истинности, — и это подрывает саму архитектуру человеческого знания.
Тем не менее, понимание ограничений ИИ-агентов и reasoning-моделей, — это первый шаг к тому, чтобы совершенствовать технологию и направлять её на службу действительно значимым научным достижениям.
Источник: ScienceNews
Изображение для иллюстрации. Источник: Magnific.com

