
Компания Google выпустила крупное обновление Gemini 3 Deep Think, платформу на базе рассуждающего искусственного интеллекта, созданную для решения современных задач в науке и инженерии. Разработка Gemini 3 Deep Think велась совместно с учёными: сервис направлен на решение сложных исследовательских задач, где элементы могут не иметь чётких ограничений или единственно верного решения, а сопутствующие данные — быть неполными или несистематизированными.
Deep Think в новой версии ориентирован на практическое применение: режим доступен прямо в приложении Gemini, однако им смогут воспользоваться лишь подписчики Google AI Ultra; компания также впервые откроет доступ к сервису через API Gemini — инженерам, исследователям и предприятиям потребуется подать заявку. В тестах платформа продемонстрировала впечатляющие результаты.
В одном из задач Humanity’s Last Exam Gemini 3 Deep Think набрал 48,4 % без применения внешних инструментов; в бенчмарке ARC-AGI-2 достиг рекордного 84,6 %. В программировании на Codeforces рейтинг Эло составил 3455; в задачах Международной математической олимпиады 2025 года система показала уровень золотой медали, сопоставимый с результатами по задачам олимпиады по химии и физике. В тесте CMT-Benchmark режим продемонстрировал высокий уровень владения теоретической физикой — 50,5 %.
По данным разработчиков, Gemini 3 Deep Think стала основой ИИ-агента Aletheia, созданного в лаборатории Google DeepMind. Алетея включает инструмент проверки гипотез на естественном языке для выявления слабых мест предлагаемого решения и поддерживает итеративный процесс генерации и корректировки выводов. Важно, что агент может признать неспособность дать ответ. Для решения сложных задач он обращается к поиску Google и веб‑навигации: при подготовке обзоров по литературе он не выдает фиктивных ссылок и стремится минимизировать неточности в расчётах.
Разработчики разделили достижения Aletheia на пять уровней. В автономном режиме ИИ‑агент попробовал решить три открытые задачи, сформулированные математиком Палом Эрдёшем — в оценке по уровню это ноль, то есть минимальная новизна. Он также предложил решение ещё одной задачи из того же набора и вышел на первый уровень, или минимальную новизну. На втором уровне, «пригодном для публикации», Aletheia показал результаты в автономном режиме, в сотрудничестве с человеком и в режиме вспомогательного инструмента. Третий уровень («значительный прорыв») и четвёртый («знаменательный прорыв») агенту пока не покорились.
По заданию инженеров Aletheia проанализировал 700 неразрешённых до сих пор задач Эрдёша и нашёл решения к 13 из них. Из них у 9 задач уже существовало решение, а действительно впервые решёнными оказались только 4 задачи. Из 212 предложенных агентом решений лишь 6,5 % оказались содержательно корректными; остальные решения имели фундаментальные недостатки (68,5 %) или неверно трактовали формулировку задач (31,5 %).





