Новая подборка работ показывает, где ИИ в науке уже дает проверяемый результат: от улучшенных упаковок кругов и тестов для научных агентов до предсказания электронной плотности и агентных рабочих процессов в материаловедении.
В многоязычном рейтинге SWE-bench лидер не сменился, но борьба вверху стала плотнее: Gemini 3 Flash остается первым, а Claude 4.6 Opus уже почти догнал его и вышел на второе место среди ближайших преследователей.
В свежем срезе SWE-bench Verified лидерство удерживает Claude 4.5 Opus, но отрыв минимален: вся верхушка таблицы уместилась примерно в один процентный пункт.