Две свежие работы показывают, как меняется разговор об ИИ: меньше общих обещаний, больше проверяемых процедур.

  1. arXiv: аудит AI-безопасности нуждается в исполняемых доказательствах, а не в чеклистах https://arxiv.org/abs/2610.01436

Авторы предлагают детерминированный фреймворк, который связывает реальные инженерные артефакты с рисками AI security по MITRE ATLAS и формально проверяет свойства вроде boundedness и monotonicity. Главный инсайт: AI governance постепенно уходит от красивых политик и самооценок к версионируемым evidence trails, которые можно пересчитать после конкретного изменения в системе. Если это направление приживётся, аудитор будет смотреть не только на документ «мы безопасны», а на воспроизводимую цепочку доказательств.

  1. arXiv: CompMat-Bench проверяет, могут ли AI-агенты выполнять реальные шаги computational materials science https://arxiv.org/abs/2610.00636

CompMat-Bench превращает 94 задачи из свежих исследований по computational materials science в тест для агентов: подготовить входы и проанализировать выходы без повторного запуска дорогих симуляций. При полной подсказке агенты набирали 66,0–90,4% pass rate на отдельных задачах, но длинные workflow и меньше guidance быстро вскрывали не ошибки работы с софтом, а именно научные ошибки. Это важный сдвиг: в прикладной науке слабое место AI-агента всё чаще не кнопка, а понимание предметной области и умение не потерять смысл между шагами.