Anthropic встроила внешнего оценщика внутрь процесса проверки моделей

Anthropic договорилась с Faculty, AI-подразделением Accenture: сотрудники партнёра будут работать внутри компании и заниматься краснокомандным тестированием, оценкой выравнивания и проверкой защитных механизмов моделей. По данным TechCrunch, стороны планируют инвестировать не менее 1 млрд долларов за пять лет.

Почему это важно: гонка моделей всё чаще упирается не только в результаты бенчмарков, но и в доверие к процедуре выпуска. Anthropic пробует сделать внешнюю оценку постоянным контуром разработки, а не разовой галочкой перед релизом. Если этот подход приживётся, лаборатории будут конкурировать не только качеством модели, но и качеством доказательств, что модель можно выпускать.

OpenAI заявила, что внутренняя математическая модель решила больше 100 открытых задач

OpenAI создала независимую консультативную группу по математике и AI при Институте перспективных исследований в Принстоне. Поводом стали заявления компании о том, что внутренняя модель решила более 100 открытых математических задач после резонансной публикации решения задачи Навье — Стокса.

Почему это важно: модели начинают предъявлять не просто высокие баллы на тестах, а претензии на новые научные результаты. В математике этого недостаточно объявить пресс-релизом: нужны проверка, рецензирование, воспроизводимость и понятный темп раскрытия. Поэтому независимая группа здесь важна не меньше самой модели — она должна отделить настоящий вклад от слишком быстрого маркетинга.

xAI представила Grok 4.7 для кода и долгих агентных задач

xAI выпустила Grok 4.7 как новую флагманскую модель для программирования, агентных задач и офисной работы. В анонсе компания выделяет более крупную базовую модель, более длинное обучение с подкреплением на многочасовых задачах, лучшую самопроверку, контекст 500 тыс. токенов в API и цену 2 доллара за миллион входных токенов и 6 долларов за миллион выходных токенов ниже порога 200 тыс. токенов.

Почему это важно: xAI делает ставку не только на чат, а на длительную автономную работу. Именно в таких сценариях сейчас конкурируют Claude, GPT и Gemini: модель должна не просто красиво ответить, а держать контекст, проверять себя, работать с кодом и выполнять цепочку действий без постоянной ручной правки.