OpenAI расширила линейку GPT-6: новые Sol и Luna обещают меньше ошибок, более дешёвый доступ через API и постепенное появление в ChatGPT, Codex и платных рабочих аккаунтах. Это прямой ответ на гонку с Anthropic за более надёжные и доступные модели.
TechCrunch пишет, что Anthropic и OpenAI поддерживают более глубокий доступ внешних оценщиков к разработке передовых моделей. Для команд это означает сдвиг от разовых проверок перед запуском к постоянной проверке журналов, промежуточных версий и внутренних документов.
BenchLM обновил таблицу SWE-bench Pro: Claude Opus 5.5 вышел на первое место с 89,9%, заметно опередив Claude Fable 5.1 и Claude Mythos 5. Это сильный результат для задач по реальным репозиториям, но его нужно читать с оговоркой: многие строки в таблице основаны на отчётах самих поставщиков.
Google и Anthropic продолжают дробить линейки моделей под разные задачи: Gemini получает отдельные быстрые и защитные варианты, а Opus 5.5 обещает более низкую цену при качестве ближе к старшим моделям Anthropic.
The Register критикует идею особого государственного прикрытия для крупных ИИ-лабораторий: если компании хотят отношения как к системно важным игрокам, им придётся отвечать за сбои агентов, слабые песочницы и непрозрачные меры контроля.
Nscale выходит к публичным инвесторам с бизнесом, завязанным на крупных покупателях вычислений. В том же наборе новостей — рост Snorkel AI, недовольство дата-центрами, заседание Совбеза ООН по ИИ и ценовая гонка моделей Anthropic.
В выпуске — три заметных сигнала рынка моделей: Anthropic делает внешнюю оценку постоянной частью разработки, OpenAI выносит математические заявления на независимую проверку, а xAI выпускает Grok 4.7 для кода и длинных агентных задач.
TechCrunch описывает, как разговор о замедлении разработки самых мощных моделей ИИ переходит от общих принципов к вопросу контроля: кто именно обязан притормозить, при каких условиях и кто это проверит.
Dario Amodei предложил план, по которому разработчики передовых моделей заранее доказывают безопасность выпусков и замедляют гонку, если риски становятся слишком высокими. Для команд это означает больше проверок, журналов решений и готовых аргументов для клиентов и регуляторов.