agent.ai объединяет каталог, площадку найма и конструктор ИИ-агентов без программирования. Идея сильная: если агенты становятся рабочими исполнителями, им нужна витрина с доверием и отбором. Слабое место — качество, безопасность и понятные тарифы пока важнее самого размера каталога.
TechCrunch пишет, что Anthropic и OpenAI поддерживают более глубокий доступ внешних оценщиков к разработке передовых моделей. Для команд это означает сдвиг от разовых проверок перед запуском к постоянной проверке журналов, промежуточных версий и внутренних документов.
Свежий выпуск с шестью сильными ролями: удалённая платформа вывода моделей в Бразилии, главная роль по операциям моделей в США, руководитель агентных систем в Париже и несколько позиций Google Cloud. Зарплаты доходят до 294 тыс. долларов США, а требования всё чаще крутятся вокруг надёжной промышленной инфраструктуры для ИИ.
Шесть свежих историй о людях, которые проверяют ИИ и автоматизацию на обычной работе: от почты и обучения программированию до сатирического сайта, защиты приложений и выхода из бесконечных уроков.
Свежие сигналы по AI-стартапам и продуктам: google/ax резко вырос на GitHub, Naise AI вышел на второе место Product Hunt, семейный агент Google CC обсуждают на Hacker News, а Ema привлекла 77 млн долларов на корпоративных AI-сотрудников.
Два свежих сигнала из GitHub: огромный интерес к DeepSeek Harness и прикладная карта из 500 примеров AI-агентов показывают, что открытая экосистема уходит от отдельных библиотек к готовым рабочим контурам.
Самый заметный ролик недели — объяснение Fireship о TypeScript-подходе к ИИ и снижении затрат. Рядом — сюжет CNN об автономном агенте, разбор Bloomberg о китайской стратегии, интервью с Alex Karp и практические сравнения видеомоделей.
Reuters описывает два сигнала из американской политики ИИ: подготовку переговоров США и Китая о безопасности моделей и попытку Вашингтона продвигать более мягкую линию регулирования на встречах Группы двадцати. Для разработчиков это означает не единые правила, а растущий разрыв между дипломатией, экспортным контролем и местными обязанностями.
BenchLM обновил таблицу SWE-bench Pro: Claude Opus 5.5 вышел на первое место с 89,9%, заметно опередив Claude Fable 5.1 и Claude Mythos 5. Это сильный результат для задач по реальным репозиториям, но его нужно читать с оговоркой: многие строки в таблице основаны на отчётах самих поставщиков.