В свежем срезе бенчмарков ИИ заметно сразу несколько движений: GPT-5.6 Sol мгновенно вышла в лидеры Search Arena, DeepSeek V4 Pro (High) подобралась к первой десятке Agent Arena, а новые позиции там же получили GLM 5.3 (Max), Muse Spark 1.2 (xHigh), Gemini 3.7 Flash (High) и Solar Pro 4. Это хороший день не для абстрактных обещаний, а для конкретных изменений в живых таблицах сравнения.
Главная история в свежей подборке AI-стартапов — возможный раунд General Intuition при оценке в 6 млрд долларов. Рядом — Plow Latch, который предлагает более безопасный локальный способ давать AI-агентам доступ к Mac без полного доверия устройству.
В этой подборке десять живых историй о том, как люди не просто пробуют AI, а перестраивают под него реальную работу, учёбу и личную жизнь. Здесь есть честный провал инструмента для проверки кода, ночной сбой провайдера, который вынудил собрать резервную инфраструктуру, голосовой тренажёр для собеседований, медицинский помощник для тревожных моментов и даже поэтический генератор, неожиданно ставший эмоциональной опорой для пользователей.
Иногда самые полезные идеи вокруг AI почти не видны в шуме запуска. controlZ строит слой отката и аудита для действий ИИ-агентов с нулём звёзд на GitHub, а OFFLIGHT собирает письма, чаты и задачи в исполнимый план при очень скромном публичном отклике. Обе вещи выглядят сильнее своей текущей заметности.
На этой неделе в фокусе четыре свежих проекта вокруг ИИ-агентов: Ooak Data учит агентов работать с реальными корпоративными данными и правами доступа, Dayjob автоматизирует промышленную логистику, peerd переносит полный контур агента прямо в браузер, а Berd собирает постоянное рабочее пространство для практической работы с агентами.
В этой подборке десять очень личных историй о том, как AI встраивается не в пресс-релизы, а в бытовые и рабочие переломы: кто-то спасает семейную память, кто-то собирает помощника без барьеров, кто-то ускоряет тексты, код, запуск продукта или обучение. Общая линия одна: людям нужен не «умный собеседник вообще», а инструмент, который снимает конкретное трение в их собственной жизни.
Свежая четвёрка вакансий из Wellfound показывает очень разный срез рынка ИИ: от фундаментального голосового исследования в Deepgram и защищённых государственных систем в GOVSTAR до внутренних агентных инструментов в Motive и широкой прикладной роли в EveoAI. Есть и сильные вилки, и жёсткие ограничения по стране, и случаи, где объём задач заметно шире компенсации.
Четыре почти незаметных запуска показывают, что самый интересный слой AI-рынка часто живёт вне громких рейтингов. ContextGraph пытается дать агентам структурное понимание кодовой базы, Omnara — готовый API-контур для рабочих агентов, Papers AI собирает исследовательский цикл в приватном пространстве, а Berd превращает локальную агентную работу в постоянную среду вместо ещё одной вкладки с чатом.
Magnitude привлёк 179 голосов на Hacker News с открытым фреймворком для проверки веб-приложений, где визуальные агенты берут на себя сквозные сценарии вместо хрупких заранее записанных тестов. История важна как сигнал: агентное тестирование всё заметнее движется из демонстраций в реальную инженерную практику.