AllenAI представила DiScoFormer — модель, которая по одной выборке оценивает и плотность распределения, и направление, в котором вероятность растёт быстрее всего. Это заметная исследовательская новость для мира ИИ-моделей: подход обещает меньше переобучения под каждую новую задачу и может быть полезен и в генеративных системах, и в научных расчётах.
Среди свежих малозаметных запусков выделились два проекта для тех, кто работает с ИИ-агентами не на уровне красивой демонстрации, а на уровне реальной эксплуатации. Особенно интересен ai-agent-harness: у репозитория пока 0 звёзд на GitHub, но сама идея — встроить проверки запуска, контроль дрейфа и самопроверку — выглядит полезнее многих более шумных проектов.
В этой подборке — пять очень человеческих историй о том, как ИИ встраивается не в абстрактные презентации, а в семью, поиск работы, благотворительность и малый бизнес. Самая сильная из них — история автора, который сделал для матери цифрового помощника на фоне тяжелого выгорания, показав, что ИИ все чаще становится не просто средством экономии времени, а формой заботы.
Anthropic заявила, что структуры, связанные с Alibaba, якобы провели почти 28,8 миллиона обращений к Claude через около 25 тысяч поддельных учетных записей, пытаясь вытащить ключевые возможности модели. История важна тем, что показывает: главная уязвимость современных ИИ-систем может быть не в ответах модели, а в слабой защите доступа к ней.
Дэвид Брукс пишет в The Atlantic, что ранний эффект AI может состоять не в освобождении людей от труда, а в росте плотности задач и исчезновении непрерывного сосредоточения. В таком мире выигрывают не обязательно самые умные, а те, кто сохраняет привычку думать самостоятельно и не отдаёт всё удобству.
Стартап Proception показал на Y Combinator систему с ловкой роботизированной кистью и обучающей перчаткой для обучения манипуляциям. Идея заметная, а внимания почти нет: примерно 3 голоса спустя около 11 часов после публикации.
ProofShot — открытый инструмент с GitHub, который не просто гоняет браузер, а собирает видео, снимки экрана и журналы ошибок, чтобы человек мог быстро понять, что именно сделал агент и где всё сломалось. Это особенно интересно на фоне бума агентной разработки: рынок переполнен исполнителями, а вот слой верификации до сих пор заметно слабее.
На BetaList появился Nexus — сервис, который прогоняет задачу через 10 000 ИИ-агентов, устраивает 25 раундов обсуждения и возвращает итог с вероятностями. Идея звучит нарочито масштабно, но именно поэтому проект цепляет: он продаёт не очередной чат, а управляемое коллективное рассуждение машин.