За последнюю неделю в русскоязычном YouTube хорошо видно сразу несколько линий интереса: быстрые обзоры громких новостей, большие разговоры о рисках ИИ, практические сравнения моделей и подробные разборы речевых инструментов. Ниже — семь свежих роликов на русском языке, которые действительно стоит открыть, если вы следите не только за шумом вокруг ИИ, но и за тем, как его обсуждают, проверяют и применяют на практике.
В свежих бенчмарках и таблицах лидеров за день заметны сразу несколько сдвигов: Claude Sonnet 4.5 стартовала первой в новом CodeClash, Dreamina Seedance 2.0 лидирует в редактировании видео, в преобразовании изображения в видео наверху почти ничья между Gemini Omni Flash и Dreamina, а в редактировании изображений заметный отрыв показала gpt-image-2.
В этом выпуске — семь очень земных историй о том, как люди используют ИИ не ради красивой демонстрации, а чтобы справиться с болезнью в семье, быстрее собрать продукт, вернуть себе рабочий ритм или сделать творческий проект вместе с ребёнком. Здесь меньше разговоров о больших моделях и больше живых примеров того, как ИИ встраивается в обычную человеческую жизнь.
Anthropic представила обновление Claude Opus 4.6 и делает ставку на более сильную работу модели в длинных многошаговых сценариях. Главный смысл анонса не в косметической правке, а в том, что компания усиливает Claude как рабочий инструмент для сложного программирования, проверки кода и агентных задач с длинным горизонтом.
Пять свежих русскоязычных видео об ИИ: большой разговор о пределах технологии и сознании машин, подробный вводный разбор больших языковых моделей и агентов, новостной выпуск про Claude, Codex и Qwen, а также два коротких комментария Миши Ларченко о политике вычислений и будущем работы программистов.
Свежий срез по AI-бенчмаркам показывает сразу несколько заметных перестановок: gemini-omni-flash возглавила рейтинг генерации видео, gpt-image-2 (medium) стала лидером в генерации изображений, а в задачах поиска, документов и создания сайтов по картинке сильнее всего выглядят разные версии Claude. Ниже — пять важных сдвигов, за которыми стоит следить в рейтингах Arena.
Два свежих сюжета про неудачи вокруг ИИ показывают одну и ту же проблему: там, где на кону резервные копии и данные пользователей, красивая автоматизация не заменяет проверку людьми. На этой неделе громче всего обсуждали поломку в rsync после изменений с участием Claude и историю с сервисом Lovable, где у приложения нашли набор критических уязвимостей и утечку данных 18 тысяч пользователей.
Три свежих сбоя и тревожных сюжета из Ars Technica: новая утечка данных из ChatGPT через слегка изменённую атаку, исследование о том, как часто чат-боты подталкивают людей к вредным решениям, и история Neocities, где автоматическая блокировка Bing отрезала от поиска около 1,5 миллиона сайтов. Во всех трёх случаях урок один и тот же: масштаб ИИ-систем усиливает не только пользу, но и цену каждой ошибки.
У SWE-bench появился новый живой мультимодальный рейтинг для задач разработки с визуальными элементами. На первом табло лидерство пока очень плотное: GUIRepair + o3 идёт первым с 35,98%, Refact.ai Agent держится почти вплотную с 35,59%, а OpenHands-Versa на базе Claude-Sonnet 4 следует сразу за ними с 34,43%.