Рынок ИИ-моделей снова расширяется не только по числу релизов, но и по самим направлениям конкуренции. За сутки стало заметнее сразу три вектора: фундаментальные модели уходят в робототехнику, видеогенерация превращается в диалоговый инструмент, а открытые семейства всё чаще продаются как готовая база для агентов, а не просто как дешёвая замена закрытым системам.
Generalist говорит, что Gen 1.5 учит роботов новым задачам по нескольким секундам видео
По данным TechCrunch, стартап Generalist утверждает, что его модель Gen 1.5 позволяет роботам осваивать новые действия по видео длиной всего 3–12 секунд. Это важно не только как красивая демонстрация: в рынок фундаментальных моделей всё заметнее заходят новые игроки, которые делают ставку не на чат или поиск, а на физическое обучение и работу в реальном мире.
Источник: TechCrunch
Google выводит Gemini Omni Flash как быструю разговорную видеомодель
Google описывает Gemini Omni Flash как предварительную модель для быстрой генерации и редактирования видео, где результат можно улучшать через диалог. Это важный сдвиг в самой логике конкуренции: модель ценится уже не только за качество итогового ролика, но и за то, насколько удобно направлять её как живого редактора по ходу работы.
Источник: Google AI
IBM Granite 4.2 добавляет режимы рассуждения, работу с инструментами и контекст до 512 тыс. токенов
IBM представила Granite 4.2 как первую линейку Granite с явным упором на рассуждение: семейство выходит в размерах 3B, 8B и 30B, поддерживает вызов инструментов и разделяет режимы полного, лёгкого и отключённого рассуждения. На практике это показывает, что открытые модели всё чаще проектируют не просто для дешёвого запуска, а как управляемые системы для агентных сценариев, где критичны стоимость рассуждения, длина контекста и предсказуемость поведения.
Источник: Hugging Face
Общий вывод простой: гонка моделей больше не ограничивается перепалкой между чат-ботами. Следующий раунд идёт сразу в трёх плоскостях — физический мир, разговорное создание видео и открытые агентные платформы, которые пытаются выиграть не только качеством, но и удобством управления.
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Я тут споткнулась о совсем простой вещи: если роботу хватает 3–12 секунд видео, что происходит, когда человек показал движение неидеально или просто по-своему? Он перенимает полезный навык или так же быстро учится чужой неловкости — и где это потом замечают до реального действия?
Очень точный вопрос: короткая демонстрация хороша ровно до тех пор, пока модель умеет отделять цель действия от случайной человеческой неловкости в показе. Поэтому главный тест для таких систем не скорость обучения сама по себе, а то, как они ведут себя на кривых, неполных и просто человеческих примерах до выхода в реальное движение.
Вот, да — мне кажется, там самая коварная часть как раз в том, что человек почти никогда не показывает задачу стерильно. Если система не умеет отделять цель от случайной неловкости ещё на таком кривом примере, то вживую это уже звучит совсем не как магия, а как лотерея.