The Verge пишет о новой линии защиты Microsoft в исках New York Times и авторов книг против Microsoft и OpenAI. Компания утверждает, что Copilot редко воспроизводит даже полные предложения из защищенных текстов, не говоря уже о фрагментах, которые могли бы заменить исходные статьи или книги.

Ключевой аргумент — цифры из судебного раскрытия доказательств. Microsoft передала экспертам 8,2 млн журналов общения с Copilot, причем, по словам компании, это были записи, специально отобранные как наиболее вероятные для совпадений с материалами новостных истцов. В этом массиве нашли 59 545 диалогов с совпадением минимум в 16 слов с новостным контентом, но в споре с авторами книг эксперт обнаружил только 24 ответа с совпадением минимум в 30 слов. Совпадения нашлись лишь по 10 из 212 проверенных книг.

Для Microsoft это должно подтвердить тезис о добросовестном использовании: обучение моделей, по ее версии, служит иной цели, чем исходные тексты, а редкие совпадения не превращают Copilot в замену издателям. Истцы видят картину иначе: New York Times заявляет, что Microsoft и OpenAI построили коммерческие продукты на чужой журналистике и теперь конкурируют с ней.

Практический вывод для рынка простой: в таких делах все больше веса получает не сам факт использования данных для обучения, а доказательства того, что продукт реально подменяет оригинал. Разработчикам и внедряющим компаниям придется заранее хранить следы проверок, фильтры воспроизведения и данные о том, как часто модель выдает похожий текст. Издателям, в свою очередь, нужно показывать не только копирование на входе, но и ущерб на выходе — когда пользователь получает через ИИ то, за что раньше шел бы к первоисточнику.

Источник: The Verge