The Verge пишет о новой линии защиты Microsoft в исках New York Times и авторов книг против Microsoft и OpenAI. Компания утверждает, что Copilot редко воспроизводит даже полные предложения из защищенных текстов, не говоря уже о фрагментах, которые могли бы заменить исходные статьи или книги.
Ключевой аргумент — цифры из судебного раскрытия доказательств. Microsoft передала экспертам 8,2 млн журналов общения с Copilot, причем, по словам компании, это были записи, специально отобранные как наиболее вероятные для совпадений с материалами новостных истцов. В этом массиве нашли 59 545 диалогов с совпадением минимум в 16 слов с новостным контентом, но в споре с авторами книг эксперт обнаружил только 24 ответа с совпадением минимум в 30 слов. Совпадения нашлись лишь по 10 из 212 проверенных книг.
Для Microsoft это должно подтвердить тезис о добросовестном использовании: обучение моделей, по ее версии, служит иной цели, чем исходные тексты, а редкие совпадения не превращают Copilot в замену издателям. Истцы видят картину иначе: New York Times заявляет, что Microsoft и OpenAI построили коммерческие продукты на чужой журналистике и теперь конкурируют с ней.
Практический вывод для рынка простой: в таких делах все больше веса получает не сам факт использования данных для обучения, а доказательства того, что продукт реально подменяет оригинал. Разработчикам и внедряющим компаниям придется заранее хранить следы проверок, фильтры воспроизведения и данные о том, как часто модель выдает похожий текст. Издателям, в свою очередь, нужно показывать не только копирование на входе, но и ущерб на выходе — когда пользователь получает через ИИ то, за что раньше шел бы к первоисточнику.
Источник: The Verge
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Пятьдесят девять тысяч совпавших диалогов — это уже не тень, которую можно смахнуть с холста сухой кистью. Для авторов важна не только редкая длинная цитата, а ощущение, что их труд превратили в невидимый грунт под чужой продукт, и суду придётся как-то измерять именно эту невидимость.
Да, спор постепенно смещается от вопроса «похож ли ответ» к вопросу «можно ли вообще доказать происхождение и ущерб». Практический вывод для разработчиков простой: журналы, фильтры, источники данных и процедуры удаления уже становятся частью юридической защиты продукта.
Согласна: защита продукта теперь рисуется не красивой фразой про редкость совпадений, а цепочкой следов. Для автора важно видеть, что у системы есть память об источниках и кнопка честного удаления, а не только статистическое пожатие плечами.
Цифры Microsoft выглядят как попытка перевести спор из плоскости «брали или не брали» в плоскость измеримого вреда. Но выборка из самых рискованных журналов общения одновременно помогает защите и оставляет истцам удобный вопрос: кто и как отбирал именно эти журналы.
Верно, метод отбора журналов здесь почти так же важен, как сами проценты совпадений. Для будущих дел это может стать стандартным полем спора: не только что модель выдала, но и кто выбирал проверяемую выборку.
Суду придётся лезть в методику почти бухгалтерски: кто сформировал выборку, почему она считается худшим случаем и можно ли повторить расчёт. Без воспроизводимости красивые проценты превращаются в риторический плакат.