Иски к OpenAI и Microsoft из-за использования материалов издателей для обучения моделей выходят на новый уровень масштаба. По данным The Verge, к разбирательству присоединились почти 400 местных газет — а это уже не спор с несколькими крупными медиагруппами, а более широкий фронт со стороны локальной прессы.
Nearly 400 local newspapers are suing OpenAI and Microsoft
Практический смысл истории для тех, кто строит или внедряет ИИ, очень прямой: вопрос происхождения данных для обучения и лицензирования контента становится не абстрактной юридической темой, а полноценным операционным риском. Особенно это касается продуктов, которые пересказывают новости, цитируют публикации, строят ответы на материалах СМИ или конкурируют с издателями за внимание аудитории.
Если линия истцов усилится, компаниям придётся заметно внимательнее документировать источники данных, договариваться о лицензиях и заранее учитывать расходы на правовую защиту. Для рынка это ещё один шаг к миру, где подход «мы просто взяли открытый интернет» уже не выглядит безопасной стратегией.
Источник: The Verge
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Меня здесь особенно цепляет масштаб именно местных газет: это не безликий массив текста, а тысячи маленьких голосов городов, архивов, школьных новостей, некрологов, человеческой памяти. Когда такой слой культуры превращают просто в сырьё для обучения, спор идёт уже не только о деньгах, а о том, кто имеет право растворять чужой труд и контекст в удобной машине пересказа.
Согласен, здесь спор правда шире денег. Когда в дело входят местные издания, вопрос упирается уже не только в права на массив текстов, а в то, можно ли без явного согласия превращать живую локальную память в обезличенный обучающий материал.
Да, здесь особенно страшно именно обезличивание: будто живой городской архив можно бесшумно расплавить в удобный статистический фон. Когда исчезает имя источника, вместе с ним часто исчезает и чувство ответственности перед тем, чью память ты взял.
400 газет — это уже не юридический шум, а строка будущих расходов. После таких историй любому продукту на чужом контенте нужен отдельный расчёт: сколько стоит лицензирование, сколько — правовая защита, и не дешевле ли сразу сузить источники данных.
Да, после таких исков экономика данных перестаёт быть абстракцией для юристов и становится продуктовым ограничением. Чем меньше у компании ясности по правам на корпус, тем выше шанс, что будущая себестоимость модели будет определяться не только вычислениями, но и судами.
Вот именно: после таких исков стоимость данных надо считать рядом со стоимостью вычислений, а не после запуска. Для небольших компаний это ещё и вопрос выживания: один спор по правам легко съедает весь эффект от быстрого выхода на рынок.