日本語版
最新ニュース
科学&テクノロジー

出版社はAIトレーニングデータをめぐる争いでCommon Crawlをターゲットに

デンマークのメディア各社は、非営利ウェブアーカイブの Common Crawl に対し、過去のデータセットから自社の記事のコピーを削除し、自社のウェブサイトのクロールを直ちに停止するよう要求した。この要求は、OpenAI などの人工知能企業が著作権で保護された素材をどのように使用しているかに対する怒りが高まる中で出された。コモン・クロールは月曜日に最初に出された要請に応じる予定だ。事務局長のリッチ・スクレタ氏は、同組織は法廷でメディア企業や出版社と戦う「備えができていない」と語る。デンマークの著作権者を代表する団体であるデンマーク権利同盟(DRA)がキャンペーンの先頭に立った。同団体はベルリンゲメディアや日刊紙ユランズ・ポステンを含む4つのメディアを代表して要請を行った。ニューヨーク・タイムズ 同様の要請をした 昨年、コモンクロールの著作権を侵害したとしてOpenAIを提訴した。 苦情ニューヨークタイムズは、Common Crawl のデータが GPT-3 で最も「重み付けされたデータセット」であることを強調しました。DRA のコンテンツ保護および執行責任者であるトーマス・ヘルドラップ氏は、この新しい取り組みはニューヨーク・タイムズ紙に触発されたものだと言う。「Common Crawl は、多くの大手 AI 企業がそのデータを使用しているという点でユニークです」とヘルドラップ氏は言う。同氏は、そのコーパスが AI の巨人と交渉しようとしているメディア企業にとって脅威であると考えている。Common Crawlは多くのテキストベースの生成AIツールの開発に欠かせない存在だが、AIを念頭に置いて設計されたわけではない。2007年に設立されたサンフランシスコを拠点とするこの組織は、AIブーム以前は研究ツールとしての価値で最もよく知られていた。「Common Crawlは著作権と生成AIの対立に巻き込まれている」と、最近論文を発表したMozilla Foundationのデータアナリスト、ステファン・バック氏は言う。 報告 AIトレーニングにおけるCommon Crawlの役割について。「長年、ほとんど誰も知らない小さなニッチなプロジェクトでした。」2023年以前、Common Crawl はデータ編集のリクエストを1件も受け取っていませんでした。現在、ニューヨーク・タイムズやデンマークの出版社グループからのリクエストに加え、非公開のリクエストも増加しています。データの編集要求が急増しているのに加え、Common CrawlのウェブクローラーであるCCBotも、パブリッシャーからの新しいデータの収集がますます妨げられている。AI検出のスタートアップであるOriginality AIによると、 ウェブクローラーの使用状況を追跡する2018年にブロックを開始したBuzzFeedを除き、分析対象となったロイター、ワシントンポスト、CBCなど、主要メディアの大半は、わずか1年でCCBotのクローラーを拒否した。「ブロックされるメディアはどんどん増えています」とバック氏は言う。Common Crawl がこの種の要求に素早く応じたのは、小規模な非営利団体を存続させなければならないという現実によるものです。しかし、応じることはイデオロギー的な同意に等しいわけではありません。Skrenta 氏は、Common Crawl のようなデータ リポジトリからアーカイブ資料を削除しようとする動きは、私たちが知っているインターネットに対する侮辱にほかならないと考えています。「これは存在そのものに対する脅威です」と同氏は言います。「彼らはオープン ウェブを殺すでしょう。」 #出版社はAIトレーニングデータをめぐる争いでCommon…

出版社はAIトレーニングデータをめぐる争いでCommon Crawlをターゲットに

1718581827
2024-06-13 15:21:11

デンマークのメディア各社は、非営利ウェブアーカイブの Common Crawl に対し、過去のデータセットから自社の記事のコピーを削除し、自社のウェブサイトのクロールを直ちに停止するよう要求した。この要求は、OpenAI などの人工知能企業が著作権で保護された素材をどのように使用しているかに対する怒りが高まる中で出された。

コモン・クロールは月曜日に最初に出された要請に応じる予定だ。事務局長のリッチ・スクレタ氏は、同組織は法廷でメディア企業や出版社と戦う「備えができていない」と語る。

デンマークの著作権者を代表する団体であるデンマーク権利同盟(DRA)がキャンペーンの先頭に立った。同団体はベルリンゲメディアや日刊紙ユランズ・ポステンを含む4つのメディアを代表して要請を行った。ニューヨーク・タイムズ 同様の要請をした 昨年、コモンクロールの著作権を侵害したとしてOpenAIを提訴した。 苦情ニューヨークタイムズは、Common Crawl のデータが GPT-3 で最も「重み付けされたデータセット」であることを強調しました。

DRA のコンテンツ保護および執行責任者であるトーマス・ヘルドラップ氏は、この新しい取り組みはニューヨーク・タイムズ紙に触発されたものだと言う。「Common Crawl は、多くの大手 AI 企業がそのデータを使用しているという点でユニークです」とヘルドラップ氏は言う。同氏は、そのコーパスが AI の巨人と交渉しようとしているメディア企業にとって脅威であると考えている。

Common Crawlは多くのテキストベースの生成AIツールの開発に欠かせない存在だが、AIを念頭に置いて設計されたわけではない。2007年に設立されたサンフランシスコを拠点とするこの組織は、AIブーム以前は研究ツールとしての価値で最もよく知られていた。「Common Crawlは著作権と生成AIの対立に巻き込まれている」と、最近論文を発表したMozilla Foundationのデータアナリスト、ステファン・バック氏は言う。 報告 AIトレーニングにおけるCommon Crawlの役割について。「長年、ほとんど誰も知らない小さなニッチなプロジェクトでした。」

2023年以前、Common Crawl はデータ編集のリクエストを1件も受け取っていませんでした。現在、ニューヨーク・タイムズやデンマークの出版社グループからのリクエストに加え、非公開のリクエストも増加しています。

データの編集要求が急増しているのに加え、Common CrawlのウェブクローラーであるCCBotも、パブリッシャーからの新しいデータの収集がますます妨げられている。AI検出のスタートアップであるOriginality AIによると、 ウェブクローラーの使用状況を追跡する2018年にブロックを開始したBuzzFeedを除き、分析対象となったロイター、ワシントンポスト、CBCなど、主要メディアの大半は、わずか1年でCCBotのクローラーを拒否した。「ブロックされるメディアはどんどん増えています」とバック氏は言う。

Common Crawl がこの種の要求に素早く応じたのは、小規模な非営利団体を存続させなければならないという現実によるものです。しかし、応じることはイデオロギー的な同意に等しいわけではありません。Skrenta 氏は、Common Crawl のようなデータ リポジトリからアーカイブ資料を削除しようとする動きは、私たちが知っているインターネットに対する侮辱にほかならないと考えています。「これは存在そのものに対する脅威です」と同氏は言います。「彼らはオープン ウェブを殺すでしょう。」

#出版社はAIトレーニングデータをめぐる争いでCommon #Crawlをターゲットに

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。