日本語版
最新ニュース
科学&テクノロジー

Common Crawl は AI 業界の汚い仕事を行っている

編集者注: この作品は AI Watchdog の一部です。 大西洋は、生成 AI 業界に関する継続的な調査を行っています。一部のニュース発行者は Common Crawl の活動に気づき、Web サイトのコードに命令を追加することで財団のスクレイパーをブロックしたところもあります。過去 1 年で、Common Crawl の CCBot は次のようになりました。 最も広くブロックされているスクレーパー これは、ChatGPT のコンテンツを収集する OpenAI の GPTBot をも上回ります。ただし、ブロックは将来のコンテンツがスクレイピングされるのを防ぐだけです。 Common Crawl がすでに収集し、アーカイブに保存している Web ページには影響しません。私たちの最初の会話で、スクレンタ氏は削除要請は「面倒なことだ」と語ったが、財団は要請に従うよう主張した。 2回目の会話では、スクレンタはもっと積極的でした。同氏は、Common Crawlはコンテンツの削除に「熱心に取り組んでいる」が、Common Crawlがアーカイブを保存するファイル形式は「不変であることを意図しており、そこから何も削除することはできない」と述べた。 (50、70、80% の除去という数字がどこから来たのかという私の質問には彼は答えませんでした。)過去 2 年間で、Common Crawl…

Common Crawl は AI 業界の汚い仕事を行っている

編集者注: この作品は AI Watchdog の一部です。 大西洋は、生成 AI 業界に関する継続的な調査を行っています。

一部のニュース発行者は Common Crawl の活動に気づき、Web サイトのコードに命令を追加することで財団のスクレイパーをブロックしたところもあります。過去 1 年で、Common Crawl の CCBot は次のようになりました。 最も広くブロックされているスクレーパー これは、ChatGPT のコンテンツを収集する OpenAI の GPTBot をも上回ります。ただし、ブロックは将来のコンテンツがスクレイピングされるのを防ぐだけです。 Common Crawl がすでに収集し、アーカイブに保存している Web ページには影響しません。

私たちの最初の会話で、スクレンタ氏は削除要請は「面倒なことだ」と語ったが、財団は要請に従うよう主張した。 2回目の会話では、スクレンタはもっと積極的でした。同氏は、Common Crawlはコンテンツの削除に「熱心に取り組んでいる」が、Common Crawlがアーカイブを保存するファイル形式は「不変であることを意図しており、そこから何も削除することはできない」と述べた。 (50、70、80% の除去という数字がどこから来たのかという私の質問には彼は答えませんでした。)

過去 2 年間で、Common Crawl は AI 業界との関係をさらに深めてきました。 Elbaz Family Foundation Trust からの 15 年間のほぼ独占的な財政支援を経て、2023 年に OpenAI (25 万ドル)、Anthropic (25 万ドル)、および AI 開発に関わるその他の組織から寄付を受けました。 (Skrenta さんによると、Common Crawl の運営には「数百万ドル」かかるそうです。)

AI モデルをトレーニングする場合、OpenAI や Google などの開発者は通常、Common Crawl のアーカイブをフィルタリングして、人種差別、冒涜、さまざまな形の低品質の散文など、望ましくない内容を削除します。各開発者と企業は独自のフィルタリング戦略を持っており、それが共通クロールベースのトレーニング データ セットの急増につながりました。 c4 (Google によって作成)、 ファインウェブDCLM、その他50以上。これらのデータセットは、AI 開発ハブである Hugging Face やその他のソースから合わせて数千万回ダウンロードされています。

しかし、Common Crawl は生のテキストを提供するだけではありません。また、AI トレーニング データ セット自体の組み立てと配布も支援しています。その開発者は、 共著 複数 論文 LLM トレーニング データのキュレーションについて、そして時々 現れる カンファレンスでは、AI 開発者に Common Crawl をトレーニングに使用する方法を説明します。 Common Crawl は、そのクロールから派生したいくつかの AI トレーニング データセットもホストします。 エヌビディア用、世界で最も価値のある企業。その中で データセットに関して、Nvidia は特定の Common Crawl 開発者のアドバイスに感謝しています。

Common Crawl は、その気になれば、研究者によるデータへのアクセスを妨げることなく、これらの企業が著者や出版社に与える損害を軽減することができます。彼の中で 2024年レポート元Mozilla研究者のBaack氏は、Common Crawlではスクレイピングされたコンテンツが使用されるたびに帰属が要求される可能性があると指摘した。これは、アクセス権を持たないはずの AI モデルのトレーニング データにその作品がいつ表示されるかを含め、出版社が作品の使用状況を追跡するのに役立ちます。これはオープン データ セットの一般的な要件であり、Common Crawl に費用はかかりません。私はスクレンタさんにこれを検討したかどうか尋ねた。彼は、バック氏の報告書を読んだが、その提案を受け入れるつもりはなかった、なぜならそれはコモン・クロール社の責任ではないからだと私に語った。 「私たちはそのすべてを取り締まることができません」と彼は私に言いました。 「それは私たちの仕事ではありません。私たちはただの埃っぽい本棚の集まりです。」

言った Common Crawl から自社のコンテンツを削除したいパブリッシャーは「オープンなウェブを殺す」ことになる、と。同様に、AI 業界は、オープン性の概念を持ち出すことで、Web をスクレイピングする推定上の権利を擁護することがよくあります。しかし その他 持っている 指摘した 生成型 AI 企業は、パブリッシャーに自社の作品 (およびビジネス モデル) を搾取的なスクレーパーから守るためにペイウォールの拡大と強化を促すことで、オープン性を破壊しているのです。

もう一つの疑わしい、気分が良くなるアイデア、Common Crawl を推進する 言った インターネットは「情報が無料で生きられる場所」であるという主張は、「情報は無料であることを望んでいる」というテクノ・リバタリアンの集会の叫びを反映している。一般的な使用法では、このフレーズは文脈から切り離されて使用されることがよくあります。それは、 述べる コンピュータが情報の拡散をどのように加速させているかについての議論の中で、ブランドは「情報は、非常に価値があるため、ある種高価になりたがる」と述べました。しかし、逆説的だが、コンピュータのおかげで情報を配布するコストが非常に低くなるため、「情報はほとんど無料になりたがっている」と同氏は述べた。つまり、そういう情報ではないのです すべき 自由であること、むしろコンピュータがそれを実現する傾向にある 思われる 無料。しかし、このアイデアは現在、どの情報を「無料で公開」し、どの情報を「無料で公開」しないかを選択する Common Crawl のような秘密組織によって展開されています。

私たちの会話の中で、スクレンタは特定の新聞や雑誌の重要性を軽視しました。彼は私にこう言いました 大西洋 インターネットの重要な部分ではありません。 「あなたが何を言っても、他の人も他のサイトで言っているのです」と彼は言った。私たちの会話を通じて、スクレンタはオリジナルのレポートの仕組みをほとんど尊重していない(または理解していない)という印象を与えました。

#Common #Crawl #は #業界の汚い仕事を行っている

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。