日本語版
最新ニュース
科学&テクノロジー

AIツールが子供の実際の画像で密かにトレーニング中

ブラジルの子供たちの画像170枚以上と個人情報が、本人の承諾なしにオープンソースのデータセットから収集され、 AIの訓練に使用は、 新しいレポート ヒューマン・ライツ・ウォッチが月曜日に発表した。報告書によると、これらの画像は2023年という最近までに投稿されたコンテンツから、また1990年代半ばまで遡って収集されたもので、インターネットユーザーがそのコンテンツがAIの訓練に利用されると予想するよりずっと前のことだ。ヒューマン・ライツ・ウォッチは、これらの子供たちの個人情報と写真へのURLリンクが、AIスタートアップ企業の訓練データとしてよく使われているデータセット「LAION-5B」に含まれていたと主張している。「彼らのプライバシーが侵害されるのは、まず写真がスクレイピングされ、これらのデータセットに取り込まれたときです。そして、これらのAIツールはこのデータで訓練され、子供たちのリアルな画像を作成することができます」と、ヒューマン・ライツ・ウォッチの子供の権利と技術の研究者であり、これらの画像を発見した研究者であるヘ・ジョン・ハン氏は言う。「この技術は、自分の写真や動画をオンラインに載せている子供は誰でも危険にさらされるような方法で開発されています。なぜなら、悪意のある人物がその写真を撮り、これらのツールを使用して好きなように操作できるからです。」LAION-5Bは、ウェブからスクレイピングして作成され研究者に公開されたデータリポジトリであるCommon Crawlに基づいており、Stability AIのStable Diffusion画像生成ツールを含むいくつかのAIモデルのトレーニングに使用されています。ドイツの非営利団体LAIONによって作成されたこのデータセットは公開されており、同団体のWebサイトによると、現在58億5000万組以上の画像とキャプションが含まれています。研究者が見つけた子供の画像は、ママのブログや個人ブログ、マタニティブログ、子育てブログからのものだったほか、家族や友人と共有するためにアップロードされたと思われる、視聴回数の少ないYouTube動画の静止画でもあった。「投稿された場所の文脈だけを見ても、彼らは期待とある程度のプライバシーを享受していた」とヘイ氏は言う。「これらの画像のほとんどは、オンラインで逆画像検索を行っても見つけることは不可能だった。」LAIONの広報担当者ネイト・タイラー氏は、同組織はすでに対策を講じていると述べた。「LAION-5Bは、データセット内に公開ウェブ上の違法コンテンツへのリンクがあることが判明したスタンフォード大学の報告を受けて削除されました」と同氏は述べ、同組織は現在「インターネット・ウォッチ財団、カナダ児童保護センター、スタンフォード大学、ヒューマン・ライツ・ウォッチと協力して、違法コンテンツへの既知の言及をすべて削除している」と付け加えた。YouTubeの 利用規約 特定の状況を除いてスクレイピングを許可していないため、これらの事例はポリシーに違反しているようだ。「YouTube コンテンツの無許可のスクレイピングは利用規約違反であることは明らかです」と YouTube の広報担当者ジャック・マオン氏は言う。「この種の不正行為に対しては引き続き措置を講じていきます。」12月中、 スタンフォード大学の研究者らは LAION-5Bが収集したAIトレーニングデータに児童性的虐待の素材が含まれていた。米国の学校の生徒の間でも、露骨なディープフェイクの問題が増加しており、 クラスメイト、特に女子をいじめるヘイ氏は、子どもの写真を使ってCSAMを生成するだけでなく、データベースが位置情報や医療データなどの機密情報を明らかにする可能性があることを懸念している。2022年、米国を拠点とするアーティスト LAIONデータセットで自分の画像を見つけた、そしてそれが彼女の個人的な医療記録からのものであることに気づいた。 #AIツールが子供の実際の画像で密かにトレーニング中

AIツールが子供の実際の画像で密かにトレーニング中

1718027731
2024-06-10 04:01:00

ブラジルの子供たちの画像170枚以上と個人情報が、本人の承諾なしにオープンソースのデータセットから収集され、 AIの訓練に使用は、 新しいレポート ヒューマン・ライツ・ウォッチが月曜日に発表した。

報告書によると、これらの画像は2023年という最近までに投稿されたコンテンツから、また1990年代半ばまで遡って収集されたもので、インターネットユーザーがそのコンテンツがAIの訓練に利用されると予想するよりずっと前のことだ。ヒューマン・ライツ・ウォッチは、これらの子供たちの個人情報と写真へのURLリンクが、AIスタートアップ企業の訓練データとしてよく使われているデータセット「LAION-5B」に含まれていたと主張している。

「彼らのプライバシーが侵害されるのは、まず写真がスクレイピングされ、これらのデータセットに取り込まれたときです。そして、これらのAIツールはこのデータで訓練され、子供たちのリアルな画像を作成することができます」と、ヒューマン・ライツ・ウォッチの子供の権利と技術の研究者であり、これらの画像を発見した研究者であるヘ・ジョン・ハン氏は言う。「この技術は、自分の写真や動画をオンラインに載せている子供は誰でも危険にさらされるような方法で開発されています。なぜなら、悪意のある人物がその写真を撮り、これらのツールを使用して好きなように操作できるからです。」

LAION-5Bは、ウェブからスクレイピングして作成され研究者に公開されたデータリポジトリであるCommon Crawlに基づいており、Stability AIのStable Diffusion画像生成ツールを含むいくつかのAIモデルのトレーニングに使用されています。ドイツの非営利団体LAIONによって作成されたこのデータセットは公開されており、同団体のWebサイトによると、現在58億5000万組以上の画像とキャプションが含まれています。

研究者が見つけた子供の画像は、ママのブログや個人ブログ、マタニティブログ、子育てブログからのものだったほか、家族や友人と共有するためにアップロードされたと思われる、視聴回数の少ないYouTube動画の静止画でもあった。

「投稿された場所の文脈だけを見ても、彼らは期待とある程度のプライバシーを享受していた」とヘイ氏は言う。「これらの画像のほとんどは、オンラインで逆画像検索を行っても見つけることは不可能だった。」

LAIONの広報担当者ネイト・タイラー氏は、同組織はすでに対策を講じていると述べた。「LAION-5Bは、データセット内に公開ウェブ上の違法コンテンツへのリンクがあることが判明したスタンフォード大学の報告を受けて削除されました」と同氏は述べ、同組織は現在「インターネット・ウォッチ財団、カナダ児童保護センター、スタンフォード大学、ヒューマン・ライツ・ウォッチと協力して、違法コンテンツへの既知の言及をすべて削除している」と付け加えた。

YouTubeの 利用規約 特定の状況を除いてスクレイピングを許可していないため、これらの事例はポリシーに違反しているようだ。「YouTube コンテンツの無許可のスクレイピングは利用規約違反であることは明らかです」と YouTube の広報担当者ジャック・マオン氏は言う。「この種の不正行為に対しては引き続き措置を講じていきます。」

12月中、 スタンフォード大学の研究者らは LAION-5Bが収集したAIトレーニングデータに児童性的虐待の素材が含まれていた。米国の学校の生徒の間でも、露骨なディープフェイクの問題が増加しており、 クラスメイト、特に女子をいじめるヘイ氏は、子どもの写真を使ってCSAMを生成するだけでなく、データベースが位置情報や医療データなどの機密情報を明らかにする可能性があることを懸念している。2022年、米国を拠点とするアーティスト LAIONデータセットで自分の画像を見つけた、そしてそれが彼女の個人的な医療記録からのものであることに気づいた。

#AIツールが子供の実際の画像で密かにトレーニング中

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。