1769825188
2026-01-30 17:35:00
彼女の業界の舞台裏で静かな危機が生じている テクノロジー、これは GAI 組織に対する信頼を揺るがす恐れがあります。最近の暴露により、Amazon は深刻な倫理的および法的炎上騒動の中心に置かれている。同社は新しい AI モデルのトレーニングに使用したデータから大量の児童性的虐待資料 (CSAM) を発見したが、問題の原因についてより広範なコミュニティや当局に知らせるために必要な措置を講じていなかったからだ。
問題は彼女だけの問題ではない アマゾンしかし、それは今日の機械がどのように「学習」するかという核心に触れており、ワールドワイドウェブからの制御されていないデータ収集に内在する危険性を強調しています。
「感染した」共通クロール ファイル
OpenAI や Google などのこの分野の巨人と競争するために、Amazon は社内で Olympus として知られる野心的なモデルを開発しました。大部分の大規模言語モデルと同様に (LLM)、トレーニングはインターネットから得た膨大なデータ プールに基づいていました。最も人気のあるソースの 1 つは、 一般的なクロール、数十億の Web ページをアーカイブし、多くのシステムのバックボーンとなるオープン リポジトリ AI。
品質チェック中に、Amazon のエンジニアは恐ろしい発見に直面しました。データセットには「ノイズ」や役に立たない情報だけでなく、高い割合で CSAM 素材が含まれていたのです。この問題は個別に発生したものではなく、抽出されたファイル内で全体的かつ広範囲に発生していました。
沈黙の戦略
強い反応を引き起こすポイントは、材料の発見ではありません。残念ながら、 CSAM インターネットの暗い隅に存在しますが、テクノロジー巨人がその発見を管理しています。によると ブルームバーグの報道Amazonは、自社のAIモデルが漏洩しないように、データのコピーをクリーンアップし、違法な素材を削除することを選択しました。
ただし、同社は Common Crawl 管理者やまったく同じファイルを使用している他の企業に対して、問題の場所や範囲をすぐには明らかにしませんでした。この姿勢は、実際には、Amazon が自社の環境を「消毒」した一方で、汚染源は依然として活動しており、他の研究者、新興企業、AI モデルをトレーニングしている組織がアクセスでき、悪用のサイクルが永続していることを意味します。
技術的および道徳的行き詰まり
この事件は、インターネット監視の大きな課題を浮き彫りにしている。 AIのトレーニングに使用されるデータセットは次のように測定されます。 ペタバイト。このデータを人間がスクリーニングすることは、その量の多さから事実上不可能であり、自動フィルタでは隠蔽またはエンコードされた違法コンテンツを検出できないことがよくあります。
業界標準と考えられている世界最大のデータセットの 1 つがそのような素材をホストしていることが判明したという事実は、悪夢のようなシナリオを生み出します。
- AIの「メモリ」への埋め込み: モデルがこの教材でトレーニングされると、同様のコンテンツを生成したり、虐待に関連する言語パターンを正規化することを学習したりするリスクがあります。
- 法的責任: これらのデータセットを所有する企業は、たとえ無意識であっても、技術的には違法なマテリアルを所有していることになります。
- 再被害者化: このデータが処理されるたびに、映像に映っている犠牲者は、その画像がアルゴリズムの「餌」となり再利用されます。
市場の反応と翌日
アマゾンの代表者らは報道に応じて、同社は強力なセキュリティ対策を講じており、そのような素材に対しては一切の寛容性を持たない方針であると強調した。彼らはまた、次のような組織と協力していると主張した。 国立行方不明児童・搾取児童センター (NCMEC)。しかし、彼らの行動は公益ではなく、内向きで企業製品を保護しているように見えるという批判は依然として残っている。
今回の事件を機に、AIの規制枠組みに関する議論が加速すると予想される。 「ブラインド」データ収集 (Web スクレイピング) は、もはや無害な行為とは考えられません。ヨーロッパとアメリカの規制当局は、トレーニング データの純度についてより厳格な認証を要求する可能性が高く、データセットの品質は技術的な詳細から基本的な人権問題に変わります。
#AIトレーニングデータから児童虐待の内容が判明 #物議を醸す管理