日本語版
最新ニュース
科学&テクノロジー

Wikipediaは、開発者がLLMモデルをトレーニングするための特定のデータセットを開発者に利用できるようにすることでボットIAと戦う

ウィキペディア 直面することにしました ボット別の自動擦り付け現象 これは、最近の過去にその剥離に圧力をかけてきた人工知能モデルのトレーニングのための情報を収集します。 ウィキメディア財団は、Kaggleとのパートナーシップを発表しました、Googleが所有するデータサイエンスプラットフォーム、 IAモデルのトレーニングを目的として構造化され、明示的に最適化されたデータセットの公開。現時点では、データセットはベータ版でkaggleで既に利用可能であり、英語とフランス語でウィキペディアコンテンツが含まれています。 このデータセットの可用性は、機械学習の作業フローに簡単に統合するために特別に構築されたものであり、サイトの「スクレイピング」または記事のテキストの「解析」と呼ばれる操作に頼る必要性を防ぐ方法です。 ウィキメディア財団はそれを説明しています データセット構造は、よく組織されたJSON表現に基づいています概要として高い付加価値を持つ要素、短い説明、画像へのリンク、情報ボックスのデータ、記事のセクションを含むが、書誌参照とオーディオファイルなどの非テキストコンテンツは除外されます。 したがって、開発者に提供する方法です 機械による「読み取り」に適した、「きれい」で使用できる情報の本文 ウィキペディアの有機ページからの直接抽出から必然的に生じる複雑さの減少のおかげで、モデリング、微調整、ベンチマーク操作、モデルの整合、分析に役立ちます。 ウィキメディア財団の決定は、私たちが言ったように、 数週間前にどれだけ言ったか:昨年、ウィキメディアバンドの使用における50%の増加。 Kaggleのサポートを受けた構造化データの分布は、大きな現実IAだけでなく、ウィキペディアインフラストラクチャを比較検討せずに質の高いデータのソースにアクセスできる独立した開発者や中小企業にも捧げられたソリューションを表しています。 Wikimedia Enterprise eのスナップショットAPIから派生したデータセット 約25GBの時点、オープンライセンスでリリースされます:主にクリエイティブコモンズの帰属シェアアリック4.0(CC by-sa 4.0)e la gnu free documentationライセンス(GFDL)、Wikimediaの使用条件でいくつかの例外が指定されています。このようにして、ソースの帰属があり、デリバティブ作業が同じライセンスで配布される限り、情報を再利用および変更する可能性が保証されます。 #Wikipediaは開発者がLLMモデルをトレーニングするための特定のデータセットを開発者に利用できるようにすることでボットIAと戦う

Wikipediaは、開発者がLLMモデルをトレーニングするための特定のデータセットを開発者に利用できるようにすることでボットIAと戦う

1744932983
2025-04-17 15:21:00

ウィキペディア 直面することにしました ボット別の自動擦り付け現象 これは、最近の過去にその剥離に圧力をかけてきた人工知能モデルのトレーニングのための情報を収集します。

ウィキメディア財団は、Kaggleとのパートナーシップを発表しました、Googleが所有するデータサイエンスプラットフォーム、 IAモデルのトレーニングを目的として構造化され、明示的に最適化されたデータセットの公開。現時点では、データセットはベータ版でkaggleで既に利用可能であり、英語とフランス語でウィキペディアコンテンツが含まれています。

このデータセットの可用性は、機械学習の作業フローに簡単に統合するために特別に構築されたものであり、サイトの「スクレイピング」または記事のテキストの「解析」と呼ばれる操作に頼る必要性を防ぐ方法です。

ウィキメディア財団はそれを説明しています データセット構造は、よく組織されたJSON表現に基づいています概要として高い付加価値を持つ要素、短い説明、画像へのリンク、情報ボックスのデータ、記事のセクションを含むが、書誌参照とオーディオファイルなどの非テキストコンテンツは除外されます。

したがって、開発者に提供する方法です 機械による「読み取り」に適した、「きれい」で使用できる情報の本文 ウィキペディアの有機ページからの直接抽出から必然的に生じる複雑さの減少のおかげで、モデリング、微調整、ベンチマーク操作、モデルの整合、分析に役立ちます。

ウィキメディア財団の決定は、私たちが言ったように、 数週間前にどれだけ言ったか:昨年、ウィキメディアバンドの使用における50%の増加。 Kaggleのサポートを受けた構造化データの分布は、大きな現実IAだけでなく、ウィキペディアインフラストラクチャを比較検討せずに質の高いデータのソースにアクセスできる独立した開発者や中小企業にも捧げられたソリューションを表しています。

Wikimedia Enterprise eのスナップショットAPIから派生したデータセット 約25GBの時点、オープンライセンスでリリースされます:主にクリエイティブコモンズの帰属シェアアリック4.0(CC by-sa 4.0)e la gnu free documentationライセンス(GFDL)、Wikimediaの使用条件でいくつかの例外が指定されています。このようにして、ソースの帰属があり、デリバティブ作業が同じライセンスで配布される限り、情報を再利用および変更する可能性が保証されます。

#Wikipediaは開発者がLLMモデルをトレーニングするための特定のデータセットを開発者に利用できるようにすることでボットIAと戦う

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。