1749880275
2025-06-13 16:15:00
インターネットで言ったことはすべて、人類について人工知能を教えることの始まりに過ぎませんでした。ハイテク企業は現在、知識の古いリポジトリ:ライブラリスタックを活用しています。
早くも15世紀に、そして254の言語で発行された100万冊近くの書籍は、今週AI研究者にリリースされているハーバード大学コレクションの一部です。また、ボストンの公共図書館が保持している古い新聞や政府の文書の大群もすぐに来ます。
数世紀の昔の本に丸天井を開くことは、AIチャットボットを訓練することに同意せずに創造的な作品がすくい上げられている、生きている小説家、視覚芸術家、その他の訴訟からの訴訟と戦っているハイテク企業にとってのデータボナンザになる可能性があります。
「パブリックドメインデータから始めることは賢明な決定です。なぜなら、それは今でも著作権中のコンテンツよりも物議を醸すものではないからです」と、Microsoftの副顧問であるBurton Davisは述べています。
デイビス氏は、図書館は、AIチャットボットがほとんど学んだ過去数十年のオンライン解説から欠けている「かなりの量の興味深い文化、歴史、言語データ」も持っていると述べました。データが不足していることへの恐怖により、AI開発者はチャットボット自体によって作成された「合成」データに頼るようになり、品質が低くなりました。
MicrosoftとChatGpt Maker Openaiの「無制限の贈り物」に支えられて、ハーバードに本拠を置くInstitutional Data Initiativeは、世界中の図書館や博物館と協力して、彼らがサービスを提供するコミュニティにも利益をもたらす方法で歴史的なコレクションを作る方法について協力しています。
「私たちは、この現在のAIの瞬間からこれらの機関にさかのぼって、いくつかの権力を動かしようとしています」と、ハーバードロースクールの図書館イノベーションラボで研究を管理するアリスタナスクールタスは述べています。 「図書館員は常にデータの管理人であり、情報の管理人でした。」
ハーバードの新しくリリースされたデータセットである施設内の本1.0には、3億9,400万件以上のスキャンされたページが含まれています。以前の作品の1つは、1400年代のものです。韓国の画家の手書きの花と木を栽培することです。作品の最大の集中は、文学、哲学、法律、農業などの主題に関する19世紀からのものであり、それはすべて、司書の世代によって細心の注意を払って保存され、組織されています。
システムの精度と信頼性を向上させようとするAI開発者にとって恩恵になることを約束します。
「AIトレーニングで使用されている多くのデータは、元の情報源からのものではありません」と、データイニシアチブのエグゼクティブディレクターであるグレッグレパートは、ハーバード大学のバークマンクラインセンターのインターネットおよび社会のチーフテクニストでもあると述べています。この本のコレクションは、「実際にそれらのアイテムを収集した機関によってスキャンされた物理的なコピーにまでさかのぼります」と彼は言いました。
CHATGPTが商業的なAI Frenzyを引き起こす前に、ほとんどのAIの研究者は、ウィキペディアから引き出したテキストの出所、Redditなどのソーシャルメディアフォーラム、時には海賊版の本の深いリポジトリからあまり考えていませんでした。彼らは、コンピューター科学者がトークンと呼ぶものをたくさん必要としていました。それぞれが単語を表すことができます。
ハーバード大学の新しいAIトレーニングコレクションには、推定2,420億トークンがあり、人間が推測するのが難しい量ですが、それはまだ最も先進的なAIシステムに供給されているものの一滴に過ぎません。たとえば、Facebookの親会社Metaは、AI大手言語モデルの最新バージョンが、テキスト、画像、ビデオから引き出された30兆以上のトークンでトレーニングされたと述べています。
メタはまた、コメディアンのサラ・シルバーマンや、海賊版の「シャドウ・ライブラリ」から本を盗んだと非難する他の出版された著者からの訴訟と戦っています。
現在、いくつかの予約があるため、実際の図書館が立ち上がっています。
また、一連の著作権訴訟と戦っているOpenaiは、今年、オックスフォード大学の400年前のBodleian Libraryを含む研究機関のグループに5,000万ドルを寄付しました。
デジタルおよびオンラインサービスのチーフであるジェシカチャペルは、同社が最初に米国最大のボストン公共図書館に連絡したとき、図書館は、デジタル化された情報がすべての人にとってであることを明らかにしました。
「Openaiは、膨大な量のトレーニングデータにこの関心を持っていました。私たちは膨大な量のデジタルオブジェクトに関心を持っています。これは、物事が整合しているようなものです」とチャペル氏は言いました。
デジタル化は高価です。たとえば、ボストンの図書館が、ケベック州のカナダ移民コミュニティによって19世紀後半から20世紀初頭に広く読まれた多数のニューイングランドのフランス語の新聞をスキャンしてキュレートすることは骨の折れる仕事でした。このようなテキストはトレーニングデータとして使用されているため、図書館員がとにかくやりたいと思うバンクロールプロジェクトに役立ちます。
Harvardのコレクションは、2006年にGoogleの別のハイテク大手Googleのために、2000万冊以上の検索可能なオンラインライブラリを作成するために、すでにデジタル化されていました。
Googleは、著者からオンラインブックライブラリへの法的課題を何年もかけて費やしました。米国最高裁判所が著作権侵害の請求を拒否した下級裁判所の判決を表明した2016年に最終的に解決されました。
現在、Googleは初めてハーバード大学と協力して、Google Booksからパブリックドメインのボリュームを取得し、AI開発者へのリリースへの道をクリアしました。米国の著作権保護は通常95年間続き、サウンド録音の場合は長くなります。
新しい努力は、木曜日に同じ著者グループによって称賛され、Googleが本プロジェクトを訴え、最近ではAI企業を法廷に連れて行った。
「これらのタイトルの多くは、主要なライブラリのスタックにのみ存在し、このデータセットの作成と使用は、これらのボリュームへのアクセスと知識の拡大と知識を提供します」 「重要なことに、合法で大規模なトレーニングデータセットの作成は、新しいAIモデルの作成を民主化することです。」
次世代のAIツールにとって、このすべてがどれほど有用であるかは、データセットと誰でもダウンロードできるオープンソースAIモデルをホストするハギングフェイスプラットフォームで6月12日にデータが共有されたため、まだ見られていません。
本のコレクションは、典型的なAIデータソースよりも言語的に多様です。特にドイツ語、フランス語、イタリア語、スペイン語、ラテン語、ヨーロッパの言語は依然として支配的ですが、英語の半分未満です。
Leppert氏は、19世紀の考えに浸された本のコレクションは、人間と同様に計画と推論できるAIエージェントを構築するためのテクノロジー業界の取り組みにとっても「非常に重要」である可能性があると述べました。
「大学では、推論することの意味について多くの教育学があります」とレパート氏は言いました。 「プロセスを実行する方法と分析を実行する方法に関する科学的情報がたくさんあります。」
同時に、科学的および医学的理論を暴かれた人種差別主義者や植民地時代の物語まで、時代遅れのデータもたくさんあります。
「このような大規模なデータセットを扱っているとき、有害なコンテンツと言語に関するいくつかのトリッキーな問題があります」と、イニシアチブがデータを使用して、「独自の情報に基づいた決定を行うのに役立ち、AIを反対に使用するのに役立つ」というガイダンスを提供しようとしていると述べているハーバードの図書館イノベーションラボのコーディネーターであるクリスティ・ムークは言いました。
この話はAP通信によって報告されました。
#HarvardのInstitutional #Data #InitiativeはAIアクセスライブラリスタックを支援します