1742690157
2025-03-21 13:00:00
Googleと協力して、コンピューターヒストリー博物館は、2012年にAIに対する一般的なアプローチをキックスタートしたニューラルネットワークであるAlexnetにソースコードをリリースしました。ソースコードは、CHMのGitHubページでオープンソースとして利用できます。
alexnetとは何ですか?
Alexnetは、写真画像の内容を認識するために作成された人工ニューラルネットワークです。 2012年に、トロント大学の大学院生であるアレックス・クリズヘフスキーとイリヤ・サツケイバー、そしてその教員アドバイザーであるジェフリー・ヒントンによって開発されました。
ヒントンは、神経ネットワークを使用し、今日の主流のAIの基礎である人工知能のタイプである深い学習の父の一人と見なされています。適応ウェイトの層のみを備えた単純な3層ニューラルネットワークは、1950年代後半、特にコーネルの研究者であるフランクローゼンブラットによって最初に構築されましたが、制限があることがわかりました。 [This explainer gives more details on how neural networks work.] 特に、研究者は、適応ウェイトの複数の層を持つネットワークを必要としていましたが、それらを訓練する良い方法はありませんでした。 1970年代初頭までに、ニューラルネットワークはAIの研究者によって大部分が拒否されていました。
フランク・ローゼンブラット [left, shown with Charles W. Wightman] 1957年に最初の人工ニューラルネットワークであるPerceptronを開発しました。レアおよび原稿コレクションの部門/コーネル大学図書館
1980年代、ニューラルネットワークの研究は、カリフォルニア大学サンディエゴ校の認知科学者によって、「コネクショニズム」の新しい名前でAIコミュニティの外で復活しました。博士号を取得した後1978年にエディンバラ大学で、ヒントンはUCSDのポスドク研究員になり、そこでデビッド・ルーメルハートとロナルド・ウィリアムズと協力しました。 3つは、ニューラルネットワークをトレーニングするためのBackpropagationアルゴリズムを再発見し、1986年に2つの論文を発行し、ニューラルネットワークが言語とビジョンタスクの複数の機能を学習できるようにしました。今日の深い学習の基礎となるバックプロパゲーションは、現在の出力とネットワークの目的の出力の違いを使用して、出力層から入力層までの出力層からの重みを調整します。
1987年、ヒントンはトロント大学に入学しました。伝統的なAIの中心から離れて、ヒントンの仕事と彼の大学院生の仕事は、トロントを今後数十年にわたって深い学習研究の中心にしました。ヒントンのポスドク学生の1人は、現在メタのチーフサイエンティストであるヤン・レクンでした。トロントで働いている間、Lecunは、バックプロパゲーションが「畳み込み」ニューラルネットワークで使用されたとき、手書きの数字を認識するのに非常に優れていることを示しました。
ImagenetおよびGPU
これらの進歩にもかかわらず、ニューラルネットワークは他のタイプの機械学習アルゴリズムを常に上回ることができませんでした。彼らは、AI以外からの2つの開発を必要としていました。 1つ目は、Webを通じて利用可能になったトレーニング用の非常に多くのデータの出現でした。 2つ目は、GPUとして知られる3Dグラフィックチップの形で、このトレーニングを実行するのに十分な計算能力でした。 2012年までに、Alexnetの時代は熟していました。
2009年に完成したFei-fei LiのImagenet Image Datasetは、Alexnetのトレーニングに極めて重要でした。ここ、li [right] コンピューター歴史博物館でトム・カリルと話しています。ダグラスフェアベアン/コンピューター歴史博物館
AlexNetを訓練するために必要なデータは、Stanford Fei-Fei Li教授が開始および主導するプロジェクトであるImagenetで見つかりました。 2006年から、従来の知恵に反して、Liは英語のすべての名詞をカバーする画像のデータセットを想像しました。彼女と彼女の大学院生は、インターネットで見つかった画像を収集し、WordNetが提供する分類法、単語のデータベース、および互いの関係を使用してそれらを分類し始めました。彼らの仕事の巨大さを考えると、Liと彼女の協力者は最終的に、Amazonの機械的なタークプラットフォームを使用して、ギグワーカーに画像をラベル付けするタスクをクラウドソーシングしました。
2009年に完成したImagenetは、以前の画像データセットよりも数桁大きかった。 Liは、その可用性が新しいブレークスルーを促進することを望んでおり、2010年に研究チームが画像認識アルゴリズムを改善することを奨励するために競争を開始しました。しかし、今後2年間で、最高のシステムはわずかな改善のみを行いました。
ニューラルネットワークの成功に必要な2番目の条件は、膨大な量の計算への経済的アクセスでした。ニューラルネットワークトレーニングには、GPUが行うように設計されていることは、並行して行われる多くの繰り返しマトリックス乗算が含まれます。 CEOのJensen Huangが共同設立したNvidiaは、2000年代に、特に2007年にリリースされたCUDAプログラミングシステムを使用して、3Dグラフィックを超えたアプリケーションにGPUをより一般化し、プログラム可能にするための道をリードしていました。
ImagenetとCudaの両方は、ニューラルネットワーク自体のように、適切な状況が輝くのを待っていたかなりニッチな発展でした。 2012年、AlexNetは、Deep Neural Networks、Big Dataset、およびGPUのこれらの要素を初めてまとめ、パスブレイク結果をもたらしました。これらのそれぞれは他を必要としていました。
Alexnetがどのように作成されたか
2000年代後半までに、トロント大学のヒントンの卒業生は、GPUを使用して、画像認識と音声認識の両方のためにニューラルネットワークを訓練し始めていました。彼らの最初の成功は音声認識でもたらされましたが、画像認識の成功は、AIに対する汎用解決策の可能性として深い学習を示しています。 1人の学生であるIlya Sutskeverは、ニューラルネットワークのパフォーマンスが利用可能なデータの量とともに拡大すると信じており、Imagenetの到着は機会を提供しました。
2011年、Sutskeverは、GPUから最大のパフォーマンスを絞る能力を持ち、イメージネット用の畳み込みニューラルネットワークを訓練する能力を持っていた仲間の大学院生であるAlex Krizhevskyを説得し、ヒントンは主要な研究者として働きました。
AlexNetは、ImagENetデータセットでトレーニングされたCUDAコードを実行しているNVIDIA GPUを使用しました。 Nvidia CEOのJensen Huangは、コンピューターグラフィックスチップスとAIへの貢献により2024 CHMフェローに指名されました。ダグラスフェアベアン/コンピューター歴史博物館
Krizhevskyは、Nvidia GPUを使用して畳み込みニューラルネットワークのCUDAコードをすでに書いていました。 cuda-convnet、はるかに小さく訓練されています CIFAR-10画像データセット。彼は、複数のGPUおよびその他の機能をサポートしてCuda-Convnetを拡張し、Imagenetで再訓練しました。トレーニングは、両親の家にあるKrizhevskyの寝室にある2枚のNvidiaカードを備えたコンピューターで行われました。翌年の間に、彼はネットワークのパラメーターを常に微調整し、競合他社よりも優れたパフォーマンスを達成するまでそれを再訓練しました。ネットワークは、最終的にKrizhevskyにちなんでAlexnetという名前です。ジェフ・ヒントンはこのようにアレックスネットプロジェクトを要約しました。 ノーベル賞。」
SutskeverのKrizhevskyとHintonは、2012年秋に発行され、10月にイタリアのフィレンツェで開催されたコンピュータービジョン会議でKrizhevskyが発表したAlexnetに関する論文を書きました。ベテランのコンピュータービジョンの研究者は納得していませんでしたが、会議に出席していたレクンは、それをAIのターニングポイントと宣言しました。彼は正しかった。 Alexnetの前に、主要なコンピュータービジョン論文のどれもニューラルネットを使用していませんでした。その後、ほとんどすべてがそうします。
Alexnetはほんの始まりに過ぎませんでした。次の10年間で、ニューラルネットワークは、信じられる人間の声を統合し、チャンピオンゴープレイヤーを破り、アートワークを生成し、2022年11月にSutskeverが共同設立したChatGptのリリースで頂点に達しました。
AlexNetソースコードのリリース
2020年、私はKrizhevskyに連絡して、歴史的な重要性のためにCHMがAlexNetソースコードをリリースできるようにする可能性について尋ねました。彼は私を当時Googleで働いていたヒントンに私をつなぎました。 Googleは、Hinton、Sutskever、Krizhevskyが所有する会社であるDnnResearchを買収したAlexnetを所有していました。ヒントンは、CHMをGoogleの適切なチームに接続することでボールを転がしました。 CHMはGoogleチームと5年間協力してリリースを交渉しました。チームはまた、リリースするAlexNetソースコードの特定のバージョンを特定するのを支援しました。これは、長年にわたって多くのバージョンのAlexNetがありました。 GithubにはAlexnetと呼ばれるコードの他のリポジトリがありますが、これらの多くは、元のコードではなく、有名な論文に基づいた再作成です。
CHMは、人工知能の分野を変換した2012年バージョンのALEXNETにソースコードを提示できることを誇りに思っています。 CHMのGitHubページのソースコードにアクセスできます。
この投稿はもともと、コンピューター歴史博物館のブログに掲載されました。
謝辞
彼の引用を提供してテキストをレビューしてくれたGeoffrey Hinton、追加の明確化のためにMetzとAlex KrizhevskyをCade、David BieberとGoogleの他のチームにソースコードリリースを確保するために、彼の引用を提供してくれたGeoffrey Hintonに感謝します。
サイトの記事から
ウェブ上の関連記事
#AlexnetがAIとコンピュータービジョンを永遠にどのように変えたか