日本語版
最新ニュース
科学&テクノロジー

AI のパイオニア、フェイフェイ・リー氏はコンピューター ビジョンに対するビジョンを持っています

スタンフォード大学教授 フェイフェイ・リー すでに AI の歴史の中でその地位を獲得しています。彼女はで重要な役割を果たしました ディープラーニング 何年にもわたって努力して革命を起こした イメージネット データセットと競争では、AI システムが 1,000 のカテゴリにわたる物体や動物を認識することに挑戦しました。 2012 年、AlexNet と呼ばれるニューラル ネットワークが他のすべてのタイプのモデルを大幅に上回り、ImageNet コンテストで優勝したとき、AI 研究コミュニティに衝撃を与えました。そこから、 ニューラルネットワーク 現在インターネット上で入手可能な膨大な量の無料トレーニング データを活用して、 GPU 前例のないコンピューティング能力を提供します。 ImageNet 以来 13 年間で、コンピュータ ビジョンの研究者はオブジェクト認識を習得し、画像とビデオの生成に移りました。リーはスタンフォード大学の共同設立者 人間中心AI研究所 (HAI) の限界を押し広げ続けました。 コンピュータビジョン。ちょうど今年、彼女はスタートアップを立ち上げ、 ワールドラボ、ユーザーが探索できる 3D シーンを生成します。 World Labs は、AI…

AI のパイオニア、フェイフェイ・リー氏はコンピューター ビジョンに対するビジョンを持っています

1734043190
2024-12-12 20:46:00

スタンフォード大学教授 フェイフェイ・リー すでに AI の歴史の中でその地位を獲得しています。彼女はで重要な役割を果たしました ディープラーニング 何年にもわたって努力して革命を起こした イメージネット データセットと競争では、AI システムが 1,000 のカテゴリにわたる物体や動物を認識することに挑戦しました。 2012 年、AlexNet と呼ばれるニューラル ネットワークが他のすべてのタイプのモデルを大幅に上回り、ImageNet コンテストで優勝したとき、AI 研究コミュニティに衝撃を与えました。そこから、 ニューラルネットワーク 現在インターネット上で入手可能な膨大な量の無料トレーニング データを活用して、 GPU 前例のないコンピューティング能力を提供します。

ImageNet 以来 13 年間で、コンピュータ ビジョンの研究者はオブジェクト認識を習得し、画像とビデオの生成に移りました。リーはスタンフォード大学の共同設立者 人間中心AI研究所 (HAI) の限界を押し広げ続けました。 コンピュータビジョン。ちょうど今年、彼女はスタートアップを立ち上げ、 ワールドラボ、ユーザーが探索できる 3D シーンを生成します。 World Labs は、AI に「空間インテリジェンス」、つまり 3D 世界を生成し、その中で推論し、対話する能力を与えることに専念しています。リー氏は昨日、基調講演を行った NeurIPS、大規模な AI カンファレンスで、マシン ビジョンに対する彼女のビジョンについて次のように述べました。 IEEEスペクトル 彼女の講演の前に独占インタビュー。

講演のタイトルを「視覚的知性のはしごを登る」としたのはなぜですか?

フェイフェイ・リー: 知性にはさまざまなレベルの複雑さと洗練さがあることは直感的だと思います。講演では、過去数十年、特に過去10年以上の社会の変化を感じていただきたいと思います。 ディープラーニング 革命、私たちが視覚知性を使って行うことを学んだことは、まさに息を呑むようなものです。私たちはテクノロジーの活用能力をますます高めています。そして、ユダヤ・パールの「因果関係のはしご」にもインスピレーションを受けました。 [in his 2020 book The Book of Why]。

この講演には「見ることから行うことへ」という副題も付いています。これは人々が十分に理解していないことです。動物にとっても AI エージェントにとっても、見ることは対話や行動と密接に結びついています。そしてこれは言語からの逸脱です。言語は基本的に、アイデアを伝えるために使用されるコミュニケーション ツールです。私の考えでは、これらは非常に補完的ですが、同様に奥深い、知性の様式です。

私たちは特定の光景に対して本能的に反応するということでしょうか?

李: 私は本能のことだけを言っているのではありません。知覚の進化と動物の知性の進化を見ると、それは深く深く絡み合っています。私たちが環境からより多くの情報を得ることができるたびに、進化の力が能力と知性を前進させます。環境を感じないと、世界との関係は非常に受動的になってしまいます。食べるか食べられるかは非常に受動的な行為です。しかし、知覚を通じて環境から手がかりを得ることができるようになると、進化の圧力が実際に高まり、それが知性を前進させます。

そうやって私たちはより深い機械知能を生み出していると思いますか?機械がより多くの環境を認識できるようにすることでしょうか?

李: 「深い」という形容詞が私に当てはまるかどうかはわかりません。私たちはさらに多くの機能を開発していると思います。より複雑になり、より機能的になっていると思います。空間インテリジェンスの問題に取り組むことが、本格的なインテリジェンスに向けた根本的かつ重要なステップであることは、全くの真実だと思います。

World Labs のデモを見てきました。なぜ空間知能を研究し、これらの 3D 世界を構築したいのですか?

李: 空間知能は視覚知能が進むところだと思います。私たちが視覚の問題を解決し、それを行動に結びつけることを真剣に考えているのであれば、非常に単純で、白日の下に並べられた事実があります。それは、世界は 3D であるということです。私たちは平坦な世界に住んでいるわけではありません。私たちの物理エージェントは、ロボットであれデバイスであれ、3D 世界に存在します。仮想世界もますます 3D になってきています。アーティスト、ゲーム開発者、デザイナー、建築家、医師と話す場合、たとえ彼らが仮想世界で働いている場合でも、その多くは 3D です。少し時間をとってこの単純だが奥深い事実を認識すれば、3D インテリジェンスの問題を解決することが基本であることに疑問の余地はありません。

World Labs のシーンがオブジェクトの永続性と物理法則への準拠をどのように維持しているのかに興味があります。 Sora のようなビデオ生成ツールがあるため、これはエキサイティングな前進のように感じられます。 まだそんなことを手探りしてる

李: 世界の 3D 性を尊重すれば、その多くは自然なことになります。たとえば、私たちがソーシャル メディアに投稿したビデオの 1 つでは、バスケットボールがシーンにドロップされています。 3D なので、そのような機能が可能になります。シーンが 2D で生成されたピクセルだけの場合、バスケットボールはどこにも進みません。

あるいは、ソラのように、どこかへ行って消えてしまうかもしれません。 そのテクノロジーを推進する際に直面している最大の技術的課題は何ですか?

李: この問題を解決した人は誰もいませんよね?とてもとても大変です。ご覧いただけます [in a World Labs demo video] 私たちはファン・ゴッホの絵を取り上げ、その周りのシーン全体を一貫したスタイルで生成しました。芸術的なスタイル、照明、その近所にどのような建物があるかに至るまでです。振り向いたら高層ビルになったら全く納得いかないですよね?そしてそれは 3D でなければなりません。そこに移動する必要があります。つまり、ピクセルだけではありません。

トレーニングに使用したデータについて何か言うことができますか?

李: たくさん。

コンピューティング負荷に関して技術的な課題はありますか?

李: 大量の計算が必要です。これは公共部門には対応できない種類のコンピューティングです。これが、私がこのサバティカルを取得し、民間部門でこれを行うことに興奮している理由の一部です。また、これは私が公共部門のコンピューティング アクセスを提唱してきた理由の 1 つでもあります。なぜなら、私自身の経験が、適切な量のリソースによるイノベーションの重要性を強調しているからです。

公共部門は通常、自らのための知識や人類の利益のための知識を獲得することにより動機付けられるため、公共部門に権限を与えるのは素晴らしいことでしょう。

李: 知識の発見にはリソースが必要ですよね?ガリレオの時代、天文学者が新しい天体を観察できる最高の望遠鏡でした。虫眼鏡が顕微鏡になることに気づき、細胞を発見したのはフックです。新しい技術ツールが登場するたびに、知識の探索に役立ちます。そして現在、AI の時代では、テクノロジー ツールにはコンピューティングとデータが含まれます。公共部門についてもそれを認識する必要があります。

リソースを提供するために連邦レベルで何が起こってほしいですか?

李: これはスタンフォード HAI の過去 5 年間の取り組みです。私たちは議会、上院、ホワイトハウス、産業界、その他の大学と協力して NAIRR を創設してきました。 国家 AI 研究リソース

AI システムに 3D 世界を本当に理解させることができると仮定すると、それによって何が得られるでしょうか?

李: それは人々に多くの創造性と生産性を解き放つでしょう。もっと効率的な方法で家を設計したいと思っています。医療用途の多くには、人体という非常に特殊な 3D 世界の理解が含まれることを私は知っています。私たちはいつも人間が創る未来について話します 私たちを助けてくれるロボットしかし、ロボットは 3D 世界で移動し、脳の一部として空間知能を必要とします。また、人々が場所を訪れたり、概念を学んだり、楽しんだりできる仮想世界についても話します。そしてそれらは 3D テクノロジー、特にハイブリッド、いわゆる AR を使用しています。 [augmented reality]。木々、道、雲についての情報が得られるメガネをかけて国立公園を歩きたいと思っています。また、空間知性の助けを借りてさまざまなスキルを学びたいと思っています。

どのようなスキルですか?

李: 私のつまらない例は、高速道路でタイヤがパンクした場合、どうすればよいでしょうか?今、「タイヤの交換方法」の動画を公開しています。しかし、メガネをかけて自分の車に何が起こっているのかを確認し、そのプロセスをガイドしてもらえたら、それは素晴らしいでしょう。しかし、それはつまらない例です。料理について考えたり、彫刻について考えたり、楽しいことを考えたりできます。

私たちが生きている間にこれでどこまで達成できると思いますか?

李: ああ、テクノロジーの進歩のペースは本当に速いので、それは私たちが生きているうちに起こると思います。過去 10 年間が何をもたらしたかを見てきました。それは間違いなく、次に何が起こるかを示しています。

あなたのサイトの記事から

ウェブ上の関連記事

#のパイオニアフェイフェイリー氏はコンピューター #ビジョンに対するビジョンを持っています

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。