1765080811
2025-12-06 16:30:00
- AI のブレークスルーの最後の波を刺激した未開発のデータが枯渇しつつあり、AI モデルは宙に浮いたままになっています。
- モデルをトレーニングするための新しいデータとデータセットを作成する機能は利用可能ですが、障害はまだ残っています。
- 新しいデータの作成に対する障壁を取り除いた企業や経済は、競争上の優位性を獲得できるでしょう。
1 世代前、World Wide Web の台頭はビッグデータ時代の火付け役となり、今日私たちが目にしている AI 革命の推進に貢献しました。最初は、より多くのデータがより深い洞察に変換され、リスクモデリング、ターゲットを絞った広告、ビジネスインテリジェンス、その他のデータ駆動型イノベーションの進歩につながりました。しかし、世界中のデータにもかかわらず、 3~4年ごとに倍増、専門家は現在、AIモデルのデータが不足しており、その成長と有効性が大幅に妨げられるだろうと述べています。
実際のところ、AI は、私たちがこれまで見たことのない「新しい」データを生成するよりも速く、データを取り込んで合成することができます。たとえば、AI が科学教科書の知識をすべて吸収してしまうと、新しい版が出版されるまで新しい洞察は得られません。それでも、主題はほとんど同じであるため、AI の知識は段階的に拡大しています。データの量は増加していますが、多様性と新規性の欠如が AI の足かせとなっています。
技術の進歩に関係なく、同じ既存のデータでトレーニングされた大規模言語モデル (LLM) は、最終的には同じコモディティ化された出力を生成します。新しいデータがなければ、AI はより高度なビジネス、科学、社会の課題を解決するのに役立ちません。
これは、製薬、金融サービス、化学などの定量産業で特に顕著であり、医薬品の組み合わせ、市場状況、原子構造など、考えられる無限の順列が、それらをモデル化して新しいデータや洞察を抽出する能力をはるかに上回っています。これまでこれを達成する唯一の方法は、順列ごとに物理実験を行うことでした。これは、信じられないほど遅く、法外に費用がかかり、あるいは単に実行不可能なプロセスでした。
AI のブレークスルーの最後の波を刺激した未開発のデータが枯渇しつつあり、ますます強力になっているこれらの AI モデルは行き詰まったままになっています。 AI の真の可能性を解き放つには、過去を分析するだけでなく、未来をモデル化して探索できる、新しい定量的データ ソースが必要です。
良いニュースは、新しい「合成」データを作成する方法があるということです。
新しいデータを生成する方法
複雑な AI システム用の新しいデータセットを迅速に生成するには、自動化または計算という 2 つの方法でアプローチできます。
自動化では、ロボット工学と高度なセンサーを活用して、物理実験を 24 時間体制で実施します。これにより生産量は増加しますが、数千台のラボボットの導入はコスト効率が悪く、科学者が実験を通じて重要な実践学習や知識を収集する機会が奪われます。
計算では、多様なデータセット、物理法則、詳細な計算モデルを組み合わせて、生化学反応から機械的応力方程式に至るまで、複雑なシステムをより正確、迅速、安全かつコスト効率よくデジタルでシミュレーションします。
計算は大規模定量モデル (LQM) のバックボーンを形成します。偏見、誤り、誤った情報に満ちた歴史的文書から外挿する LLM とは異なり、LQM は物理学、化学、生物学、その他の定量的領域を支配する第一原理方程式に基づいてトレーニングされます。これらのモデルは、結果をシミュレートするだけでなく、監査可能な因果関係の説明と、現在の文献には存在しない新しいデータを生成します。
業界全体への影響は甚大です。たとえば、新薬の開発に何十年も費用のかかる実験室実験を要する代わりに、LQM は、実験室での実験を開始する前に、薬物相互作用、考えられる作用機序、または数千の潜在的な候補物質の毒性を同時に迅速にモデル化できます。これらの仮想実験により、物理的研究がより的を絞った効率的なものとなり、時間とコストのかかる創薬技術の試行錯誤が最小限に抑えられます。また、研究者がまだカタログ化されていない化学空間を探索したり、新しいデータの欠如により進歩が停滞している複雑で「治療不可能な」条件に取り組んだりするのにも役立ちます。
新しいイノベーションエコシステムのための合成データ
合成データを生成するこの機能は革新的ですが、その影響はより広範なイノベーション エコシステムにかかっています。現在、医療や産業の画期的な進歩に必要な重要なデータセットにアクセスするのが難しい場合があります。これにより、AI イノベーションに対する障壁が生じます。しかし、変化は進行中です。
基本モデルのデータは、それらにアクセスするためのプラットフォームまたは特定のプログラムを介してプロビジョニングできるため、知的財産やデータ プライバシー、ガバナンス、セキュリティ標準を損なうことなく、画期的な AI 機能をより広範囲にアクセスできるようになります。これらのモデルを構築するために必要なコストと専門知識は依然として重要ですが、プラットフォームベースのアクセスにより参加が民主化され、集合知が繁栄することが可能になります。
たとえば、仮想患者集団やタンパク質とリガンドの組み合わせなどのデータ リソースを共有することで、研究者はより広範な遺伝的背景を対象とした仮想試験で新しい治療法を探索できる可能性があります。このアプローチは、がんなどの困難な症状の治療法、世界的なパンデミックのワクチン、個別化医療を進歩させる可能性があります。同様のモデルが金融、材料科学、エネルギーの分野でも登場しており、それぞれが民主化されたアクセスを活用して大規模な問題解決を加速しています。
競争上の優位性のためのデータの生成
データを生成する能力は、単なる技術的な利点ではなく、戦略的な利点でもあります。時間とコストがかかる「設計、構築、テスト」サイクルから、迅速で反復的な「シミュレーション、改良、検証」ワークフローに転換できる企業や政府が、業界や国の変革を主導することになるでしょう。世界最大の産業の一部では、これは次のようになります。
ライフサイエンス: 合成患者データと仮想細胞モデルは、医薬品開発のスケジュールとコストを大幅に削減し、患者登録前に臨床試験の結果を予測するのに役立ちます。
ファイナンス: 複雑な市場シナリオをシミュレートすることで、堅牢なポートフォリオのストレステストが可能になり、歴史的な危機を超えて真に新たなリスクに備えることができます。
製造: 原子構造と物理的特性をデジタル的にモデリングすることで、新しい化合物、化学物質、触媒、または合金をより迅速に特定し、正確な性能基準を満たす優れた製品を生産できます。
エネルギー: 回収された炭素、廃棄物、または低価値の副産物を高価値の製品に変えることで、持続可能性が向上し、新たな収益源が生まれます。先進的なバッテリーの研究開発を加速することで、世界的な電動化の取り組みをサポートします。
AI を活用した経済的および科学的リーダーシップの到来の波は、過去のデータセットを蓄積する人ではなく、データ生成方法論を習得する人によって決定されます。因果関係があり、信頼できるデータを生成することが、あらゆる分野でイノベーションを加速する鍵となります。
データファーストの未来を構築する
私たちは現在、有限の過去のデータに依存するか、それとも生成されたデータによってもたらされる機会を受け入れるか、という転換点に立っています。企業と政府のリーダーは、より革新的で競争力があり、回復力のある AI と産業エコシステムを構築するために、新しいデータ生成方法への投資を優先する必要があります。データファースト アーキテクチャの実装は、集合的な AI インテリジェンスのパワーを解放し、将来のブレークスルーを推進するために不可欠です。
リーダーはこの移行を擁護し、過去に観察されたものの不足ではなく、将来可能なものの豊富さによってイノベーションが促進される新しい時代に組織を推進するための人材、パートナーシップ、フレームワークを育成する必要があります。
#トレーニング #データが不足しています #しかし私たちは解決策を持っています