1758646701
2025-09-23 11:44:00
Nasuniの創設者兼最高技術責任者(CTO)Andres Rodriguezに、企業の非構造化データを最適に使用するためにストレージから必要な特性と、その規模の課題について話します。
彼は、クラウドがすべてを変えたと言います。クラウドモデルは、どこからでもアクセスできる単一のストレージプールの青写真を提供します。
彼はまた、企業がデータの企業知識とアクセスを高めることができる豊富なメタデータを構築し、Model Model Context Protocol(MCP)コネクタなどの人工知能(AI)にアクセスするために、データを分類、タグ付け、キュレートする必要があると述べています。
企業で非構造化データを最適に使用するための障害の性質は何ですか?
それは本当にスケールです。つまり、構造化されていないデータに戻ると、それはファイルサーバー内のすべてのファイルであるNASです。 [network-attached storage]、など
それはすべてその作業製品です。したがって、あなたが建築会社である場合、それはデザインの図面です。あなたが製造会社なら、それはデザインの図面とシミュレーションです。これらはすべて、エンタープライズのファイルシステムでファイルになります。
そして、それに加えて、すべての組織には、ExcelとPowerPointsとWord DocumentsとPDFという古典的なオフィス文書があります。これらはすべての業界で一般的です。そのため、組織に価値を加えるために採掘できるこの種の巨大な潜在的なリポジトリになります。
しかし、課題は、どのようにアクセスするのですか?アクセスできると同時に、どのようにアクセスを制御しますか?そして、そのデータに関する洞察を与えるツールにどのようにプラグインしますか?そして、それを大規模に行うことは本当に手ごわい挑戦です。
それで、顧客は、非構造化されたデータができるだけ多くの洞察を得ることができるように保存される方法から何を必要としますか?
最初のことは、組織に非常に多くのことがあるので、従来のアプローチで起こっていることは、データのサイロがたくさんあることです。ご存知のように、データはデバイスに保存され、デバイスはいたるところにあります。
それが大規模な組織である場合、従業員が位置するさまざまな地理的場所がある可能性があり、それらの場所のファイルへの高性能アクセスが必要です。したがって、あなたはそれらのためにサイロを構築することになります。
それはただの容量かもしれません。 1つのファイルサーバーで容量が不足しているため、別のファイルサーバーを展開すると、この信じられないほどの数のファイルサーバーが展開されます。したがって、データで価値のあることをしようとすると、データは非常に多くの異なるサイロであるため、不可能になり、サイロに到達して、あらゆる種類の論理的な方法で集計することは困難です。
クラウドはすべてを変えました。多くの組織、特に構造化されていないデータ、ファイルデータをクラウドに統合した大規模な組織は、この大きな利益を認識しています。これは、データが無限にスケーラブルな1つの論理空間で統合され、世界中の非常に高いレベルのパフォーマンスで利用できるようになったことです。
雲は無限で、雲はどこにでもあります。そして、それは彼らがそのデータリポジトリ、その非構造化されたデータリポジトリを活用し、データから洞察を収集できるようにするための信じられないほどの基礎的な部分です。
特にAIのこの時代に、顧客向けの非構造化データの最適な使用を支えるテクノロジーは何ですか?
いくつかの作品があると思います。
基礎レベルでは、NASの統合を可能にするテクノロジーが必要です。私たちの専門の1つは、クラウドで有効になっているそのようなNASを提供することです。それが最初のビルディングブロックです。
次に、そのブロックの上に、その巨大なリポジトリを取得して大規模に行うことができる非構造化データ管理ツールが必要です。
私が話しているすべてのことについて、あなたはスケールの逆風と戦っているので、数億または数十億のファイルとペタバイトのストレージに到達できる技術が必要です。そうしないと、問題の大規模な努力で不自由になることになります。
したがって、構造化されていないデータ管理のこの次のレイヤーでは、データを分類したり、データをタグ付けしたり、データのグローバルレベルでアクセスコントロールを設定できるようにする非常にスケーラブルなツールを用意している必要があります。つまり、データをキュレートします。
つまり、人々がAIで今やろうとしていることを見て、AIから洞察を得ている場合、これらのプロジェクトのほとんどの失敗は、LLMSに入る十分な品質データの欠如に起因する可能性があります [large language models]。エンジニアリングスクールでは、彼らは私たちに教えてくれました。あなたはモデルにゴミを入れ、モデルからゴミを出します。
最優先事項は、モデルに入っているデータをクリーンアップすることです。これは、組織が生成している通常の非構造化データを使用して大規模に行うことができるツールを意味するため、組織が進化し続けるにつれて、そのデータセットは自動的に更新されます。
特別な種類のリフトと労力を行っているからではなく、パイプラインをすでにセットアップしており、すべてのシステムが自動的にデータをクリーンアップし、機械学習モデルでデータを利用できるようにしているからです。
これが、プロジェクトを実行しているときに一度に機能するだけでなく、継続的に組織に洞察を追加するシステムを取得する方法です。
したがって、最後のレイヤーは、利用可能なすべてのLLMモデルへのこの種の汎用プラグインです。すべてのニーズを満たすものは1つもありません。
接続できるようなハブのようなものが必要です。人々が現在使用している用語は、さまざまなモデルへの標準アクセスを提供するMCPインターフェイスです。データセットが変更されないため、モデルのレベルでのこの種の標準化は重要です。
つまり、労働者が変わると変化するでしょうが、使用しているモデルに基づいて変更されるわけではありません。達成しようとしている目標に最適なモデルをプラグインできる必要があります。
それが機能しない場合、またはアップグレードが必要な場合、またはベンダーを切り替えたい場合は、それを変更できる必要があります。それは私たちが遅い拘束と呼んでいるものであり、プロジェクトの後半では、あなたはその決定を下すことができる必要があります。
そして、もちろん、ループを閉じて、タブローなどの何らかのインターフェイスレポートを確認する必要があります。
クライアントが通常やりたいことは、プロジェクトデータを見て見積もることです。このプロジェクトは時間通りになるのでしょうか?構造化されていないデータからの信号に基づいて、予算内にあるのでしょうか?
または、より高いレベルの知識でコンプライアンスを行うことができるようにしたい。おそらく、ファイルにあるものだけでなく、エンドユーザーがそれらのファイルとどのように対話するか、それらのファイルが時間の経過とともにどのように変化したかを理解したいのでしょう。これにより、構造化されていないデータの動作と、組織がそのデータをどのように使用しているかまたは使用していないかについての膨大な洞察が得られます。
ですから、それは本当にこれらの3つの層の統合についてです。基礎NAS統合または構造化されていないデータ統合レイヤーは、すべてストレージとデータが保護されていることを確認し、容量と高性能を確実に持っていることを確認します。その上には、データをキュレートして準備できるようにして、すべての機械学習モデルへのインターフェイスである3番目のレイヤーで使用できるようにするための非構造化データ管理レイヤーがあります。
物事のキュレーションと分類層の部分はすべてメタデータに関するものだと思います。そうでしょうか?
それは正しいです。
データを活用してメタデータを思いつくことができる場合がありますが、ルールは常にメタデータに基づいています。
ですから、アイデアは、豊かな構造を持たなければならないということです。これが、その最初の層であるNAS統合が非常に重要である理由です。
これは、ファイルシステムに豊富な構造が必要なため、新しいメタデータでデータを注釈して、キュレーション、非構造化データの動作を制御するメタデータに基づいてルールを設定できるようにするためです。
#ポッドキャスト構造化されていないデータから価値を取得する方法