1760642275
2025-10-16 19:08:00
この夏の 1 週間、テイラーとルームメイトは額に GoPro カメラを装着し、絵を描いたり、彫刻をしたり、家事をしたりしていました。彼らは AI ビジョン モデルをトレーニングし、システムが同じ動作を複数の角度から取得できるように映像を注意深く同期していました。それは多くの点で困難な仕事でしたが、彼らはその仕事に対して十分な報酬を得ました。そしてそのおかげでテイラーは一日のほとんどを芸術作品の制作に費やすことができました。
「私たちは起きて、いつものルーティンをこなし、それからカメラを頭にくくりつけて時間を同期しました」と彼女は私に語った。 「それから私たちは朝食を作り、皿を洗いました。それから私たちはそれぞれの道を歩み、芸術に取り組みました。」
彼らは毎日 5 時間の同期映像を制作するよう雇われましたが、テイラーさんはすぐに、休憩や身体の回復に十分な時間を確保するために、1 日 7 時間を作業に割り当てる必要があることに気づきました。
「それは頭痛を引き起こすでしょう」と彼女は言いました。 「それを脱ぐと、額には赤い四角が残るだけです。」
テイラーさんは名字を明かさないように頼んだが、彼女をTechCrunchに結びつけたAI企業、チューリング・ラボでデータフリーランサーとして働いていた。チューリングの目標は、AI に油絵の作り方を教えることではなく、逐次的な問題解決と視覚的推論に関するより抽象的なスキルを習得することでした。大規模な言語モデルとは異なり、チューリングの視覚モデルは完全にビデオでトレーニングされ、そのほとんどはチューリングによって直接収集されます。
テイラーのようなアーティストと並んで、チューリングはシェフ、建設作業員、電気技師など手を使うあらゆる人々と契約を結んでいる。 Turing の最高 AGI オフィサー、Sudarshan Sivaraman 氏は > に対し、十分に多様なデータセットを入手するには手動による収集が唯一の方法であると語った。
「私たちは非常に多くの異なる種類のブルーカラーの仕事のためにこれを行っているので、トレーニング前の段階で多様なデータを得ることができます」とシバラマン氏はTechCrunchに語った。 「これらすべての情報を取得すると、モデルは特定のタスクがどのように実行されるかを理解できるようになります。」
テッククランチイベント
サンフランシスコ | 2025年10月27日~29日
チューリング氏のビジョン モデルに関する研究は、AI 企業によるデータの扱い方における変化の拡大の一環です。かつてはトレーニング セットが Web から自由に収集されたり、低賃金のアノテーターから収集されたりしていましたが、現在では企業は慎重に厳選されたデータに高額のお金を払っています。
AI の本来の力はすでに確立されており、企業は競争上の優位性として独自のトレーニング データに注目しています。そして、請負業者に仕事を任せるのではなく、請負業者が自分たちで仕事を引き受けることもよくあります。
メール会社は フィクサーAI モデルを使用してメールを分類し、返信の下書きを行う はその一例です。
初期のいくつかの実験の後、創設者のリチャード・ホリングスワースは、焦点を絞ったトレーニング データを含む一連の小さなモデルを使用することが最良のアプローチであることを発見しました。 Turing とは異なり、Fyxer は他人の基礎モデルを基に構築していますが、根底にある洞察は同じです。
「私たちは、データの量ではなく質がパフォーマンスを実際に定義するものであることに気づきました」とホリングスワース氏は私に語った。
実際問題として、これは型破りな人員の選択を意味しました。ホリングスワース氏によると、初期の頃は、Fyxer のエンジニアとマネージャーの数が、モデルのトレーニングに必要なエグゼクティブ アシスタントの数より 4 対 1 で劣ることもありました。
「メールに返信すべきかどうかの基礎を訓練する必要があったため、経験豊富なエグゼクティブアシスタントを多数起用しました」と同氏はTechCrunchに語った。 「これは非常に人間志向の問題です。優秀な人材を見つけるのは非常に難しいのです。」
データ収集のペースは決して遅くなることはありませんでしたが、時間の経過とともに、ホリングスワース氏はデータセットをより大切にするようになり、トレーニング後の時間になると、より厳密に選別された小さなデータセットを好むようになりました。彼が言うように、「パフォーマンスを本当に決めるのはデータの量ではなく質です。」
これは、合成データが使用される場合に特に当てはまり、考えられるトレーニング シナリオの範囲と元のデータセットの欠陥の影響の両方が拡大します。ビジョンの面では、データの 75 ~ 80% が元の GoPro ビデオから推定された合成データであるとチューリング氏は推定しています。しかし、そのため、元のデータセットを可能な限り高品質に保つことがさらに重要になります。
「トレーニング前のデータ自体の品質が良くない場合、合成データを使って何をするにしても、品質は良くありません」とシバラマン氏は言います。
品質への懸念を超えて、データ収集を社内で維持する背後には強力な競争ロジックがあります。 Fyxer にとって、データ収集の労力は、同社が競争に対抗するための最良の堀の 1 つです。ホリングスワース氏の見解では、誰でもオープンソース モデルを製品に組み込むことができますが、誰もがそれをトレーニングして実行可能な製品にできる専門のアノテーターを見つけることができるわけではありません。
同氏はTechCrunchに対し、「それを実現する最善の方法はデータを利用することだと信じている。カスタムモデルの構築や人間主導の高品質なデータトレーニングを通じてだ」と語った。
#スタートアップがデータを自ら手に入れる理由