日本語版
最新ニュース
科学&テクノロジー

AI 音声ディクテーションのおかげで、より多くの人がメール、メッセージ、コードを音声で話すようになりました

ギャビン・マクナマラはキーボードを放棄し、タイピングをせずに一日中話し続けています。 彼はコンピューターと電話で何時間も話し、電子メールを送信し、プレゼンテーションを作成し、LinkedIn に投稿し、さらにはサンフランシスコの新興企業 Wispr Flow の AI ディクテーション アプリを使用して会話を通じてコーディングを行っています。 AI は、彼のとりとめのない発言に句読点を付け、フォーマットし、一貫したコピーに適応させます。マクナマラの平均入力速度は 1 分あたり 125 ワードで、これは平均のタイピング速度の 2 倍です。「現時点では、タイピングでできることはすべて、私は話すことでやっています」と、ソフトウェア代理店 Why Not Us の創設者である 32 歳の彼は言いました。 「私はただ話すだけです。」 彼は過去 5 か月間で 77 のアプリにわたって 300,000 語近くの単語を口述筆記しました。これは小説 3 冊を書くのに相当します。カリフォルニアの大手テクノロジー企業や新興企業は、AI とそのベースとなる大規模な言語モデルを利用して、人々が指ではなく声を使ってテクノロジーと対話できるようにする運動の最前線に立っています。 「AI と LLM はこの力関係を変えました」と、サンディエゴを拠点とする無料の音声からテキストへのディクテーション…

AI 音声ディクテーションのおかげで、より多くの人がメール、メッセージ、コードを音声で話すようになりました

1769699867
2026-01-29 11:03:00

ギャビン・マクナマラはキーボードを放棄し、タイピングをせずに一日中話し続けています。

彼はコンピューターと電話で何時間も話し、電子メールを送信し、プレゼンテーションを作成し、LinkedIn に投稿し、さらにはサンフランシスコの新興企業 Wispr Flow の AI ディクテーション アプリを使用して会話を通じてコーディングを行っています。

AI は、彼のとりとめのない発言に句読点を付け、フォーマットし、一貫したコピーに適応させます。マクナマラの平均入力速度は 1 分あたり 125 ワードで、これは平均のタイピング速度の 2 倍です。

「現時点では、タイピングでできることはすべて、私は話すことでやっています」と、ソフトウェア代理店 Why Not Us の創設者である 32 歳の彼は言いました。 「私はただ話すだけです。」

彼は過去 5 か月間で 77 のアプリにわたって 300,000 語近くの単語を口述筆記しました。これは小説 3 冊を書くのに相当します。

カリフォルニアの大手テクノロジー企業や新興企業は、AI とそのベースとなる大規模な言語モデルを利用して、人々が指ではなく声を使ってテクノロジーと対話できるようにする運動の最前線に立っています。

「AI と LLM はこの力関係を変えました」と、サンディエゴを拠点とする無料の音声からテキストへのディクテーション アプリ Handy の作成者である CJ Pais 氏は述べています。 「音声を使用する方が、入力するよりもはるかに高速です。」

Handy、サンフランシスコの Wispr Flow、Willow など、独立した開発者と新興企業が混在し、人工知能との正確な音声対話を提供する企業が誕生しました。

テクノロジー業界の大手企業も、人々が AI と提携するための新しい方法を生み出しています。 Meta の最新のスマート グラスは音声に依存しています。 OpenAI と Meta は、ボットの音声チャット用に異なる個性を設計しました。 Amazon の Alexa や Apple の Siri でさえ AI のアップグレードが行われており、これにより誰もが自社のテクノロジーと対話することがさらに増えるだろうと両社は予想している。

コンピューターで話し言葉を使用するためのこれらの無料および有料の方法は、プログラマー、エグゼクティブアシスタント、弁護士、コンテンツクリエーター、医療関係者など、何百万ものユーザーを魅了してきました。楽観主義者の中には、キーボードが時代遅れになる可能性があると考えている人もいます。

Willow の創設者である Allan Guo 氏は、「世界で最も権威あるテレビ賞からキーボードを削除したことを発表できることを嬉しく思います」と Willow の創設者である Allan Guo 氏は投稿の中で述べています。 リンクトイン、エミー賞チームは、2026年の賞に備えてSlackメッセージを送信し、受信箱をより速くクリアするためにウィローの音声ディクテーションを使用したと指摘しました。

大手テクノロジー企業は長年にわたり、 適応された 同社の製品の多くには、利便性を考慮して音声優先機能が搭載されています。今日では、アクセシビリティ機能としての音声から生産性ツールへの転換が行われています。

2022 年後半、ChatGPT の開発者 無制限のアクセスを提供し始めた Whisper と呼ばれる自動音声認識モデルは、68 万時間の多言語データに基づいてトレーニングされています。 OpenAI は、かつては厳重に守られていた大きな技術秘密であった、正確な音声転写の技術を共有しました。誰でも無料で高品質の AI 文字起こしをダウンロードして実行できるようになりました 彼らのラップトップ上で

AI ディクテーション アプリの新しい波は、Whisper を基盤として使用し、その上にライブ ディクテーションを提供するために構築されています。無料の代替手段もありますが、有料サブスクリプションの料金は月額 8 ~ 12 ドルです。

AI を活用したディクテーションは現在、プログラマーや一般ユーザーの間で浸透しており、人々がラップトップに向かって話すようになりました。電子メールを書く、SMS を送信する、Web サイトをデザインする、AI にタスクを与えるなど、初期導入者はディクテーションによって作業が速くなり、より明確に考えられ、生産性が向上すると主張しています。

ニューヨークを拠点とする音声ディクテーションアプリ「モノローグ」のゼネラルマネージャー、ナヴィーン・ナイドゥ氏は、「音声を多用してきた人々はもう戻らない。週に20時間もラップトップに向かって話し続けると、タイピングが摩擦のように感じられるようになる」と語る。 「私が考えている方向性は、声が委任層になることです。あなたが自分の意図を話すと、物事が起こります。」

これらの新しい AI ディクテーション アプリは Apple の 先進的なチップ iPhone と Mac でプライベートなオンデバイスディクテーションを実行します。

独立系ソフトウェア開発者のジェフリー・ハントリー氏は、6 月に仕事をほぼ完全に音声に切り替えました。

彼は、コードが生成される前に、音声プロンプトを開いて AI に懸念事項やプロジェクトの要件についてインタビューするよう依頼して、プロジェクトを開始することがよくあります。

「ジャズバンドでリフをするように、後ろ向き、前向き、後ろ向き、前向きに話しかけます」とハントリーは語った。このボーカルダンスにより仕様が改善され、その後 AI がハンドルを握り、 そしてソフトウェアを構築します

Huntley 氏は、コーディング以外にも、ブログ投稿のアイデアやメッセージをキャプチャするときに、次のようなアプリを使用して音声を「リッピング」します。 スーパーウィスパー または、Whisper Flow を使用して、最終編集のためにキーボードに移る前に考えの「最初のダンプ」を取得します。

シリコンバレーでは、入力する代わりに、一度に何時間もコーディング指示を口述筆記するソフトウェア開発者が増えています。急速に進歩する AI エージェントの組み合わせにより、 時間、音声入力はタイピングよりも早く考えを捉えることができるため、生産性が向上しました。

自称「雰囲気コーダー」のマクナマラは、数か月で 25 を超える Web アプリを構築しました。これは、音声指示なしでは不可能な開発速度です。

「そんなことはないと思うよ [typing]どう考えても、会話と同じくらい早く目的地に到達するには効率的または効果的です」とマクナマラ氏は語った。

彼はとりとめのない会話をし、AI を構築するのに数時間を費やしました。 スプラウトギフト、子供向けのギフト レジストリ、および 写真を通じてどんなアイテムでも査定します

確かに、AI は間違いを犯す可能性があり、その動作をチェックする必要があります。

一方で、広く普及することで新たな不便も生じており、パワーユーザーでさえラップトップに向かって話すのが気まずいと感じている。混雑したオープン オフィスは、多くの人が同時にコンピューターで会話できるように設計されていません。

「声は好きだけど、オフィスではダメだ」と、ある人は言った。 ユーザー 「私は他人と話すのが嫌いです。密室のオフィスで話したり、車の中で仕事に行ったりしていました。」

マクナマラはヘッドフォンを使用しているため、人々は彼が電話中だと思い込んでいます。

「これは私がやっているソーシャルハックのようなものです」と彼は言いました。

QwertyキーボードがティッカーテープやFAXに続いて廃れるかどうか、いつ廃れるかを判断するのは時期尚早だが、音声への速度は加速していると、企業にオーディオモデルを提供しているサンフランシスコを拠点とするAssembly AIの創設者ディラン・フォックス氏は語る。

「私たちは間違いなく、音声、AI アプリケーション、インターフェースに対する需要が 10 ~ 100 倍に増加すると考えられる状況の始まりにいます。」と彼は言いました。

プログラマーのマクナマラにとって、チャットボットと話すことが増えたことで、より良い相棒になりました。

彼はテキストメッセージに返信するのが苦手でした。今では彼はすぐに友達に戻ります。

「私はすぐに反応するので、彼らは『この男は誰ですか?』という感じです」と彼は言いました。

#音声ディクテーションのおかげでより多くの人がメールメッセージコードを音声で話すようになりました

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。