Exclusive invitation-only access. Global public launch coming in 2026.

T
f/technologie
2年前Technology
0:00/0:00

OpenAIは最近、Voice Engineという新しいツールの小規模なプレビューを行ったと発表しました。

これは、15秒の音声サンプルを分析することで、任意の話者を模倣できる音声クローン技術です。同社はこれが「自然な音声」を生み出し、「感情豊かでリアルな」声を再現すると主張しています。

無限の可能性...と深刻なリスク

この技術は、同社の既存の音声合成APIを基にしており、2022年から開発が進められています。OpenAIはすでに、現在の音声合成APIおよびテキスト読み上げ機能で利用できるプリセットの音声に、このツールキットの一部を使用しています。公式ブログにはいくつかの例が掲載されており、それらは現実に非常に近いものであると感じられます。ぜひ聴いてみて、その可能性を良い面と悪い面の両方で想像してみてください。

可能な用途とプライバシーの懸念

OpenAIは、この技術が読み上げ支援、言語翻訳、突然や進行性の話し方障害を持つ人々の助けになる可能性があると述べています。しかし、悪意のある者がこの技術を悪用し、本物そっくりのディープフェイクを作るために利用する危険も確かに存在します。現状、このVoice Engineは一般公開に向けて準備が整っておらず、全展開前に解決すべき深刻なプライバシーの懸念があります。

安全策と責任あるアプローチ

OpenAIは、この技術が「選挙イヤーにおいて特に深刻なリスクを伴う」と認めています。同社は、「政府、メディア、エンターテインメント、教育、シビルソサエティなど、多様な背景を持つアメリカおよび国際的なパートナーからのフィードバックを取り入れ、安全に製品を展開できるよう努めている」と述べています。すべてのプレビュー参加者は、OpenAIの利用規約に同意し、他者になりすます行為や合法的な権利のない模倣を禁じています。

透明性と使用管理

さらに、技術を使用する者は、自分の音声がAIによって生成されたものであることを視聴者に明らかにする義務があります。OpenAIは、音声の出所を追跡できるデジタルウォーターマーキングや、「積極的なモニタリング」などの安全対策を導入しています。正式リリース時には、「禁止済みの声リスト」が作成され、著名人に非常に似たAI生成の声を検知・防止します。

価格設定と今後の計画

展開のタイミングについて、OpenAIは慎重に情報を控えています。TechCrunchがいくつかの価格推定情報を明らかにしており、競合他社のElevenLabsなどをやや過小評価しているようです。Voice Engineのコストは、100万文字、約162,500語、つまりスティーブン・キングの『シャイニング』くらいの長さの音声を生成するのに約15ドルと予想されています。これはオーディオブックを作成するのに経済的な方法と言えるでしょう。マーケティング資料には、「HD」バージョンもあり、倍の価格だと記載されていますが、その詳細は明らかにされていません。

巨大な可能性と克服すべき課題

OpenAIは今週も複数の大きな発表を続けています。最新の発表では、親しいパートナーであるMicrosoftと協力して、「Stargate」というAIスーパーコンピュータを構築する計画を公表しました。報道によれば、このプロジェクトの費用はなんと1000億ドルにのぼるといいます。

Keoby Social Media Website