Deepgram が提供する、音声認識(STT)・音声合成(TTS)・音声対話エージェントを単一の API でまとめて扱える音声AIプラットフォーム。低遅延のストリーミング処理に強みを持ち、自然なターンテイキングや割り込みに対応した音声対話を構築できる。話者分離・要約などの音声解析機能も備え、コールセンターや音声アシスタントの構築に向く。クラウド提供に加えてオンプレミス/VPCへのセルフホストにも対応し、エンタープライズでの大規模導入実績を持つ。2015年8月の設立。
主な特徴
- Speech-to-Text API: ストリーミング・バッチの両方に対応し、50以上の言語を認識できる。話者分離やスマートフォーマット、要約といった音声解析機能も併せ持つ
- Text-to-Speech API: 低遅延の音声合成を提供する。Flux TTS など新しいモデルも順次追加されている
- Voice Agent API: 音声対話エージェントを構築するための統合API。ターンテイキングや割り込み処理に対応し、自然な会話のやり取りを実現する
- Audio Intelligence API: 音声データからトピック検出・感情分析・要約などのインサイトを抽出する機能を提供する
- セルフホスト対応: クラウド版に加えてオンプレミス/VPCへのデプロイに対応し、データを外部に出したくないエンタープライズ要件にも応えられる
料金
Pay As You Go の従量課金が基本で、STT・Voice Agent とも利用量に応じた単価が設定されている。新規登録時には無償クレジットが付与される。年間契約のプリペイド型プランも用意されており、従量課金より割引が効く。Enterprise プランは要問い合わせで、詳細な料金・機能は非公開のため本記事では言及しない。
| プラン | 料金 | 主な特徴 |
|---|---|---|
| Pay As You Go | 従量課金。STT $0.0043〜$0.0092/分、Voice Agent $0.056〜$0.122/分。新規登録で$200クレジット付与 | 全パブリックモデルの全エンドポイントが利用可能、コミュニティ/Discordサポート |
| Growth | 年間$4,000〜のプリペイドクレジット | 従量課金比10〜20%割引、より高い同時実行数枠 |
| Enterprise | 要問い合わせ | セルフホスト/VPCデプロイ、専任サポート等(詳細非公開) |
料金は2026年9月時点の情報です。最新の料金は公式サイトをご確認ください。
メリット・デメリット
✅ メリット
- ストリーミングのレイテンシが低く、リアルタイム性が求められる音声アプリの構築に強い
- STT・TTS・Voice Agent の3種類のAPIをワンストップで提供し、音声まわりの機能を1社でまとめられる
- セルフホスト/VPCデプロイに対応し、データを外部に出しにくいエンタープライズ要件にも応えやすい
- 新規登録時のクレジット付与があり、小規模な検証から始めやすい
⚠️ デメリット
- Enterprise プランの詳細・料金は非公開で、大規模導入時は個別見積もりが前提になる
- 音声からの感情分析などの解析の深さでは、専業の AssemblyAI に劣るとの指摘がある
- Flux TTS など一部の新モデルは期間限定の無償提供であり、恒久的な無料枠ではない点に注意が必要
- 料金・機能は改定が続いているため、導入検討時は都度公式ページでの確認が欠かせない
類似サービスとの比較
| 比較項目 | Deepgram | AssemblyAI | OpenAI Whisper API | Google Speech-to-Text |
|---|---|---|---|---|
| 提供元 | Deepgram | AssemblyAI | OpenAI | |
| 主な用途 | リアルタイム音声認識・合成・対話エージェント | 音声インテリジェンス(感情分析・PII削除等) | バッチでの音声書き起こし | 汎用音声認識 |
| 動作環境 | クラウドAPI / セルフホスト(VPC) | クラウドAPI | クラウドAPI | クラウドAPI(Google Cloud) |
| ストリーミング対応 | 対応(低遅延) | 対応 | 非対応(バッチ特化) | 対応 |
| 特徴 | STT・TTS・音声対話をワンストップ提供 | 音声解析機能の深さ | 低価格・高精度な書き起こし | Google Cloud エコシステムとの統合 |
こんな人におすすめ
- コールセンターや音声アシスタントなど、低遅延のリアルタイム音声対話を構築したいエンジニア
- 音声認識・音声合成・対話エージェントを別々のサービスで組み合わせず、1つのAPIでまとめたいチーム
- 会議や動画コンテンツの自動文字起こしを業務フローに組み込みたい担当者
- データを外部クラウドに出しにくく、セルフホスト/VPCでの音声AI導入を検討している企業
- 音声データからトピックや感情といったインサイトを抽出したい人
まとめ
Deepgram は、音声認識・音声合成・音声対話エージェントを単一のAPIで扱える音声AIプラットフォームであり、低遅延ストリーミングによる自然な会話のやり取りが中心的な強みである。料金は従量課金が基本で新規登録クレジットもあり小さく試しやすい一方、Enterprise 領域の詳細は非公開で、感情分析などの音声解析の深さでは専業サービスに一歩譲るとの指摘もある。リアルタイム性を重視した音声アプリを作るなら有力な選択肢だが、解析機能の深さを重視する用途では AssemblyAI などとの比較検討もあわせて行いたい。