Hanabi AIが提供するAI音声生成プラットフォーム。テキストから自然な音声を生成するテキスト読み上げ(TTS)を中心に、短い音声サンプルから声を再現するボイスクローン、音声のテキスト化(STT)、ボイスチェンジャー、ストーリー制作向けのスタジオ機能までを1つのサービスにまとめている。30以上の言語に対応し、大規模な音声ライブラリから好みの声を検索して使える。中核のTTSモデル「OpenAudio S1」は、音声合成品質のリーダーボード TTS-Arena2 で上位にランクインした実績を持ち、REST APIと各種SDKによる開発者向けの従量課金APIも提供されている。
主な特徴
- 高品質なテキスト読み上げ(TTS): フラッグシップモデル OpenAudio S1 によるTTSは、TTS-Arena2 で高評価を得た自然な発話が持ち味。(cheerful)(hesitating)のような感情・トーンのタグを本文に挿入して、話し方を細かく制御できる
- 短いサンプルからのボイスクローン: 10〜15秒程度の音声サンプルから、声質や話し方の特徴を再現したクローンボイスを作成できる。作った声はTTSやストーリー制作でそのまま利用可能
- 30以上の言語に対応: 日本語・英語・中国語をはじめ多数の言語で音声を生成できる。UIも日本語化されており、日本のユーザーでも扱いやすい
- 検索できる大規模ボイスライブラリ: コミュニティで共有された多数の声を検索・試聴して選べる。自分で声を作らなくても、用途に合う声をすぐ見つけられる
- STT・ボイスチェンジャー・スタジオ機能: 音声の文字起こし、声の変換、複数キャラクターの掛け合いを構成できるストーリー制作向けスタジオなど、音声まわりの作業を一通りカバーする
- 開発者向けAPIとSDK: REST APIと各種SDKを従量課金で提供。APIのレイテンシが低く、リアルタイムの音声エージェント用途にも組み込める
料金
| プラン | 料金 | 主な内容 |
|---|---|---|
| Free | $0 | 月8,000クレジット(音声生成 約7分/月)、パブリックボイス3枠、個人利用・非商用のみ |
| Plus | 年払い$66/年(月額$5.5相当) | 月25万クレジット(約200分/月)、プライベートボイス10枠、Voice Design、優先生成 |
| Pro | 年払い$450/年(月額$37.5相当) | 月200万クレジット(約1,620分/月)、チーム3席、ボイス枠無制限 |
| Max | 年払い$8,988/年(月額$749相当) | 月2,500万クレジット、チーム10席、プロフェッショナルボイス15枠 |
| Enterprise | 要問い合わせ | データ保持なし(Zero Data Retention)、オンプレミス展開、SOC2対応 |
月払い(月ごとの課金)も選べるが、表示価格が改定されることがあるため、月額で契約する場合は公式サイトで最新の金額を確認してほしい。上表は年払い価格を基準にしている。
このほか開発者向けAPIは従量課金制で、サブスクリプションとは別に利用量に応じて課金される。商用利用は有料プランが前提で、公式には「無料プランで生成したコンテンツは個人利用・非商用に限る」と明記されている。業務で使うなら Plus 以上を選ぶことになる。
料金は2026年8月21日時点の情報です。最新の料金は公式サイトをご確認ください。
メリット・デメリット
✅ メリット
- TTS-Arena2 で上位評価を得たモデルによる、自然で高品質な音声生成
- 10〜15秒程度の短いサンプルでボイスクローンを作れる手軽さ
- TTS・クローン・STT・ボイスチェンジャー・スタジオ機能が1つのサービスで完結する
- 無料プランで品質を試せて、有料プランも音声AIとしては手頃な価格帯
- 従量課金のAPIとSDKで、自作アプリやワークフローに組み込みやすい
⚠️ デメリット
- 無料プランの生成量は月約7分と少なく、実用には有料プランがほぼ必須
- クレジット制のため、長尺コンテンツを量産する場合はコストの見積もりが必要
- ボイスクローンは本人の同意なく他人の声を複製すると権利侵害になりうるため、利用には倫理・法律面の注意が要る
- 感情タグなどの細かい制御は、狙いどおりの結果を得るまで試行錯誤が要る
類似サービスとの比較
| 比較項目 | Fish Audio | ElevenLabs | MiniMax Audio | Play.ht |
|---|---|---|---|---|
| 提供元 | Hanabi AI | ElevenLabs | MiniMax | PlayAI |
| 強み | 高品質TTS・低価格・感情タグ | 業界標準の品質・機能の幅広さ | 長文向け・多言語 | API・エンタープライズ向け |
| ボイスクローン | 短いサンプルから可 | 対応(即席/プロ) | 対応 | 対応 |
| 無料プラン | あり(約7分/月) | あり | あり | あり |
| API | 従量課金制 | あり | あり | あり |
こんな人におすすめ
- ナレーション・解説動画・ポッドキャストの音声を低コストで量産したいクリエイター
- 自分の声のクローンを作って、コンテンツ制作を効率化したい配信者
- 音声エージェントや読み上げ機能をアプリに組み込みたい開発者
- ElevenLabsなどの定番サービスより安価な選択肢を探している人
- 日本語を含む多言語の音声コンテンツを1つのツールで作りたい人
まとめ
Fish Audioは、高品質なTTSを核に、ボイスクローン・STT・ボイスチェンジャー・スタジオ機能までを低価格で揃えたAI音声生成プラットフォームである。TTS-Arena2 での高評価が示すとおり品質面の実力は高く、無料プランで気軽に試せるのも良い。まずは無料枠でボイスライブラリと生成品質を確かめ、制作量が増えてきたらPlus以上のプランやAPIの利用を検討するとよい。