ローカル文字起こしモデルの選び方:WhisperとParakeet
ローカル音声認識モデルは、大きいほど必ず自分の用途で優れるわけではありません。対応言語、端末メモリ、CPU・GPU、モデルサイズ、話す内容、待ち時間の許容度で選びます。日本語を使う場合は多言語Whisper系を出発点にし、実際の文章で修正量を比べてください。
最終確認日: 2026-07-31. 本記事はVoicetyprが公開しています。モデルの対応範囲はVoicetyprの出荷カタログ、OpenAIとNVIDIAの公式モデル資料で確認しました。未測定の速度・WERは掲載しません。 公開資料を基にした編集比較であり、記載していない実機テスト、提携、認識精度の優位性は主張しません。
結論
日本語や多言語なら多言語Whisperモデルから始め、軽いモデルと大きいモデルを同じ30〜60秒の原稿で比較します。英語中心で対応ハードウェアを使う場合はParakeetも候補です。端末が熱くなる、確定が遅い、他アプリが重いなら一段軽いモデルを選びます。
用途別の判断
日本語中心
多言語Whisperから開始
日本語を扱えることを先に満たし、サイズ間の修正量と待ち時間を比較します。
古い・低メモリ端末
軽いモデルを優先
理論上の品質より日常的に待たずに使えることが重要です。
英語中心の対応端末
Parakeetも比較
対応言語とハードウェア条件を確認し、同一原稿でWhisper系と比べます。
選ぶときの基準
言語
モデルカードの対応言語と、実際に混ぜる日本語・英語・固有名詞を確認します。
端末資源
ダウンロード容量、メモリ、CPU・GPU負荷、発熱を日常アプリと同時に見ます。
修正量
同じ原稿で意味修正と固有名詞修正を数えます。
確定時間
話し終えてから文字が使えるまでを複数回測ります。
まず対応言語を絞り込む
Whisperは多言語音声認識を対象にしたモデル群です。ただしモデル名や実装により英語専用と多言語の区別があるため、日本語では多言語版かを確認します。
Parakeet系はモデルカードごとに対応言語と用途が異なります。「Parakeet」という名前だけで日本語対応を推測せず、Voicetyprの選択画面と元モデルの公式カードを確認してください。
大きさと体感を同時に測る
大きいモデルはより多くの端末資源を使う可能性があります。音声入力中だけでなく、ブラウザ、IDE、会議アプリを同時に動かした状態で待ち時間と発熱を確認します。
最も大きいモデルで修正が少し減っても、確定が遅くて毎回待つなら総作業時間は増えることがあります。軽い候補と大きい候補を同じ原稿で比較してください。
モデル取得とオフライン運用
ローカルモデルは初回取得に通信と保存容量が必要です。出張や制限ネットワークで使う前にモデルを取得し、アプリを再起動してWi-Fiを切った状態で文字化を確認します。
モデルの更新や削除手順も運用の一部です。チームでは全員に同じモデルを強制するより、端末と利用言語の組み合わせを記録してサポート可能な範囲を決めます。
制限と確認事項
- モデル別の日本語WERや遅延を公開していません。
- 対応言語はすべての方言・専門語で同じ品質を保証しません。
- モデル一覧と端末要件はアプリ更新で変わる可能性があります。
評価方法
- 出荷モデル情報と元モデルの公式カードを照合しました。
- 言語、端末負荷、修正量、確定時間を別の軸として整理しました。
- 実測のない順位や数値を記載していません。
参照元
購入前に、価格・動作要件・プライバシー条件を各提供元で再確認してください。
よくある質問
一番大きいモデルが最もおすすめですか?
一律には決まりません。修正量が減っても確定時間や端末負荷が増える場合があるため、日常アプリと同時に試してください。
日本語ではどのモデルから試しますか?
日本語を扱える多言語Whisperモデルから始め、軽い候補と大きい候補を同一原稿で比較してください。
モデル取得後はオフラインですか?
通常のローカル文字化は端末内で行えます。ただしライセンス、更新、任意のクラウド機能は別の通信経路です。
自分の文章と環境で確かめる
Voicetyprはカード登録なしで3日間試せます。同じマイク、同じ原稿、同じ入力先で修正量と通信条件を確認してから判断してください。