音声認識言語
language で認識言語を設定します。
whisper利用時は必須です。sommersでは任意です。対応言語はko(韓国語)、ja(日本語)。省略時はkoが既定値です。
対応言語
Sommers モデル
- 韓国語(
ko)と日本語(ja)に対応 languageを設定しない場合、ko(韓国語)が既定になります
Whisper モデル
- ISO 639-1 の 2 文字コードで 100 言語に対応します。対応言語は Whisper の言語一覧を参照してください。
言語検出と多言語(Whisper 専用)
通常の言語コードに加えて、language には言語検出と多言語処理のための 2 つの特別な値を指定できます。
1. detect - 単一言語の自動検出
単一言語で構成された音声の言語を自動検出します。音声全体が 1 つの言語で構成されているものの、言語が不明な場合に利用できます。
例:
- 音声全体が英語で構成されている場合
- 音声全体が韓国語で構成されている場合
2. multi - 多言語処理
複数の言語が含まれる音声を処理し、文や区間ごとに使用されている言語を認識します。
例:
- 1 つの音声で英語、韓国語、日本語の文が交互に現れる場合
- 文ごとに異なる言語が使用される場合
- 複数の言語を含む国際会議の録音
language_candidates(Whisper 専用)
detect/multi 使用時に候補言語を指定して精度を高められます。
- 既定: ["ko", "ja", "zh", "en"]
注意
whisperではlanguageが必須sommersではlanguageは任意(ko/jaをサポート、既定はko)detect/multiおよびlanguage_candidatesは Whisper 専用機能(sommersでは非対応)- 候補を増やしすぎると精度低下
例
POST のリクエストボディで language を設定します(whisper では必須)。detect/multi の場合は language_candidates の指定も可能です。
POST リクエスト例: サンプル
全体例(プリセット): サンプル