メインコンテンツまでスキップ

音声認識言語

language で認識言語を設定します。

  • whisper 利用時は必須です。
  • sommers では任意です。対応言語は ko(韓国語)、ja(日本語)。省略時は ko が既定値です。

対応言語

Sommers モデル

  • 韓国語(ko)と日本語(ja)に対応
  • language を設定しない場合、ko(韓国語)が既定になります

Whisper モデル

  • ISO 639-1 の 2 文字コードで 100 言語に対応します。対応言語は Whisper の言語一覧を参照してください。

言語検出と多言語(Whisper 専用)

通常の言語コードに加えて、language には言語検出と多言語処理のための 2 つの特別な値を指定できます。

1. detect - 単一言語の自動検出

単一言語で構成された音声の言語を自動検出します。音声全体が 1 つの言語で構成されているものの、言語が不明な場合に利用できます。

例:

  • 音声全体が英語で構成されている場合
  • 音声全体が韓国語で構成されている場合

2. multi - 多言語処理

複数の言語が含まれる音声を処理し、文や区間ごとに使用されている言語を認識します。

例:

  • 1 つの音声で英語、韓国語、日本語の文が交互に現れる場合
  • 文ごとに異なる言語が使用される場合
  • 複数の言語を含む国際会議の録音

language_candidates(Whisper 専用)

detect/multi 使用時に候補言語を指定して精度を高められます。

  • 既定: ["ko", "ja", "zh", "en"]
注意
  • whisper では language が必須
  • sommers では language は任意(ko/ja をサポート、既定は ko
  • detect/multi および language_candidates は Whisper 専用機能(sommers では非対応)
  • 候補を増やしすぎると精度低下

POST のリクエストボディlanguage を設定します(whisper では必須)。detect/multi の場合は language_candidates の指定も可能です。

POST リクエスト例: サンプル

全体例(プリセット): サンプル