Whisper
デフォルト
汎用音声認識モデル
汎用音声認識モデル
性能
平均
速度
中
料金
$0.006
コスト
入力
音声
出力
テキスト
Whisper は、多様な音声を含む大規模なデータセットで学習した汎用音声認識モデルです。多言語の音声認識に加え、音声翻訳や言語識別を行うマルチタスクモデルとしても使用できます。
料金
料金は、使用したトークン数、またはモデルの種類に応じたその他の指標に基づいて算出されます。検索やコンピューターの使用など、特定のツール向けのモデルでは、ツール呼び出しごとに料金が発生します。詳細は料金ページをご覧ください。
料金
ユースケース / 1M トークン
Transcription
コスト / 分
$0.006
モダリティ
テキスト
出力のみ
画像
非対応
音声
入力のみ
動画
非対応
エンドポイント
ライブ
v1/live/sessions
Chat Completions
v1/chat/completions
Responses
v1/responses
Realtime
v1/realtime
リアルタイム翻訳
v1/realtime/translations
リアルタイム文字起こし
v1/realtime/transcription_sessions
Assistants
v1/assistants
バッチ
v1/batch
ファインチューニング
v1/fine-tuning
埋め込み
v1/embeddings
画像生成
v1/images/generations
動画
v1/videos
画像編集
v1/images/edits
音声生成
v1/audio/speech
文字起こし
v1/audio/transcriptions
翻訳
v1/audio/translations
モデレーション
v1/moderations
Completions(レガシー)
v1/completions
スナップショット
スナップショットを使うと、モデルを特定のバージョンに固定し、性能と動作の一貫性を維持できます。以下は、Whisper で利用可能なすべてのスナップショットとエイリアスの一覧です。
whisper-1
whisper-1
whisper-1
レート制限
レート制限は、一定期間内のリクエスト数、トークン数、音声の長さなどの利用量に上限を設けることで、API への公平で安定したアクセスを確保します。上限値は利用ティアによって決まります。利用ティアは、リクエスト数と API の利用金額が増えるにつれて自動的に上がります。
| ティア | RPM | RPD |
|---|---|---|
| 無料 | 3 | 200 |
| ティア 1 | 500 | - |
| ティア 2 | 2,500 | - |
| ティア 3 | 5,000 | - |
| ティア 4 | 7,500 | - |
| ティア 5 | 10,000 | - |