コンテンツにスキップ

Gemini API 連携

Gemini は Ayumi の任意のクラウド文字起こしエンジン2つを支えています。プロンプトで録音を整形する Gemini と、言語・話者・語彙のオプションを持つ Google の文字起こし専用モデル Gemini Transcribe です。どちらも同じキーを使います。自分の API キーを使う BYOK(Bring Your Own Key)方式なので、コストと使用量を完全にコントロールできます。

  1. Google AI Studio にアクセス
  2. Google アカウントでサインイン
  3. API キーのセクションに移動
  4. 新しい API キーを作成
  5. キーをコピー
  1. Ayumi > 設定(または Cmd+,)を開く
  2. 文字起こし タブに移動
  3. Gemini セクションに Gemini API キーを貼り付け
  4. Gemini のプロファイル(Clean Transcript など)に★を付けて既定にするか、録音ごとに選ぶ
  1. 文字起こし設定を開く
  2. Gemini セクションに Gemini API キーを入力
  3. Gemini のプロファイルに★を付けて既定にするか、録音ごとに選ぶ

Gemini セクションのキーはプロバイダの基本キーです。Gemini と Gemini Transcribe のすべてのプロファイルがこれを使い、プロファイル側で Override API Key を設定した場合だけそのキーで上書きされます(特定のプロファイルだけ別プロジェクトに課金したい場合など)。エンジン・モデル・プロンプト・文字起こしオプションはプロファイルに属します。

キーは入力するそばからデバイスの Keychain に安全に保存されます。保存ボタンはありません。

モデル説明
gemini-3.8-flash最新の安定版 Flash
gemini-3.7-flashひとつ前の安定版 Flash。新規設定時のデフォルト
gemini-3.6-flash以前の安定版 Flash
gemini-3.5-flash-lite軽量モデル、より高速で低コスト
gemini-2.5-flash実績のある安定版 Flash
gemini-2.5-flash-lite2.5 世代の軽量モデル
カスタム任意の Gemini モデル ID を入力可能(プレビュー版や提供終了予定のモデルも、Google 側で停止されるまで動作します)

組み込みの Gemini Transcribe プロファイルが Google の文字起こし専用モデルを言語自動検出・Smart スタイルで使います。★を付けて既定にするか、複製して上記のオプションを設定してください。同じ API キーで動作し、プロンプトは受け付けません。オプションは専用セクションに表示されます。

オプション
Language(言語)自動、または85以上の言語から選択
Style(スタイル)Smart(整形)または Verbatim(一語一句)
Label Speakers(話者ラベル)Verbatim のみ、最大8人
Word Timestamps(単語タイムスタンプ)Verbatim のみ、段落ごとに [mm:ss–mm:ss] の区間
Custom Vocabulary(カスタム語彙)改行区切りの Markdown ファイル(iCloud Drive など)、プロファイルに入力した語、またはその両方

使用されるモデルは gemini-3.5-transcribe です。各オプションが文字起こしにどう影響するかは 音声録音 を参照してください。

プロファイルはエンジンと「何をさせるか」をひとまとめにしたもので、名前ひとつで設定全体を選べます:

  1. 文字起こし設定に移動
  2. Add Profile をタップ
  3. 名前を付ける
  4. Engine を選ぶ(オンデバイス、Gemini、Gemini Transcribe)。Gemini なら Model も選ぶ
  5. プロンプトの指示を記述(Gemini の場合)、または言語・スタイル・話者ラベル・追加語彙を設定(Gemini Transcribe の場合)
  6. 保存

プロファイルは録音ビューに表示され、ショートカットからも一覧で選べます。初期プロファイルも通常のプロファイルなので、編集・複製・並べ替え・削除が自由にできます。

On-device プロファイルに★を付ければ、既定では音声が Google に送信されなくなります。Gemini のキーとプロファイルはそのまま残るので、Gemini のプロファイルを選べば引き続き動き、いつでもエントリーを文字起こしし直せます。

いずれかの Gemini エンジンの使用時:

  • 音声データは処理のために Google のサーバーに送信されます
  • Ayumi は最初の API 呼び出し前に同意ダイアログを表示します
  • Ayumi のサーバーにはデータは保存されません — API 呼び出しはデバイスから Google に直接行われます
  • Google の API データ取り扱いについては Google AI の利用規約 をご確認ください