Geminiの音声合成(TTS)を無料枠で使うときの上限|モデルごとに1日数回で止まる仕組みと、台本を1回のリクエストにまとめて無音で切り分ける節約法
Geminiの音声合成(TTS)を無料枠で使うときの上限|モデルごとに1日数回で止まる仕組みと、台本を1回のリクエストにまとめて無音で切り分ける節約法
店舗の紹介動画や求人動画にナレーションを付けたいとき、Geminiの音声合成(TTS=文章を読み上げ音声に変える機能)は無料枠でも試せます。ただし、無料枠は「1日に呼び出せる回数」がかなり少なく、使い方を決めずに始めると、その日のうちに止まります。
先に結論を書きます。
- 無料枠の上限は「回数」で数えられます。 当社が2026年9月に実測した時点で、
gemini-3.8-flash-ttsは1分あたり3回・1日あたり10回でした。読ませる文章の長さではなく、リクエストを1回送るごとに1回減ります。 - 上限はモデルごと、かつプロジェクトごとです。 同じプロジェクトのAPIキーを使う作業は、キーを分けていても同じ10回を分け合います。別のモデルは別の枠です。
- 1日の回数は太平洋時間の0時に戻ります。 日本時間では夏時間の間は16時、冬時間の間は17時です。
- 節約の基本は「台本の全文を1回のリクエストで読ませ、返ってきた音声を無音の位置で切り分ける」ことです。 1行ずつ読ませると5行で5回減りますが、まとめれば1回で済みます。
以下、上限の数え方、止まったときの見分け方、1回にまとめる手順の順に説明します。数字は当社が15〜20秒のPR動画にナレーションを付けたときの実測で、Google側の変更で変わることがあります。最新の値は公式のレート制限のページと、Google AI Studioの画面で確認してください。
無料枠の上限はどう数えられるか
数えるのは文字数ではなく「回数」
公式の説明では、上限は「1分あたりのリクエスト数」「1分あたりの入力トークン数」「1日あたりのリクエスト数」の3つで測られます。短い動画のナレーションで先に届くのは、1日あたりのリクエスト数です。
上限に届いたときのエラー(HTTPの429)には、次のように書かれていました。
> Rate limit exceeded for model gemini-3.8-flash-tts (limit: 10 requests per day on Free Tier)
1行だけの短い台詞でも、9行ある台本の全文でも、減るのは同じ1回です。ここが節約法の根拠になります。
モデルごと・プロジェクトごとに別の枠
エラーに出てくる上限の名前は GenerateRequestsPerDayPerProjectPerModel-FreeTier です。名前のとおり、「プロジェクトごと」「モデルごと」に1日の回数を数えています。公式ページにも、上限はAPIキー単位ではなくプロジェクト単位で適用されると書かれています。
実務上の意味は2つあります。
同じプロジェクトのキーを使う作業は、全部で1つの枠を分け合います。 当社では、回数が戻った直後の1時間に、2本の動画のナレーション作業が並行して10回を使い切り、3本目の作業が429で止まったことがあります。キーを作り直しても、同じプロジェクトなら枠は増えません。
モデルが違えば枠も別です。 実測で確認できた範囲は次のとおりです。
| モデル | 無料枠での状況(2026年9月・当社実測) |
|---|---|
gemini-3.8-flash-tts |
使える。1分3回・1日10回 |
gemini-3.8-flash-lite-tts |
使える。上の枠とは別に数えられ、同じ声の名前を指定できる |
gemini-2.5-flash-preview-tts |
使える。3.8 Flashの枠が尽きた時点でも呼び出せた |
gemini-2.5-pro-preview-tts |
使えない。429で「limit: 0」が返る |
Proの音声合成は、公式の料金ページでも無料枠が「利用不可」になっています。無料で試すならFlash系に絞ります。
なお、出来上がった音声を文字に書き起こして確かめる用途で使う、音声合成ではない通常のモデルも別枠です。確認作業で音声合成の回数が減ることはありません。
リセットは日本時間の夕方
公式ページには、1日あたりの回数は太平洋時間の0時に戻ると書かれています。日本時間に直すと、夏時間の間(3月中旬〜11月上旬)は16時、それ以外は17時です。
日本の営業時間で考えると、「午前中に使い切ると、夕方まで戻らない」ことになります。逆に、夕方に戻った直後から使えば、翌日の夕方までが1日分です。ナレーションを作る日は、どの時間帯に何回使うかを先に決めておくと止まりません。
止まったときの見分け方
429のエラーには「約30秒後に再試行してください」という案内が付くことがあります。1分あたりの上限に当たった場合は待てば通りますが、1日あたりの上限に当たった場合は、30秒待っても戻りません。
見分けるには、エラー本文の limit: の後ろを読みます。
requests per dayが含まれている … 1日あたりの上限。リセット時刻まで通らないので、自動の再試行を止めるlimit: 0… そのモデルは無料枠では使えない。モデルを変える- どちらでもない … 1分あたりの上限に当たった可能性がある。1分置いて1回だけ試す
再試行を自動で繰り返す作りにしていると、1日あたりの上限に当たったあとも失敗を積み重ねるだけになります。エラー本文に per day が含まれていたら処理を止める、という分岐を入れておきます。
回数はどこで減るのか
15秒の動画に5行ほどのナレーションを付けるだけなら、10回で足りそうに見えます。実際には、次の3つで回数が減っていきます。
- 声の聞き比べ。 声の種類(Kore、Sulafatなど、標準で用意された声が30種類)を変えて同じ台本を読ませると、1声につき1回減ります。3声を比べれば3回です。
- 1行ずつの生成。 台本を行ごとに送ると、行数と同じだけ減ります。4行で4回です。
- やり直し。 読み間違いや長さの不具合で作り直すと、そのたびに減ります。動作確認のためだけのテスト呼び出しも1回です。
当社の実測でも、3声の聞き比べ、別の動画の4行、失敗のやり直しが同じ日に重なり、午後には上限に届きました。1本ずつは少なくても、同じ枠を分け合っていると足りなくなります。
節約法:台本の全文を1回で読ませ、無音で切り分ける
手順
- 台本を1つの文章にまとめる。 行と行の間は空行にします。声の指示に「行間は1秒ほど間を取る」と入れておくと、あとで切り分けやすくなります。
- 1回のリクエストで読ませる。 返ってくる音声は、24kHz・モノラル・16bitのWAV形式です。
- 無音の位置で切り分ける。 音の大きさを20ミリ秒幅でならし、一定の大きさ(当社は最大振幅を1としたときの0.01)を超える部分を「声がある区間」とみなします。声のない時間が0.25〜0.4秒以上続いた位置を区切りにします。
- 区間の数と行の数が合うか確かめる。 合わなければ、次の項の方法で対応を付けます。
- 切り分けた音声をファイルに保存し、動画の各場面へ置く。 保存しておけば、動画側を直したときに音声を作り直さずに済みます。
20秒の動画に9行のナレーションを付けた例では、全文を1回で読ませ、無音で12区間に分かれたものを9行に束ねて配置しました。使った回数は1回です。1行ずつ読ませていれば9回で、その日の残りは1回になっていました。
まとめて読ませる方法には、回数以外の利点もあります。1回の読み上げの中なので、声の調子や抑揚が行の間でそろいます。
区間の数が行数と合わないとき
句点「。」や読点「、」のところで長めの間が入ると、1行が2つか3つの区間に割れます。たとえば「(製品名)。(短い句)、(短い句)。」という形の最終行は、3区間に分かれました。
この場合は、切り分けの基準をいじるより、どの区間がどの行にあたるかの対応表を作って束ねるほうが確実です。音声を書き起こし用のモデルに渡し、時刻付きで文字にさせると、各区間が何を読んでいるかが分かります。それを見て「区間1〜2が1行目、区間3が2行目」のように書き出します。
区間の数が想定と違うときは、そのまま先へ進めず止まるようにしておきます。数が合わないまま配置すると、違う場面に違う台詞が乗ります。
回数を無駄にしないための検査
やり直しは回数を減らします。1回目で使える音声を得るために、次の点を先に決めておきます。
読ませる原稿と声の指示を分ける
公式の説明では、Gemini 3.8の音声合成は、入力した文章を「一字一句そのまま読む原稿」として扱います。声の調子の指示は、原稿とは別の欄(speech_metadata の style)に書きます。
原稿の先頭に「落ち着いた声で読んでください:」のような指示を混ぜると、次のことが起こりえます。
- 指示の文章まで読み上げられる。
gemini-3.8-flash-lite-ttsに指示文つきで送ったところ、1行が23〜45秒の音声になりました。指示文をすべて声に出していたためです。 - 原稿に無い台詞が足される。 旧来の呼び出し方で先頭に指示を書いたところ、エラーは出ずに音声が返りましたが、5行の原稿が35.6秒になり、前半の約20秒は原稿に無い言葉でした。
どちらもエラーにはならないので、気づかずに動画へ載せると、声が重なったり、言っていないことを話すナレーションになったりします。原稿欄には台詞だけを入れ、指示は専用の欄に分けます。
配置の前に長さを測る
上の2つの不具合は、どちらも「長さが想定より大幅に長い」という形で現れます。音声を動画に置く前に、無音を除いた長さを測り、割り当てた時間の1.8倍を超えていたら採用しない、という検査を入れています。
全体を書き起こして原稿と見比べるだけでは、余計な台詞が足されていても見落とすことがあります。長さの検査と、区間ごとの書き起こしを組み合わせます。
読み間違いは、その行だけ作り直す
漢字の読み間違いは起こります。当社の例では「口調」が「とくちょう」と読まれました。この場合は、その語をひらがなにした1行だけを作り直します。全文を作り直すのと同じ1回ですが、ほかの行の音声を保存してあれば、そろえ直す手間がかかりません。
製品名など読みが決まっている語は、最初からカタカナで渡しておくと、やり直しが減ります。音声は画面に表示されないので、表記のルールとはぶつかりません。
無料枠で足りるか、課金に切り替えるか
判断の目安は次のとおりです。
| 状況 | 向いている選択 |
|---|---|
| 月に1〜2本、短い動画にナレーションを付ける | 無料枠。全文1回+保存して使い回す |
| 声を何種類も聞き比べたい | 無料枠なら日を分ける。1日で決めたいなら課金 |
| 同じ日に複数の動画を並行して作る | 課金。無料枠は全作業で10回を分け合うため足りない |
| Proの音声を使いたい | 課金。無料枠では使えない |
公式ページによると、支払い方法を登録すると有料の段階(Tier 1)に上がり、多くの場合はすぐに反映されます。費用は使った分だけです。公式の料金表では、gemini-3.8-flash-tts の出力は音声10秒あたり0.00225ドル相当(2026年12月末まで。2027年1月からは0.0045ドル相当)とされています。15秒のナレーションなら1回あたり1円に届かず、やり直しを数回含めても数円の範囲です。ナレーションを継続して作るなら、回数の制限で作業が止まる時間のほうが高くつきます。
もう1つ、無料枠を使うときに知っておきたい点があります。公式の料金ページでは、無料枠で送った内容はGoogleの製品改善に使われるとされています。店舗の紹介文を読ませる程度なら問題になりにくいですが、お客様の名前など個人が分かる内容は、無料枠の原稿に入れないでください。
まとめ
- Geminiの音声合成の無料枠は、文字数ではなく回数で数えられる。実測では
gemini-3.8-flash-ttsが1分3回・1日10回 - 上限はモデルごと・プロジェクトごと。同じプロジェクトの作業はキーを分けても同じ枠を分け合い、別のモデルは別枠。Proは無料では使えない
- 1日の回数は太平洋時間の0時(日本時間の16時または17時)に戻る。
per dayのエラーは待っても通らない - 台本は全文を1回で読ませ、無音で切り分ける。区間の数が合わないときは対応表で束ねる
- 原稿と声の指示は分け、配置の前に長さを測る。成功した音声は保存して使い回す
ナレーションを付ける前の素材づくりについては、静止画バナーをAIで動画広告にする手順と、スタッフ向けの説明動画は撮ったまま渡さないにまとめています。店舗の動画づくりやAIの使いどころで迷ったときは、graciautoまでご相談ください。