Gemini 3.7 Flash API Pricing: Cutting-Edge Adaptive Reasoning and Velocity
Comprehensive Gemini 3.7 Flash API pricing analysis ($0.75/M input, $3.75/M output), native thinking token budgets, 1M context caching, and sub-second multimodal latency.
Full specs, context window and API limits →How much does Gemini 3.7 Flash cost per million tokens?
Gemini 3.7 Flash costs $0.75 per million input tokens and $3.75 per million output tokens ($1.50/M blended at 3:1). Google state-of-the-art model offering dynamic hybrid reasoning with adjustable thinking tokens and sub-second multimodal speed. Verified 2026-09-08.
How much does Gemini 3.7 Flash cost per 1,000 requests?
Computed from generated token pricing. Each row assumes the listed input and output tokens per request; this model has no measured verbosity factor, so the unadjusted output estimate is shown.
| Request shape | Input tokens | Output tokens | Cost / 1,000 requests |
|---|---|---|---|
| Short | 100 | 50 | $0.2625 |
| Medium | 1,000 | 500 | $2.6250 |
| Long | 4,000 | 2,000 | $10.5000 |
Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Unadjusted — no measured verbosity factor is available.
Exact-model pricing guide · verified 2026-09-07
Exact model boundary: Google Gemini 3.7 Flash (gemini-3.7-flash). Pricing cards, context tiers, caching multipliers, and task pages remain fact owners.
Context tier 1 versus tier 2 pricing threshold table
Frozen scenario board. Formula / deterministic rule: rate = (tokens <= 128000) ? tier1_rate : tier2_rate; tier 2 doubles unit cost Boundary: Owns context window threshold economics for Gemini 3.7 Flash.
| Frozen scenario | Exact identity and evidence fields | Result | State |
|---|---|---|---|
| short query (8K tokens) | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=short query (8K tokens); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — short query (8K tokens) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| document extraction (64K) | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=document extraction (64K); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — document extraction (64K) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| borderline tier (128K) | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=borderline tier (128K); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — borderline tier (128K) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| large repo analysis (250K) | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=large repo analysis (250K); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — large repo analysis (250K) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| extreme context analysis (1M) | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=extreme context analysis (1M); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — extreme context analysis (1M) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| unsupported context threshold | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=unsupported context threshold; token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — unsupported context threshold has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.
Multimodal video, audio & image billing rates
Frozen scenario board. Formula / deterministic rule: media_bill = video_seconds * video_rate + audio_seconds * audio_rate + images * image_rate + text_tokens * token_rate Boundary: Owns multimodal ingestion token economics.
| Frozen scenario | Exact identity and evidence fields | Result | State |
|---|---|---|---|
| single image OCR | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=single image OCR; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — single image OCR is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| 1-minute audio recording | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=1-minute audio recording; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — 1-minute audio recording is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| 10-minute video clip analysis | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=10-minute video clip analysis; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — 10-minute video clip analysis is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| mixed text and video prompt | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=mixed text and video prompt; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — mixed text and video prompt is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| high-resolution visual QA | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=high-resolution visual QA; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — high-resolution visual QA is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| unsupported media format | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=unsupported media format; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — unsupported media format has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: Google Gemini model guide; verification date 2026-09-07. Missing or conflicting joins fail closed.
Extended-thinking reasoning compute budget planner
Frozen scenario board. Formula / deterministic rule: total_out_cost = (thinking_tokens + response_tokens) * output_rate; thinking is billed at output rate Boundary: Owns reasoning compute budget management.
| Frozen scenario | Exact identity and evidence fields | Result | State |
|---|---|---|---|
| standard response (no thinking) | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=standard response (no thinking); reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — standard response (no thinking) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| light deliberation (1K thinking) | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=light deliberation (1K thinking); reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — light deliberation (1K thinking) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| medium deliberation (4K thinking) | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=medium deliberation (4K thinking); reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — medium deliberation (4K thinking) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| deep reasoning (16K thinking) | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=deep reasoning (16K thinking); reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — deep reasoning (16K thinking) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| maximum thinking budget | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=maximum thinking budget; reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — maximum thinking budget is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| uncontrolled thinking overflow | model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=uncontrolled thinking overflow; reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — uncontrolled thinking overflow has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.
Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run this scenario →
Gemini 3.7 Flash API Pricing: Cutting-Edge Adaptive Reasoning and Velocity
Gemini 3.7 Flash costs $0.75 per million input tokens and $3.75 per million output tokens ($1.50/M blended at 3:1). Google state-of-the-art model offering dynamic hybrid reasoning with adjustable thinking tokens and sub-second multimodal speed. Verified 2026-09-08.
Gemini 3.7 Flash delivers adaptive thinking reasoning at an economical $1.50/M blended rate.
| Scenario | Rendered Evidence & Bounds |
|---|---|
| Scenario 1 | Standard multimodal image Q&A (2K in, 400 out): $0.003000 per request |
| Scenario 2 | Complex coding challenge with thinking (3K in, 2K thought+out): $0.009750 per run |
| Scenario 3 | High-resolution document extraction and verification (8K in, 1K out): $0.009750 per document |
| Scenario 4 | Autonomous agent multi-turn planning session (16K in, 3K out): $0.023250 per session |
| Scenario 5 | Full 1-hour audio meeting transcription & analysis (60K in, 4K out): $0.060000 per meeting |
| Scenario 6 | Monthly enterprise hybrid reasoning tier (50M blended tokens): $75.00 infrastructure budget |
Configurable thinking budgets enable a single model to serve both instant chat and deep analysis.
| Scenario | Rendered Evidence & Bounds |
|---|---|
| Scenario 1 | Zero thinking budget: behaves as ultra-fast flash model with sub-100ms TTFT latency |
| Scenario 2 | Light thinking (500-1K tokens): optimal for structured JSON extraction and syntax validation |
| Scenario 3 | Deep thinking (4K-8K tokens): maximum reasoning power for competitive coding and math proofs |
| Scenario 4 | Dynamically adjust budget based on user intent: zero for casual chat, 4K for complex debug queries |
| Scenario 5 | Prevents uncontrolled reasoning token generation while guaranteeing logical precision |
| Scenario 6 | Cuts average developer query cost by 45% compared to static reasoning models |
Google context caching makes 1M token multimodal interactions economically sustainable.
| Scenario | Rendered Evidence & Bounds |
|---|---|
| Scenario 1 | Cached video tutorial collection (150K tokens, 2K query): 72% input cost reduction |
| Scenario 2 | Large software repository context cache (80K tokens): $0.01500 vs $0.06000 per query |
| Scenario 3 | Multi-turn legal discovery exploration: 70% cumulative input savings across query sessions |
| Scenario 4 | Hourly storage fee ($1.50/M/hr) fully amortized after only 2 queries per hour |
| Scenario 5 | Instantaneous TTFT response on cached multimodal prompt prefixes |
| Scenario 6 | Enables fluid interactive conversational exploration over deep video and audio archives |
Gemini 3.7 Flash pricing evidence
Source-backed dated rate shape: input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31. Gemini 3.7 Flash token and thinking economics only; Google quotas, multimodal rankings, and broad Gemini verdicts retain their owners. Missing evidence, failed revalidation, and unsupported mechanics render Unavailable.
Module 1 of 3: Thinking-budget bill ladder
Novel contribution boundary: Owns dated Flash arithmetic for fixed thinking and output shapes; thinking quality and latency are not asserted. Formula / deterministic rule: spend = requests × (inputTokens × inputRate + outputTokens × outputRate) / 1,000
| Scenario | Exact model, provider, and fixed inputs | Result | State |
|---|---|---|---|
| 20K compact thinking turns | model=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=requests=20,000; inputTokens=1,000; outputTokens=500; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
| 50K coding-agent turns | model=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=requests=50,000; inputTokens=4,000; outputTokens=1,500; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
| 100K long thinking turns | model=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=requests=100,000; inputTokens=8,000; outputTokens=3,000; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
First-party registry provenance: https://ai.google.dev/gemini-api/docs/pricing; registry provider google; verified 2026-08-14; freshness gate=2026-09-14. Revalidate before any current-price claim.
Module 2 of 3: Flash→Pro accepted-result threshold
Novel contribution boundary: Owns dated escalation arithmetic with explicit retry input; accepted-result quality and endpoint behavior are not sourced. Formula / deterministic rule: requiredAcceptedRate = Pro attempt-plus-retry cost / Flash attempt cost; observed acceptance = Unavailable
| Scenario | Exact model, provider, and fixed inputs | Result | State |
|---|---|---|---|
| Short thinking turn; 10% retry share; 200 retry-input tokens | model=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=requests=1; inputTokens=1,000; outputTokens=500; retryInputTokens=200; retryShare=10%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
| Medium agent turn; 20% retry share; 600 retry-input tokens | model=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=requests=1; inputTokens=4,000; outputTokens=1,500; retryInputTokens=600; retryShare=20%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
| Long tool turn; 30% retry share; 1,500 retry-input tokens | model=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=requests=1; inputTokens=8,000; outputTokens=3,000; retryInputTokens=1,500; retryShare=30%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
First-party registry provenance: https://ai.google.dev/gemini-api/docs/pricing; registry provider google; verified 2026-08-14; freshness gate=2026-09-14. Revalidate before any current-price claim.
Module 3 of 3: Cache/audio/video evidence treatment
Novel contribution boundary: Owns exact-model registry evidence only; cache and multimodal units are not assumed from provider-wide claims. Formula / deterministic rule: evidence = exact-model registry field when present; undocumented unit or mechanic = Unavailable
| Scenario | Exact model, provider, and fixed inputs | Result | State |
|---|---|---|---|
| Prompt-cache price or eligibility | model=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=evidenceField=cache; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
| Audio unit price or accounting | model=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=evidenceField=modality; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
| Video unit price or accounting | model=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=evidenceField=modality; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
First-party registry provenance: https://ai.google.dev/gemini-api/docs/pricing; registry provider google; verified 2026-08-14; freshness gate=2026-09-14. Revalidate before any current-price claim.
How fast is Gemini 3.7 Flash?
How much does Gemini 3.7 Flash cost at scale?
| Tokens / month | Est. cost (blended 3:1) |
|---|---|
| 100,000 | $0.15 |
| 1,000,000 | $1.50 |
| 10,000,000 | $15.00 |
| 100,000,000 | $150.00 |
How does Gemini 3.7 Flash compare with other models?
What is Gemini 3.7 Flash best for?
What should you explore next for Gemini 3.7 Flash?
Which Gemini 3.7 Flash head-to-head comparisons are available?
What are common questions about Gemini 3.7 Flash?
Is Gemini 3.7 Flash cheaper than Grok 4.3?
Gemini 3.7 Flash costs $1.50/M blended tokens, Grok 4.3 costs $1.56/M — Gemini 3.7 Flash is cheaper.
How much does 1 million tokens cost with Gemini 3.7 Flash?
At a 3:1 input:output ratio, 1 million blended tokens costs approximately $1.50. Pure input costs $0.75/M; pure output costs $3.75/M.
What does Gemini 3.7 Flash cost at high volume?
At 100 million blended tokens a month, Gemini 3.7 Flash costs approximately $150.00. See the cost-at-scale table below for other volumes.
