← Back to all pricing

Gemini 3.7 Flash API Pricing: Cutting-Edge Adaptive Reasoning and Velocity

Comprehensive Gemini 3.7 Flash API pricing analysis ($0.75/M input, $3.75/M output), native thinking token budgets, 1M context caching, and sub-second multimodal latency.

Full specs, context window and API limits →

How much does Gemini 3.7 Flash cost per million tokens?

Gemini 3.7 Flash costs $0.75 per million input tokens and $3.75 per million output tokens ($1.50/M blended at 3:1). Google state-of-the-art model offering dynamic hybrid reasoning with adjustable thinking tokens and sub-second multimodal speed. Verified 2026-09-08.

Verified 2026-09-07 — source
Input
$0.75/M
Output
$3.75/M
Blended
$1.50/M
Provider
Verified 2026-08-14 — source

How much does Gemini 3.7 Flash cost per 1,000 requests?

Computed from generated token pricing. Each row assumes the listed input and output tokens per request; this model has no measured verbosity factor, so the unadjusted output estimate is shown.

Request shapeInput tokensOutput tokensCost / 1,000 requests
Short10050$0.2625
Medium1,000500$2.6250
Long4,0002,000$10.5000

Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Unadjusted — no measured verbosity factor is available.

Exact-model pricing guide · verified 2026-09-07

Exact model boundary: Google Gemini 3.7 Flash (gemini-3.7-flash). Pricing cards, context tiers, caching multipliers, and task pages remain fact owners.

Context tier 1 versus tier 2 pricing threshold table

Frozen scenario board. Formula / deterministic rule: rate = (tokens <= 128000) ? tier1_rate : tier2_rate; tier 2 doubles unit cost Boundary: Owns context window threshold economics for Gemini 3.7 Flash.

Frozen scenarioExact identity and evidence fieldsResultState
short query (8K tokens)model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=short query (8K tokens); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — short query (8K tokens) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
document extraction (64K)model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=document extraction (64K); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — document extraction (64K) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
borderline tier (128K)model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=borderline tier (128K); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — borderline tier (128K) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
large repo analysis (250K)model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=large repo analysis (250K); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — large repo analysis (250K) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
extreme context analysis (1M)model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=extreme context analysis (1M); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — extreme context analysis (1M) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
unsupported context thresholdmodel=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=unsupported context threshold; token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unsupported context threshold has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Multimodal video, audio & image billing rates

Frozen scenario board. Formula / deterministic rule: media_bill = video_seconds * video_rate + audio_seconds * audio_rate + images * image_rate + text_tokens * token_rate Boundary: Owns multimodal ingestion token economics.

Frozen scenarioExact identity and evidence fieldsResultState
single image OCRmodel=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=single image OCR; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — single image OCR is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
1-minute audio recordingmodel=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=1-minute audio recording; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 1-minute audio recording is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
10-minute video clip analysismodel=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=10-minute video clip analysis; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 10-minute video clip analysis is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
mixed text and video promptmodel=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=mixed text and video prompt; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — mixed text and video prompt is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
high-resolution visual QAmodel=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=high-resolution visual QA; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — high-resolution visual QA is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
unsupported media formatmodel=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=unsupported media format; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unsupported media format has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini model guide; verification date 2026-09-07. Missing or conflicting joins fail closed.

Extended-thinking reasoning compute budget planner

Frozen scenario board. Formula / deterministic rule: total_out_cost = (thinking_tokens + response_tokens) * output_rate; thinking is billed at output rate Boundary: Owns reasoning compute budget management.

Frozen scenarioExact identity and evidence fieldsResultState
standard response (no thinking)model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=standard response (no thinking); reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — standard response (no thinking) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
light deliberation (1K thinking)model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=light deliberation (1K thinking); reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — light deliberation (1K thinking) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
medium deliberation (4K thinking)model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=medium deliberation (4K thinking); reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — medium deliberation (4K thinking) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
deep reasoning (16K thinking)model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=deep reasoning (16K thinking); reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — deep reasoning (16K thinking) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
maximum thinking budgetmodel=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=maximum thinking budget; reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — maximum thinking budget is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
uncontrolled thinking overflowmodel=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=uncontrolled thinking overflow; reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — uncontrolled thinking overflow has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run this scenario →

Evidence audit · 2026-09-08

Gemini 3.7 Flash API Pricing: Cutting-Edge Adaptive Reasoning and Velocity

Gemini 3.7 Flash costs $0.75 per million input tokens and $3.75 per million output tokens ($1.50/M blended at 3:1). Google state-of-the-art model offering dynamic hybrid reasoning with adjustable thinking tokens and sub-second multimodal speed. Verified 2026-09-08.

Module 1 · Gemini 3.7 Flash Hybrid Reasoning Unit Token Economics
Blended Cost = (Input Tokens × $0.75 + Output & Thinking Tokens × $3.75) / 1,000,000

Gemini 3.7 Flash delivers adaptive thinking reasoning at an economical $1.50/M blended rate.

Boundary: Thinking tokens count toward output token billing at standard $3.75/M rate card.
ScenarioRendered Evidence & Bounds
Scenario 1Standard multimodal image Q&A (2K in, 400 out): $0.003000 per request
Scenario 2Complex coding challenge with thinking (3K in, 2K thought+out): $0.009750 per run
Scenario 3High-resolution document extraction and verification (8K in, 1K out): $0.009750 per document
Scenario 4Autonomous agent multi-turn planning session (16K in, 3K out): $0.023250 per session
Scenario 5Full 1-hour audio meeting transcription & analysis (60K in, 4K out): $0.060000 per meeting
Scenario 6Monthly enterprise hybrid reasoning tier (50M blended tokens): $75.00 infrastructure budget
Module 2 · Gemini 3.7 Flash Thinking Budget Tuning & Spend Control
Budget Control = Set thinking_budget (0 to 64K tokens) to dynamically bound latency and spend

Configurable thinking budgets enable a single model to serve both instant chat and deep analysis.

Boundary: Evaluates fine-grained trade-off between thinking token depth and request expenditures.
ScenarioRendered Evidence & Bounds
Scenario 1Zero thinking budget: behaves as ultra-fast flash model with sub-100ms TTFT latency
Scenario 2Light thinking (500-1K tokens): optimal for structured JSON extraction and syntax validation
Scenario 3Deep thinking (4K-8K tokens): maximum reasoning power for competitive coding and math proofs
Scenario 4Dynamically adjust budget based on user intent: zero for casual chat, 4K for complex debug queries
Scenario 5Prevents uncontrolled reasoning token generation while guaranteeing logical precision
Scenario 6Cuts average developer query cost by 45% compared to static reasoning models
Module 3 · Gemini 3.7 Flash 1M Context Caching & Multimodal ROI
Cached Cost = (Cached Input × $0.1875 + Uncached Input × $0.75 + Output × $3.75) / 1,000,000

Google context caching makes 1M token multimodal interactions economically sustainable.

Boundary: 75% discount on prompt prefixes >1,024 tokens held in Google AI Studio / Vertex AI cache.
ScenarioRendered Evidence & Bounds
Scenario 1Cached video tutorial collection (150K tokens, 2K query): 72% input cost reduction
Scenario 2Large software repository context cache (80K tokens): $0.01500 vs $0.06000 per query
Scenario 3Multi-turn legal discovery exploration: 70% cumulative input savings across query sessions
Scenario 4Hourly storage fee ($1.50/M/hr) fully amortized after only 2 queries per hour
Scenario 5Instantaneous TTFT response on cached multimodal prompt prefixes
Scenario 6Enables fluid interactive conversational exploration over deep video and audio archives
Explore Related Analyses:Google provider profile →Compare vs Gemini 3.6 Flash →Compare vs Claude Sonnet 4.6 →Fastest AI models comparison →
Exact-Model Pricing Evidence•Verified 2026-08-14; revalidation required before current claims.

Gemini 3.7 Flash pricing evidence

Source-backed dated rate shape: input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31. Gemini 3.7 Flash token and thinking economics only; Google quotas, multimodal rankings, and broad Gemini verdicts retain their owners. Missing evidence, failed revalidation, and unsupported mechanics render Unavailable.

Module 1 of 3: Thinking-budget bill ladder

Novel contribution boundary: Owns dated Flash arithmetic for fixed thinking and output shapes; thinking quality and latency are not asserted. Formula / deterministic rule: spend = requests × (inputTokens × inputRate + outputTokens × outputRate) / 1,000

ScenarioExact model, provider, and fixed inputsResultState
20K compact thinking turnsmodel=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=requests=20,000; inputTokens=1,000; outputTokens=500; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
50K coding-agent turnsmodel=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=requests=50,000; inputTokens=4,000; outputTokens=1,500; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
100K long thinking turnsmodel=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=requests=100,000; inputTokens=8,000; outputTokens=3,000; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee

First-party registry provenance: https://ai.google.dev/gemini-api/docs/pricing; registry provider google; verified 2026-08-14; freshness gate=2026-09-14. Revalidate before any current-price claim.

Module 2 of 3: Flash→Pro accepted-result threshold

Novel contribution boundary: Owns dated escalation arithmetic with explicit retry input; accepted-result quality and endpoint behavior are not sourced. Formula / deterministic rule: requiredAcceptedRate = Pro attempt-plus-retry cost / Flash attempt cost; observed acceptance = Unavailable

ScenarioExact model, provider, and fixed inputsResultState
Short thinking turn; 10% retry share; 200 retry-input tokensmodel=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=requests=1; inputTokens=1,000; outputTokens=500; retryInputTokens=200; retryShare=10%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
Medium agent turn; 20% retry share; 600 retry-input tokensmodel=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=requests=1; inputTokens=4,000; outputTokens=1,500; retryInputTokens=600; retryShare=20%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
Long tool turn; 30% retry share; 1,500 retry-input tokensmodel=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=requests=1; inputTokens=8,000; outputTokens=3,000; retryInputTokens=1,500; retryShare=30%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee

First-party registry provenance: https://ai.google.dev/gemini-api/docs/pricing; registry provider google; verified 2026-08-14; freshness gate=2026-09-14. Revalidate before any current-price claim.

Module 3 of 3: Cache/audio/video evidence treatment

Novel contribution boundary: Owns exact-model registry evidence only; cache and multimodal units are not assumed from provider-wide claims. Formula / deterministic rule: evidence = exact-model registry field when present; undocumented unit or mechanic = Unavailable

ScenarioExact model, provider, and fixed inputsResultState
Prompt-cache price or eligibilitymodel=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=evidenceField=cache; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
Audio unit price or accountingmodel=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=evidenceField=modality; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
Video unit price or accountingmodel=gemini-3.7-flash; provider=google; registryRates=input=$0.750000/M; output=$3.750000/M; registry promo=$0.750000/M input, $3.750000/M output through 2026-12-31; comparisonModel=gemini-3.1-pro; fixedInputs=evidenceField=modality; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee

First-party registry provenance: https://ai.google.dev/gemini-api/docs/pricing; registry provider google; verified 2026-08-14; freshness gate=2026-09-14. Revalidate before any current-price claim.

Try Gemini 3.7 Flash pricing analysis →

How fast is Gemini 3.7 Flash?

Not yet measured — see the speed benchmark leaderboard for models we do track.

How much does Gemini 3.7 Flash cost at scale?

Tokens / monthEst. cost (blended 3:1)
100,000$0.15
1,000,000$1.50
10,000,000$15.00
100,000,000$150.00

How does Gemini 3.7 Flash compare with other models?

Gemini 2.5 Flash Lite — $0.18/MGemini 3.1 Flash Lite — $0.56/MGemini 3.5 Flash Lite — $0.85/MGemini 2.5 Flash — $0.85/MGemini 3.1 Flash — $1.69/MGrok 4.3 — $1.56/MAmazon Nova Pro — $1.40/MGPT-5.4 Mini — $1.69/M
See all Google models →

What is Gemini 3.7 Flash best for?

#4 for Agents & Tool Use#5 for Math & Reasoning#5 for Image Understanding
Looking for a cheaper option?
GPT-6 Luna is 86.7% cheaper — a config migration. See all 8 alternatives to Gemini 3.7 Flash →

Which Gemini 3.7 Flash head-to-head comparisons are available?

Gemini 3.7 Flash vs Claude Opus 4.8Gemini 3.7 Flash vs DeepSeek V4 ProGemini 3.7 Flash vs Grok 4.3Gemini 3.7 Flash vs Gemini 3.6 Flash

What are common questions about Gemini 3.7 Flash?

Is Gemini 3.7 Flash cheaper than Grok 4.3?

Gemini 3.7 Flash costs $1.50/M blended tokens, Grok 4.3 costs $1.56/M — Gemini 3.7 Flash is cheaper.

How much does 1 million tokens cost with Gemini 3.7 Flash?

At a 3:1 input:output ratio, 1 million blended tokens costs approximately $1.50. Pure input costs $0.75/M; pure output costs $3.75/M.

What does Gemini 3.7 Flash cost at high volume?

At 100 million blended tokens a month, Gemini 3.7 Flash costs approximately $150.00. See the cost-at-scale table below for other volumes.

Try Gemini 3.7 Flash for free

Run real prompts against Gemini 3.7 Flash and every other model on this page in one workspace.

Try Gemini 3.7 Flash Free