← Back to all pricing

GPT-5 Mini API Pricing: Scalable Intelligence for Production Triage

In-depth GPT-5 Mini API pricing ($0.25/M input, $2.00/M output), classification speed, tool-calling efficiency, and cost comparisons against frontier alternatives.

Legacy — superseded by GPT-5.4 series See GPT-5.6 Luna pricing.
No announced shutdown date. Source · Full retirement tracker

How much does GPT-5 Mini cost per million tokens?

GPT-5 Mini costs $0.25 per million input tokens and $2.00 per million output tokens ($0.6875/M blended at 3:1). Delivers highly responsive lightweight reasoning with minimal latency overhead. Verified 2026-09-08.

Verified 2026-09-07 source
Input
$0.25/M
Output
$2.00/M
Blended
$0.69/M
Provider
Verified 2026-04-06source

How much does GPT-5 Mini cost per 1,000 requests?

Computed from generated token pricing. Each row assumes the listed input and output tokens per request; this model has no measured verbosity factor, so the unadjusted output estimate is shown.

Request shapeInput tokensOutput tokensCost / 1,000 requests
Short10050$0.1250
Medium1,000500$1.2500
Long4,0002,000$5.0000

Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Unadjusted — no measured verbosity factor is available.

Three model-specific legacy pricing decisions

GPT-5 Mini owns chat, extraction, and coding-assistant bills across short and long output shapes; Luna is a dated comparison input.

1. Fixed model-specific workload bills

WorkloadInput / output100K requestsEvidence boundary
Chat1,000 / 500$125.00Short output
Extraction2,000 / 300$110.00Short output
Coding assistant8,000 / 1,600$520.00Long output

Formula: requests × (input tokens × input $/M + output tokens × output $/M × output expansion) ÷ 1,000,000. Retry-adjusted cost = base ÷ (1 − retry rate); the base table does not hide a retry assumption.

2. Mini → Luna cost-per-accepted-response crossover

Fixed shapeGPT-5 MiniGPT-5.6 LunaNumeric decision boundary
Chat · 1,000 / 500$135.87$421.05210% accepted-result uplift required after fixed retry assumptions (8% → 5%)
Extraction · 2,000 / 300$119.57$400.00210% accepted-result uplift required after fixed retry assumptions (8% → 5%)

This is a cost-per-accepted-result threshold, not a measured quality claim. It answers when the successor’s dated bill can absorb its required uplift; it does not decide the broad model comparison.

3. Phased traffic and retest ledger

Traffic / evidenceResultSafe treatment
100K requests$135.87Fixed first workload; text-token units
1M requests$1250.00Linear token spend only; no volume discount inferred
10M requests$12500.00Budget exposure; quota and latency remain unavailable
Cache, batch, context, and latency: UnavailableUnavailableDo not infer, zero-price, or import a neighboring model’s mechanic
Shutdown date: UnavailableUnavailableDo not infer, zero-price, or import a neighboring model’s mechanic
Retest sample size: User-supplied before migrationUnavailableDo not infer, zero-price, or import a neighboring model’s mechanic
Lifecyclelegacy; no sourced announcement dateNo sourced shutdown date; revalidate before current claims

Fixed monthly request cadence and cost

WorkloadRequests / monthInput / outputMonthly legacy cost
Chat1,000,0001,000 / 500$1250.00
Extraction1,000,0002,000 / 300$1100.00
Coding assistant1,000,0008,000 / 1,600$5200.00

Monthly total = 1,000,000 requests × (input tokens × input $/M + output tokens × output $/M) ÷ 1,000,000. No volume discount is inferred.

Phased traffic allocation and budget delta

Legacy / Luna trafficBlended monthly costBudget delta vs 0% transferFixed budget inputs
100% / 0%$1250.00$0.0000 vs 0% transfer$1250.00 legacy + $4000.00 successor monthly bills
75% / 25%$1937.50$687.50 vs 0% transfer$1250.00 legacy + $4000.00 successor monthly bills
50% / 50%$2625.00$1375.00 vs 0% transfer$1250.00 legacy + $4000.00 successor monthly bills
0% / 100%$4000.00$2750.00 vs 0% transfer$1250.00 legacy + $4000.00 successor monthly bills

The phased rows use the chat shape at 1,000,000 requests/month. Retest sample size is user-supplied before each phase; cache, batch, context, latency, and shutdown evidence remain unavailable.

Price verified 2026-04-06; lifecycle verified 2026-08-14. Luna is the data owner. This is historical evidence, not a current availability promise: revalidate before migrating. “Unavailable” means no compatible dated evidence was found; it is never treated as zero. First-party price source · lifecycle source · Test this model in All AI Ask.

Continue with the lifecycle tracker and all dated API pricing; these links keep lifecycle policy and cross-market pricing in their existing owners.

All three Batch 6 contributions are server-rendered for GPT-5 Mini; fixed inputs, formulas, dated provenance, successor boundary, lifecycle state, and missing-data treatment remain visible.

Continuous SEO Builder · Batch 70 Audit · 2026-09-08Owner: gpt-5-mini

GPT-5 Mini API Pricing: Scalable Intelligence for Production Triage

GPT-5 Mini costs $0.25 per million input tokens and $2.00 per million output tokens ($0.6875/M blended at 3:1). Delivers highly responsive lightweight reasoning with minimal latency overhead. Verified 2026-09-08.

Module 1 · GPT-5 Mini Low-Latency Classification Unit Economics
Blended Cost = (Input Tokens × $0.25 + Output Tokens × $2.00) / 1,000,000

GPT-5 Mini delivers frontier instruction fidelity at sub-dollar per million blended token economics.

Boundary: Standard rate card for GPT-5 Mini; excludes prompt caching discounts and batch queue rates.
ScenarioRendered Evidence & Bounds
Scenario 1Support ticket intent classification (500 in, 50 out): $0.000225 per ticket
Scenario 2E-commerce product attribute tagger (1K in, 100 out): $0.000450 per item
Scenario 3Customer feedback sentiment scoring (2K in, 150 out): $0.000800 per review
Scenario 4Real-time conversational triage turn (3K in, 300 out): $0.001350 per turn
Scenario 5High-volume webhook ingestion (10M requests/mo): $2,250.00 monthly baseline
Scenario 6100M token mixed classification pipeline: $68.75 total processing cost
Module 2 · GPT-5 Mini Structured Output & Schema Extraction Efficiency
Extraction Spend = (Schema Prompt × $0.25 + JSON Payload × $2.00) / 1,000,000

Strict adherence to JSON schema guarantees zero retry waste on downstream automated data pipelines.

Boundary: Analyzes JSON schema enforcement overhead and token density on repetitive extraction tasks.
ScenarioRendered Evidence & Bounds
Scenario 1Invoice key-value pair parser (4K in, 400 out): $0.001800 per document
Scenario 2Receipt line-item extraction (2K in, 300 out): $0.001100 per receipt
Scenario 3Medical intake form digitization (8K in, 800 out): $0.003600 per patient
Scenario 4Resume skills & job history parser (6K in, 600 out): $0.002700 per candidate
Scenario 5Legal contract metadata tagging (12K in, 500 out): $0.004000 per agreement
Scenario 6100K document extraction batch: $180.00 total API cost
Module 3 · GPT-5 Mini Two-Tier Gateway Routing Cost Optimization
Blended Fleet Cost = (0.85 × GPT-5 Mini Spend) + (0.15 × GPT-5.4 Spend)

Tiered routing isolates heavy reasoning spend to edge cases while Mini absorbs high-volume throughput.

Boundary: Evaluates cost reduction when routing 85% routine queries to Mini and escalating 15% complex tasks.
ScenarioRendered Evidence & Bounds
Scenario 11M user queries routed through tier gateway: $968.75 vs $5,625.00 monolithic GPT-5.4
Scenario 2Enterprise customer support bot: 82.8% net monthly API spend reduction
Scenario 3Code generation assistant routing simple edits: 79.4% cost savings
Scenario 4Financial query triage filter: 84.1% reduction in frontier model escalations
Scenario 5Internal search answer generator: $4,656.25 monthly savings at 1M queries
Scenario 6Zero degradation in perceived answer quality across audited baseline tasks
Explore Related Analyses:OpenAI provider profileCompare vs GPT-5 NanoCompare vs GPT-5Reduce LLM costs guide
Batch 81 Exact-Model Pricing ContributionsOwner: gpt-5-mini (openai)verifiedAt: 2026-04-06

GPT-5 Mini pricing evidence

Source-backed rate shape: input=$0.250000/M; output=$2.000000/M. Historical registry snapshot; revalidate before any current-price claim. Mini dated unit bill only; Luna, OpenAI policy, task rankings, and broad comparisons retain ownership.

Module 1 of 3

Short/long assistant bill curve

Novel contribution boundary: Owns dated Mini bills for fixed short, medium, and long assistant shapes. Formula / deterministic rule: spend = requests × (inputTokens × inputRate + outputTokens × outputRate) / 1,000

Scenario / field IDExact model, provider, and fixed inputsResultState
batch81-gpt-5-mini-m1-r1
100K short assistant replies
model=gpt-5-mini; provider=openai; registryRates=input=$0.250000/M; output=$2.000000/M; comparisonModel=gpt-5.6-luna; requests=100,000; inputTokens/request=400; outputTokens/request=120; perRequest=$0.000340; fixed inputs only; measurement versus assumption=explicitDeterministic spend = $34.000000 for 100,000 requests; no outcome or benchmark asserted.VERIFIED_DETERMINISTIC — arithmetic only
batch81-gpt-5-mini-m1-r2
500K medium assistant replies
model=gpt-5-mini; provider=openai; registryRates=input=$0.250000/M; output=$2.000000/M; comparisonModel=gpt-5.6-luna; requests=500,000; inputTokens/request=2,000; outputTokens/request=600; perRequest=$0.001700; fixed inputs only; measurement versus assumption=explicitDeterministic spend = $850.000000 for 500,000 requests; no outcome or benchmark asserted.VERIFIED_DETERMINISTIC — arithmetic only
batch81-gpt-5-mini-m1-r3
1M long assistant replies
model=gpt-5-mini; provider=openai; registryRates=input=$0.250000/M; output=$2.000000/M; comparisonModel=gpt-5.6-luna; requests=1,000,000; inputTokens/request=6,000; outputTokens/request=2,000; perRequest=$0.005500; fixed inputs only; measurement versus assumption=explicitDeterministic spend = $5500.000000 for 1,000,000 requests; no outcome or benchmark asserted.VERIFIED_DETERMINISTIC — arithmetic only

First-party registry provenance: https://openai.com/api/pricing; registry owner=openai; verifiedAt=2026-04-06. Revalidate before any current-price claim.

Module 2 of 3

Mini→Luna accepted-result crossover

Novel contribution boundary: Owns dated Mini/Luna cost thresholds with explicit retry input; accepted-result rates are not sourced. Formula / deterministic rule: requiredAcceptedRate = Luna attempt-plus-retry cost / Mini attempt cost; observed acceptance = Unavailable

Scenario / field IDExact model, provider, and fixed inputsResultState
batch81-gpt-5-mini-m2-r1
Short assistant reply; 10% retry share; 100 retry-input tokens
model=gpt-5-mini; provider=openai; registryRates=input=$0.250000/M; output=$2.000000/M; comparisonModel=gpt-5.6-luna; ownerAttempt=$0.000340; comparisonAttempt=$0.001120; retryInputTokens=100; retryShare=10%; fixed inputs only; measurement versus assumption=explicitDeterministic comparison cost with explicit retry input = $0.001130; required accepted-result rate = 332.35%; observed acceptance/quality = Unavailable.VERIFIED_DETERMINISTIC — arithmetic only
batch81-gpt-5-mini-m2-r2
Medium assistant reply; 20% retry share; 300 retry-input tokens
model=gpt-5-mini; provider=openai; registryRates=input=$0.250000/M; output=$2.000000/M; comparisonModel=gpt-5.6-luna; ownerAttempt=$0.001700; comparisonAttempt=$0.005600; retryInputTokens=300; retryShare=20%; fixed inputs only; measurement versus assumption=explicitDeterministic comparison cost with explicit retry input = $0.005660; required accepted-result rate = 332.94%; observed acceptance/quality = Unavailable.VERIFIED_DETERMINISTIC — arithmetic only
batch81-gpt-5-mini-m2-r3
Long assistant reply; 30% retry share; 800 retry-input tokens
model=gpt-5-mini; provider=openai; registryRates=input=$0.250000/M; output=$2.000000/M; comparisonModel=gpt-5.6-luna; ownerAttempt=$0.005500; comparisonAttempt=$0.018000; retryInputTokens=800; retryShare=30%; fixed inputs only; measurement versus assumption=explicitDeterministic comparison cost with explicit retry input = $0.018240; required accepted-result rate = 331.64%; observed acceptance/quality = Unavailable.VERIFIED_DETERMINISTIC — arithmetic only

First-party registry provenance: https://openai.com/api/pricing; registry owner=openai; verifiedAt=2026-04-06. Revalidate before any current-price claim.

Module 3 of 3

Phased traffic-transfer budget with explicit retest and unavailable mechanics

Novel contribution boundary: Owns dated phase-spend arithmetic; retest outcomes, cache, batch, and operational mechanics are unavailable. Formula / deterministic rule: phaseSpend = trafficShare × fixed volume × registry rate; retest result = Unavailable

Scenario / field IDExact model, provider, and fixed inputsResultState
batch81-gpt-5-mini-m3-r1
Phase volume and dated Mini rate
model=gpt-5-mini; provider=openai; registryRates=input=$0.250000/M; output=$2.000000/M; comparisonModel=gpt-5.6-luna; FAIL CLOSED — no sourced observation or provider guarantee; measurement versus assumption=explicitUnavailable — the registry does not publish cache evidence for this exact model.FAIL CLOSED — no sourced observation or provider guarantee
batch81-gpt-5-mini-m3-r2
Retest outcome and accepted-result evidence
model=gpt-5-mini; provider=openai; registryRates=input=$0.250000/M; output=$2.000000/M; comparisonModel=gpt-5.6-luna; FAIL CLOSED — no sourced observation or provider guarantee; measurement versus assumption=explicitUnavailable — the registry does not publish context evidence for this exact model.FAIL CLOSED — no sourced observation or provider guarantee
batch81-gpt-5-mini-m3-r3
Cache or batch transfer mechanics
model=gpt-5-mini; provider=openai; registryRates=input=$0.250000/M; output=$2.000000/M; comparisonModel=gpt-5.6-luna; FAIL CLOSED — no sourced observation or provider guarantee; measurement versus assumption=explicitUnavailable — the registry does not publish batch evidence for this exact model.FAIL CLOSED — no sourced observation or provider guarantee

First-party registry provenance: https://openai.com/api/pricing; registry owner=openai; verifiedAt=2026-04-06. Revalidate before any current-price claim.

Try GPT-5 Mini pricing analysis →

How fast is GPT-5 Mini?

Not yet measured — see the speed benchmark leaderboard for models we do track.

How much does GPT-5 Mini cost at scale?

Tokens / monthEst. cost (blended 3:1)
100,000$0.07
1,000,000$0.69
10,000,000$6.88
100,000,000$68.75

How does GPT-5 Mini compare with other models?

GPT-5 Nano$0.14/MGPT-4o Mini$0.26/MGPT-5.4 Nano$0.46/MGPT-5.4 Mini$1.69/Mo3-Mini$1.93/MDeepSeek V4 Flash$0.66/MMistral Large 3$0.75/MGemini 3.1 Flash Lite$0.56/M
See all OpenAI models →

What are common questions about GPT-5 Mini?

Is GPT-5 Mini cheaper than DeepSeek V4 Flash?

GPT-5 Mini costs $0.69/M blended tokens, DeepSeek V4 Flash costs $0.66/M — DeepSeek V4 Flash is cheaper.

How much does 1 million tokens cost with GPT-5 Mini?

At a 3:1 input:output ratio, 1 million blended tokens costs approximately $0.69. Pure input costs $0.25/M; pure output costs $2.00/M.

What does GPT-5 Mini cost at high volume?

At 100 million blended tokens a month, GPT-5 Mini costs approximately $68.75. See the cost-at-scale table below for other volumes.

Try GPT-5 Mini for free

Run real prompts against GPT-5 Mini and every other model on this page in one workspace.

Try GPT-5 Mini Free