OpenAI family

GPT-5

GPT-5: GPT-5.5 Thinking ranks #9 of 197 with 400K-token context and $1.25/$10 per 1M tokens. Compare GPT-5, Mini, Nano, and Codex by workload.

Top in this family

GPT-5.5 Thinking ranks #9 of 197 on overall quality (QS 100.8) at $1.25/$10 per 1M tokens.

Practical pick

Thinking (5.4) at $0.75/$4.5 per 1M tokens (rank #53 of 197).

Variants
4
License
Closed weights
Provider
OpenAI

★ Most teams should start here

GPT-5 Mini

Variant: Thinking (5.4)

The practical default. Same family quality ceiling as the flagship for everyday API workloads, at a fraction of the price. Step up to full GPT-5 only when you have a workload that visibly benefits from it.

Quality Score
84.2
Input
$0.750/1M
Output
$4.50/1M
Context
License
Closed · API

Best variant by workload

One pick per common job. Pick by what you need to ship, not by which variant has the highest score on a leaderboard you don't use.

Note: picks are framed for direct API usage where cost per million tokens is load-bearing. If you're inside an agent harness (Claude Code, Cursor, etc.) the calculus changes: the harness sets the model, the per-task cost is usually negligible, and the flagship variant tends to win. See our piece on Claude Code for the harness-vs-API framing.
WorkloadBest pickWhy
Coding agents
GPT-5 Codex
Non-thinking
$1.25/1M / $10.00/1M
Purpose-built coding variant. Pick this when agentic coding throughput and tool-use reliability are the binding constraint.
General API workhorse
GPT-5 Mini
Thinking (5.4)
$0.750/1M / $4.50/1M
Best quality-per-dollar in the family for chat, summarization, and tool-augmented assistants. Reach for full GPT-5 only when mini measurably underperforms on your evals.
Long-context RAG
GPT-5
GPT-5.5 Thinking
$1.25/1M / $10.00/1M
Full GPT-5 has the strongest long-context recall in the family. Use when document scale and faithful retrieval over long inputs dominate.
High-volume chat
GPT-5 Nano
Thinking (5.4)
$0.200/1M / $1.25/1M
Cheapest tier with usable quality for production chat at scale. Trade some capability for the per-token cost difference.

All variants

21 variants across 4 models. Sorted by quality score (descending) · Closed API.

VariantQSGPQAHLESWESWE-ProTerminalTauMCPAIMEIn $/MOut $/MContextReleased
GPT-5.5 Thinking
GPT-5
100.8
#9/197
93.641.458.675.3$1.25$10400KAug 7, 2025
GPT-5.4 Thinking
GPT-5
97.9
#14/197
92.843.957.775.167.2$2.5$151.1MAug 7, 2025
GPT-5.3 Codex
GPT-5
97.3
#15/197
92.656.864.7$1.75$14400KAug 7, 2025
GPT-5.2 Thinking
GPT-5
92.3
#27/197
92.435.480.055.654.082.060.6100.0$1.75$14400KAug 7, 2025
Thinking (5.4)
GPT-5 Mini
84.2
#53/197
88.028.254.457.7$0.75$4.5Aug 7, 2025
GPT-5.0
GPT-5
84.2
#54/197
85.724.872.841.835.281.194.6$1.25$10400KAug 7, 2025
GPT-5.1 Thinking
GPT-5
83.4
#59/197
88.126.576.350.1$1.25$10400KAug 7, 2025
Non-thinking
GPT-5 Codex
82.1
#61/197
74.543.4$1.25$10400KSep 15, 2025
GPT-5.2
GPT-5
79.8
#76/197
27.829.954.0$1.75$14400KAug 7, 2025
Thinking (5.0)
GPT-5 Mini
77.3
#84/197
82.316.772.045.724.047.691.1$0.25$2400KAug 7, 2025
GPT-5.2 Codex
GPT-5
77.0
#89/197
41.0$1.75$14400KAug 7, 2025
Thinking (5.4)
GPT-5 Nano
76.6
#90/197
82.824.352.456.1$0.2$1.25Aug 7, 2025
GPT-5.1
GPT-5
72.4
#111/197
6.847.6$1.25$10400KAug 7, 2025
Thinking (5.0)
GPT-5 Nano
62.9
#152/197
7.9$0.05$0.4400KAug 7, 2025
GPT-5.1 Codex
GPT-5
36.9$1.25$10400KAug 7, 2025
GPT-5.1 Codex Max
GPT-5
77.9$1.25$10400KAug 7, 2025
GPT-5.1 Codex Mini
GPT-5
$0.25$2400KAug 7, 2025
GPT-5.3
GPT-5
$1.25$10400KAug 7, 2025
GPT-5.4
GPT-5
$2.5$151.1MAug 7, 2025
GPT-5.5
GPT-5
$5$30Aug 7, 2025
Non-Thinking (5.0)
GPT-5 Nano
$0.05$0.4400KAug 7, 2025

Benchmark evidence

Every benchmark we track for this family, across capabilities. The headline Quality Score draws from a deliberately narrow, governed panel (112 of 370 rows here feed it); the rest is tracked evidence: recorded and comparable, but not folded into one synthetic score.

Model / VariantBenchmarkScoreRankScoring
GPT-5 · GPT-5.2 ThinkingAIME 20251001 / 88In Quality Score
GPT-5 · GPT-5.2 ThinkingAIME 2025 · no_tools1001 / 15In Quality Score
GPT-5 · GPT-5.0Aider (Polyglot)881 / 45In Quality Score
GPT-5 · GPT-5.4 ThinkingLiveCodeBench · pro87.51 / 5In Quality Score
GPT-5 · GPT-5.0LiveCodeBench · 2025_01_2025_05_single86.81 / 11In Quality Score
GPT-5 · GPT-5.0AIME 2025 · aime_2025_python99.62 / 7In Quality Score
GPT-5 · GPT-5.2 ThinkingHumanity's Last Exam · verified43.32 / 5In Quality Score
GPT-5 · GPT-5.2 Thinkingτ²-bench · telecom98.73 / 35In Quality Score
Show all benchmark evidence (370 rows)

Reasoning

Model / VariantBenchmarkScoreRankScoring
GPT-5 · GPT-5.2 ThinkingAIME 20251001 / 88In Quality Score
GPT-5 · GPT-5.2 ThinkingAIME 2025 · no_tools1001 / 15In Quality Score
GPT-5 · GPT-5.0AIME 2025 · aime_2025_python99.62 / 7In Quality Score
GPT-5 · GPT-5.2 ThinkingHumanity's Last Exam · verified43.32 / 5In Quality Score
GPT-5 · GPT-5.0AIME 202594.64 / 88In Quality Score
GPT-5 · GPT-5.1 ThinkingAIME 2025 · no_tools944 / 15In Quality Score
GPT-5 · GPT-5.5 ThinkingGPQA Diamond93.65 / 147In Quality Score
GPT-5 · GPT-5.5 ThinkingLiveBench79.95 / 79In Quality Score
GPT-5 · GPT-5.2 ThinkingHumanity's Last Exam · search_code45.55 / 6In Quality Score
GPT-5 · GPT-5.4 ThinkingHumanity's Last Exam · hle43.95 / 93In Quality Score
GPT-5 · GPT-5.4 ThinkingGPQA Diamond92.87 / 147In Quality Score
GPT-5 · GPT-5.2 ThinkingMMLU Pro87.47 / 91In Quality Score
GPT-5 · GPT-5.5 ThinkingHumanity's Last Exam · hle_text41.47 / 67In Quality Score
GPT-5 · GPT-5.5 ThinkingHumanity's Last Exam · hle41.47 / 93In Quality Score
GPT-5 · GPT-5.3 CodexGPQA Diamond92.68 / 147In Quality Score
GPT-5 · GPT-5.5 ThinkingSimpleBench698 / 76In Quality Score
GPT-5 · GPT-5.2 ThinkingGPQA Diamond92.49 / 147In Quality Score
GPT-5 · GPT-5.4 ThinkingLiveBench789 / 79In Quality Score
GPT-5 · GPT-5.0MMLU Pro87.110 / 91In Quality Score
GPT-5 · GPT-5.5 ThinkingHumanity's Last Exam · tools52.212 / 44In Quality Score
GPT-5 · GPT-5.2 ThinkingHumanity's Last Exam · hle35.412 / 93In Quality Score
GPT-5 Mini · Thinking (5.0)AIME 202591.113 / 88In Quality Score
GPT-5 · GPT-5.4 ThinkingHumanity's Last Exam · tools52.113 / 44In Quality Score
GPT-5 · GPT-5.5 ThinkingArena Elo148214 / 175In Quality Score
GPT-5 · GPT-5.4 ThinkingHumanity's Last Exam · hle_text36.514 / 67In Quality Score
GPT-5 · GPT-5.4 ThinkingArena Elo147815 / 175In Quality Score
GPT-5 · GPT-5.5Arena Elo147617 / 175In Quality Score
GPT-5 · GPT-5.2 ThinkingHumanity's Last Exam · hle_text34.517 / 67In Quality Score
GPT-5 · GPT-5.2Humanity's Last Exam · hle_text28.521 / 67In Quality Score
GPT-5 · GPT-5.1 ThinkingGPQA Diamond88.122 / 147In Quality Score
GPT-5 · GPT-5.2 ThinkingLiveBench74.622 / 79In Quality Score
GPT-5 · GPT-5.0Humanity's Last Exam · hle_text26.322 / 67In Quality Score
GPT-5 Mini · Thinking (5.4)GPQA Diamond8823 / 147In Quality Score
GPT-5 · GPT-5.0SimpleBench56.724 / 76In Quality Score
GPT-5 · GPT-5.1 ThinkingHumanity's Last Exam · hle_text24.624 / 67In Quality Score
GPT-5 Mini · Thinking (5.4)Humanity's Last Exam · hle28.225 / 93In Quality Score
GPT-5 · GPT-5.2 CodexLiveBench7426 / 79In Quality Score
GPT-5 · GPT-5.2 ThinkingHumanity's Last Exam · tools45.527 / 44In Quality Score
GPT-5 · GPT-5.2Humanity's Last Exam · hle27.827 / 93In Quality Score
GPT-5 · GPT-5.1SimpleBench53.228 / 76In Quality Score
GPT-5 · GPT-5.1 ThinkingHumanity's Last Exam · hle26.529 / 93In Quality Score
GPT-5 Mini · Thinking (5.0)Humanity's Last Exam · hle_text19.729 / 67In Quality Score
GPT-5 · GPT-5.4Arena Elo146630 / 175In Quality Score
GPT-5 · GPT-5.0Humanity's Last Exam · tools41.732 / 44In Quality Score
GPT-5 Mini · Thinking (5.4)Humanity's Last Exam · tools41.533 / 44In Quality Score
GPT-5 · GPT-5.0Humanity's Last Exam · hle24.834 / 93In Quality Score
GPT-5 · GPT-5.0GPQA Diamond85.735 / 147In Quality Score
GPT-5 Mini · Thinking (5.0)MMLU Pro83.736 / 91In Quality Score
GPT-5 Nano · Thinking (5.4)Humanity's Last Exam · tools37.736 / 44In Quality Score
GPT-5 Nano · Thinking (5.4)Humanity's Last Exam · hle24.336 / 93In Quality Score
GPT-5 Mini · Thinking (5.0)Humanity's Last Exam · tools31.639 / 44In Quality Score
GPT-5 Nano · Thinking (5.0)LiveBench69.641 / 79In Quality Score
GPT-5 · GPT-5.2 ThinkingSimpleBench45.841 / 76In Quality Score
GPT-5 · GPT-5.1Arena Elo145545 / 175In Quality Score
GPT-5 Nano · Thinking (5.4)GPQA Diamond82.848 / 147In Quality Score
GPT-5 · GPT-5.3Arena Elo144949 / 175In Quality Score
GPT-5 Mini · Thinking (5.0)LiveBench66.449 / 79In Quality Score
GPT-5 Mini · Thinking (5.4)Arena Elo144950 / 175In Quality Score
GPT-5 Mini · Thinking (5.0)GPQA Diamond82.351 / 147In Quality Score
GPT-5 Mini · Thinking (5.0)Humanity's Last Exam · hle16.752 / 93In Quality Score
GPT-5 · GPT-5.1Humanity's Last Exam · hle_text6.556 / 67In Quality Score
GPT-5 · GPT-5.2Arena Elo143763 / 175In Quality Score
GPT-5 · GPT-5.0Arena Elo143466 / 175In Quality Score
GPT-5 · GPT-5.1Humanity's Last Exam · hle6.883 / 93In Quality Score
GPT-5 Nano · Thinking (5.4)Arena Elo1404102 / 175In Quality Score
GPT-5 Mini · Thinking (5.0)Arena Elo1390113 / 175In Quality Score
GPT-5 Nano · Thinking (5.0)Arena Elo1337144 / 175In Quality Score
GPT-5 · GPT-5.2 ThinkingHMMT Feb 202599.41 / 44Tracked evidence
GPT-5 · GPT-5.2 ThinkingHMMT Nov 202597.11 / 37Tracked evidence
GPT-5 · GPT-5.0HMMT Feb 2025 · python96.71 / 6Tracked evidence
GPT-5 · GPT-5.5 ThinkingMRCR · v2_128k94.81 / 30Tracked evidence
GPT-5 · GPT-5.4 ThinkingIPhO 2025 (Theory)93.51 / 3Tracked evidence
GPT-5 · GPT-5.4 ThinkingIMO AnswerBench91.41 / 32Tracked evidence
GPT-5 · GPT-5.2 ThinkingMAXIFE88.41 / 21Tracked evidence
GPT-5 · GPT-5.5 ThinkingMRCR · v2_128k_256k87.51 / 4Tracked evidence
GPT-5 · GPT-5.0MMMU · mmmu_single84.21 / 22Tracked evidence
GPT-5 · GPT-5.5 ThinkingMMMU PRO · tools83.21 / 10Tracked evidence
GPT-5 · GPT-5.2 ThinkingBrowseComp_zh76.11 / 20Tracked evidence
GPT-5 · GPT-5.5 ThinkingMRCR · v2_512k_1m741 / 3Tracked evidence
GPT-5 · GPT-5.0HealthBench67.21 / 5Tracked evidence
GPT-5 · GPT-5.5 ThinkingFrontierMath · tier1_351.71 / 5Tracked evidence
GPT-5 · GPT-5.5 ThinkingGraphwalks · bfs_1m45.41 / 3Tracked evidence
GPT-5 · GPT-5.5 ThinkingFrontierMath · tier435.41 / 5Tracked evidence
GPT-5 · GPT-5.5 ThinkingCritPt27.11 / 8Tracked evidence
GPT-5 · GPT-5.4 ThinkingAIME 202698.72 / 24Tracked evidence
GPT-5 · GPT-5.4 ThinkingMMMU PRO · tools81.52 / 10Tracked evidence
GPT-5 · GPT-5.4 ThinkingMRCR · v2_128k_256k79.32 / 4Tracked evidence
GPT-5 · GPT-5.5 ThinkingGraphwalks · parents_1m582 / 3Tracked evidence
GPT-5 · GPT-5.4 ThinkingFrontierMath · tier1_347.62 / 5Tracked evidence
GPT-5 · GPT-5.4 ThinkingHealthBench · hard40.12 / 5Tracked evidence
GPT-5 · GPT-5.4 ThinkingMRCR · v2_512k_1m36.62 / 3Tracked evidence
GPT-5 · GPT-5.4 ThinkingFrontier Science Research332 / 4Tracked evidence
GPT-5 · GPT-5.4 ThinkingFrontierMath · tier427.12 / 5Tracked evidence
GPT-5 · GPT-5.1 ThinkingVendingBench21473.43 / 4Tracked evidence
GPT-5 · GPT-5.5 ThinkingAIME 202698.33 / 24Tracked evidence
GPT-5 · GPT-5.5 ThinkingHMMT Feb 202696.73 / 21Tracked evidence
GPT-5 · GPT-5.1 ThinkingGlobalPIQA90.93 / 4Tracked evidence
GPT-5 · GPT-5.5 ThinkingGraphwalks · parents_256k90.13 / 4Tracked evidence
GPT-5 · GPT-5.4 ThinkingBrowseComp · context_manage82.73 / 15Tracked evidence
GPT-5 · GPT-5.4 ThinkingMMMU PRO81.23 / 53Tracked evidence
GPT-5 · GPT-5.2 ThinkingMMMU PRO · tools80.43 / 10Tracked evidence
GPT-5 · GPT-5.2 ThinkingMRCR · v2_128k_256k773 / 4Tracked evidence
GPT-5 · GPT-5.5 ThinkingGraphwalks · bfs_256k73.73 / 4Tracked evidence
GPT-5 · GPT-5.5 ThinkingFinanceAgent · v251.83 / 7Tracked evidence
GPT-5 · GPT-5.4 ThinkingGraphwalks · parents_1m443 / 3Tracked evidence
GPT-5 · GPT-5.5 ThinkingPostTrainBench28.43 / 5Tracked evidence
GPT-5 · GPT-5.2 ThinkingFrontier Science Research25.23 / 4Tracked evidence
GPT-5 · GPT-5.4 ThinkingGraphwalks · bfs_1m9.43 / 3Tracked evidence
GPT-5 · GPT-5.5 ThinkingHMMT Nov 202596.54 / 37Tracked evidence
GPT-5 · GPT-5.2 ThinkingMMMLU89.64 / 39Tracked evidence
GPT-5 · GPT-5.4 ThinkingGraphwalks · parents_256k82.84 / 4Tracked evidence
GPT-5 · GPT-5.5 ThinkingMMMU PRO81.24 / 53Tracked evidence
GPT-5 Mini · Thinking (5.4)MMMU PRO · tools784 / 10Tracked evidence
GPT-5 Mini · Thinking (5.0)IFBench75.44 / 28Tracked evidence
GPT-5 · GPT-5.0Longform Writing71.44 / 5Tracked evidence
GPT-5 · GPT-5.4 ThinkingGraphwalks · bfs_256k62.54 / 4Tracked evidence
GPT-5 · GPT-5.2 ThinkingFACTS Benchmark Suite61.44 / 12Tracked evidence
GPT-5 · GPT-5.5 ThinkingFinanceAgent604 / 15Tracked evidence
GPT-5 · GPT-5.2 ThinkingFrontierMath · tier1_340.74 / 5Tracked evidence
GPT-5 · GPT-5.2 ThinkingFrontierMath · tier418.84 / 5Tracked evidence
GPT-5 · GPT-5.2 ThinkingGlobal PIQA91.25 / 26Tracked evidence
GPT-5 · GPT-5.2 ThinkingIFBench755 / 28Tracked evidence
GPT-5 · GPT-5.2 ThinkingSciCode525 / 24Tracked evidence
GPT-5 · GPT-5.2 ThinkingAIME 202696.76 / 24Tracked evidence
GPT-5 · GPT-5.4 ThinkingHMMT Nov 202595.86 / 37Tracked evidence
GPT-5 · GPT-5.5 ThinkingBrowseComp84.46 / 56Tracked evidence
GPT-5 · GPT-5.2 ThinkingMRCR · v2_128k83.86 / 30Tracked evidence
GPT-5 · GPT-5.2 ThinkingFinanceAgent59.56 / 15Tracked evidence
GPT-5 · GPT-5.1 ThinkingMathArenaApex16 / 8Tracked evidence
GPT-5 · GPT-5.0HMMT Feb 202593.37 / 44Tracked evidence
GPT-5 · GPT-5.1 ThinkingMMLU917 / 33Tracked evidence
GPT-5 · GPT-5.2 ThinkingIMO AnswerBench86.37 / 32Tracked evidence
GPT-5 Mini · Thinking (5.0)MAXIFE85.37 / 21Tracked evidence
GPT-5 Mini · Thinking (5.0)MMMU PRO · tools74.17 / 10Tracked evidence
GPT-5 · GPT-5.4 ThinkingFinanceAgent567 / 15Tracked evidence
GPT-5 · GPT-5.5 ThinkingHealthBench · professional51.87 / 7Tracked evidence
GPT-5 · GPT-5.4 ThinkingHMMT Feb 202691.88 / 21Tracked evidence
GPT-5 · GPT-5.2 ThinkingMMMU PRO79.58 / 53Tracked evidence
GPT-5 Nano · Thinking (5.4)MMMU PRO · tools69.59 / 10Tracked evidence
GPT-5 · GPT-5.0BrowseComp_zh639 / 20Tracked evidence
GPT-5 Mini · Thinking (5.0)Global PIQA88.510 / 26Tracked evidence
GPT-5 · GPT-5.2 ThinkingWMT24++78.810 / 12Tracked evidence
GPT-5 · GPT-5.3 CodexFinanceAgent5410 / 15Tracked evidence
GPT-5 · GPT-5.2 ThinkingSimpleQA3810 / 40Tracked evidence
GPT-5 Mini · Thinking (5.0)FACTS Benchmark Suite33.710 / 12Tracked evidence
GPT-5 · GPT-5.2 ThinkingMMLU89.611 / 33Tracked evidence
GPT-5 · GPT-5.4 ThinkingBrowseComp82.711 / 56Tracked evidence
GPT-5 · GPT-5.2 ThinkingBrowseComp · context_manage65.812 / 15Tracked evidence
GPT-5 · GPT-5.0FinanceAgent46.912 / 15Tracked evidence
GPT-5 · GPT-5.1 ThinkingSimpleQA34.912 / 40Tracked evidence
GPT-5 · GPT-5.3 CodexBrowseComp77.313 / 56Tracked evidence
GPT-5 · GPT-5.0SciCode42.913 / 24Tracked evidence
GPT-5 Mini · Thinking (5.4)MMMU PRO76.615 / 53Tracked evidence
GPT-5 · GPT-5.1 ThinkingMRCR · v2_128k61.615 / 30Tracked evidence
GPT-5 · GPT-5.0MMLU89.416 / 33Tracked evidence
GPT-5 · GPT-5.1 ThinkingMMMU PRO7616 / 53Tracked evidence
GPT-5 Mini · Thinking (5.0)BrowseComp_zh49.516 / 20Tracked evidence
GPT-5 Mini · Thinking (5.0)HMMT Feb 202587.818 / 44Tracked evidence
GPT-5 Mini · Thinking (5.0)MMMLU84.918 / 39Tracked evidence
GPT-5 · GPT-5.2 ThinkingBrowseComp65.818 / 56Tracked evidence
GPT-5 Mini · Thinking (5.0)MRCR · v2_128k52.522 / 30Tracked evidence
GPT-5 Mini · Thinking (5.0)MMMU PRO74.124 / 53Tracked evidence
GPT-5 · GPT-5.0IMO AnswerBench7625 / 32Tracked evidence
GPT-5 · GPT-5.0BrowseComp54.925 / 56Tracked evidence
GPT-5 Mini · Thinking (5.4)MRCR · v2_128k42.726 / 30Tracked evidence
GPT-5 Mini · Thinking (5.0)HMMT Nov 202584.228 / 37Tracked evidence
GPT-5 Mini · Thinking (5.0)BrowseComp48.131 / 56Tracked evidence
GPT-5 Nano · Thinking (5.4)MMMU PRO66.134 / 53Tracked evidence
GPT-5 Mini · Thinking (5.0)SimpleQA9.536 / 40Tracked evidence
GPT-5 Nano · Thinking (5.0)MMMU PRO57.240 / 53Tracked evidence

Coding

Model / VariantBenchmarkScoreRankScoring
GPT-5 · GPT-5.0Aider (Polyglot)881 / 45In Quality Score
GPT-5 · GPT-5.4 ThinkingLiveCodeBench · pro87.51 / 5In Quality Score
GPT-5 · GPT-5.0LiveCodeBench · 2025_01_2025_05_single86.81 / 11In Quality Score
GPT-5 Mini · Thinking (5.0)LiveCodeBench80.43 / 70In Quality Score
GPT-5 Mini · Thinking (5.0)LiveCodeBench · 2025_01_2025_05_single77.44 / 11In Quality Score
GPT-5 · GPT-5.5 ThinkingGSO (Global Software Optimization) · opt_at_137.34 / 26In Quality Score
GPT-5 · GPT-5.0SWE-bench Verified · multilingual_single55.35 / 10In Quality Score
GPT-5 · GPT-5.2 ThinkingLiveCodeBench · v687.76 / 45In Quality Score
GPT-5 · GPT-5.4 ThinkingGSO (Global Software Optimization) · opt_at_130.46 / 26In Quality Score
GPT-5 · GPT-5.0LiveCodeBench · v6877 / 45In Quality Score
GPT-5 · GPT-5.2 ThinkingGSO (Global Software Optimization) · opt_at_126.57 / 26In Quality Score
GPT-5 · GPT-5.2 ThinkingSWE-bench Verified809 / 70In Quality Score
GPT-5 · GPT-5.1GSO (Global Software Optimization) · opt_at_112.811 / 26In Quality Score
GPT-5 · GPT-5.1 Codex MaxSWE-bench Verified77.913 / 70In Quality Score
GPT-5 · GPT-5.0GSO (Global Software Optimization) · opt_at_15.914 / 26In Quality Score
GPT-5 Mini · Thinking (5.0)LiveCodeBench · v680.517 / 45In Quality Score
GPT-5 · GPT-5.1 ThinkingSWE-bench Verified76.321 / 70In Quality Score
GPT-5 Codex · Non-thinkingSWE-bench Verified74.526 / 70In Quality Score
GPT-5 · GPT-5.0SWE-bench Verified72.834 / 70In Quality Score
GPT-5 Mini · Thinking (5.0)SWE-bench Verified7240 / 70In Quality Score
GPT-5 · GPT-5.5 ThinkingDeepSWE701 / 8Tracked evidence
GPT-5 · GPT-5.2 ThinkingSecCodeBench68.71 / 6Tracked evidence
GPT-5 · GPT-5.5 ThinkingProgramBench70.82 / 6Tracked evidence
GPT-5 · GPT-5.0OJ-Bench · cpp56.22 / 6Tracked evidence
GPT-5 · GPT-5.5 ThinkingNL2Repo50.72 / 15Tracked evidence
GPT-5 Mini · Thinking (5.0)Codeforces21603 / 48Tracked evidence
GPT-5 Mini · Thinking (5.0)OJ-Bench40.43 / 19Tracked evidence
GPT-5 · GPT-5.5 ThinkingFrontierCode · diamond5.74 / 4Tracked evidence
GPT-5 · GPT-5.4 ThinkingNL2Repo41.37 / 15Tracked evidence
GPT-5 · GPT-5.2 ThinkingSWE-bench Multilingual7210 / 21Tracked evidence

Agentic

Model / VariantBenchmarkScoreRankScoring
GPT-5 · GPT-5.2 Thinkingτ²-bench · telecom98.73 / 35In Quality Score
GPT-5 · GPT-5.5 ThinkingMCP Atlas · public_set75.34 / 19In Quality Score
GPT-5 · GPT-5.2 Thinkingτ²-bench · average85.57 / 37In Quality Score
GPT-5 · GPT-5.5 Thinkingτ²-bench · telecom988 / 35In Quality Score
GPT-5 · GPT-5.5 ThinkingMCP Atlas75.311 / 39In Quality Score
GPT-5 · GPT-5.1 Thinkingτ²-bench · average80.212 / 37In Quality Score
GPT-5 · GPT-5.2 ThinkingMCP Atlas · public_set6812 / 19In Quality Score
GPT-5 · GPT-5.0τ²-bench · telecom96.713 / 35In Quality Score
GPT-5 · GPT-5.4 ThinkingMCP Atlas · public_set67.213 / 19In Quality Score
GPT-5 · GPT-5.0τ²-bench · airline62.613 / 36In Quality Score
GPT-5 Mini · Thinking (5.4)τ²-bench · telecom93.416 / 35In Quality Score
GPT-5 · GPT-5.2 Thinkingτ²-bench · retail8217 / 41In Quality Score
GPT-5 · GPT-5.4 ThinkingMCP Atlas67.217 / 39In Quality Score
GPT-5 Nano · Thinking (5.4)τ²-bench · telecom92.518 / 35In Quality Score
GPT-5 · GPT-5.4 Thinkingτ²-bench · telecom91.520 / 35In Quality Score
GPT-5 · GPT-5.0τ²-bench · retail81.121 / 41In Quality Score
GPT-5 Mini · Thinking (5.0)τ²-bench · telecom74.123 / 35In Quality Score
GPT-5 Mini · Thinking (5.0)τ²-bench · average69.825 / 37In Quality Score
GPT-5 · GPT-5.2 ThinkingMCP Atlas60.625 / 39In Quality Score
GPT-5 · GPT-5.4τ²-bench · telecom64.327 / 35In Quality Score
GPT-5 Mini · Thinking (5.4)MCP Atlas57.728 / 39In Quality Score
GPT-5 · GPT-5.2τ²-bench · telecom57.228 / 35In Quality Score
GPT-5 Nano · Thinking (5.4)MCP Atlas56.130 / 39In Quality Score
GPT-5 · GPT-5.1 ThinkingMCP Atlas50.132 / 39In Quality Score
GPT-5 Mini · Thinking (5.0)MCP Atlas47.633 / 39In Quality Score
GPT-5 · GPT-5.5 ThinkingGDPVal84.91 / 13Tracked evidence
GPT-5 · GPT-5.4 Thinkingτ³-Bench72.91 / 10Tracked evidence
GPT-5 · GPT-5.2 ThinkingMCPMark57.51 / 8Tracked evidence
GPT-5 · GPT-5.0FinSearchComp-T3481 / 5Tracked evidence
GPT-5 · GPT-5.2 ThinkingDeepPlanning44.61 / 16Tracked evidence
GPT-5 · GPT-5.2 ThinkingVendingBench · v239522 / 7Tracked evidence
GPT-5 · GPT-5.4 ThinkingGDPVal832 / 13Tracked evidence
GPT-5 · GPT-5.5 ThinkingCyberGym81.82 / 12Tracked evidence
GPT-5 · GPT-5.2 ThinkingWideSearch76.82 / 13Tracked evidence
GPT-5 · GPT-5.4 ThinkingCyberGym793 / 12Tracked evidence
GPT-5 · GPT-5.5 ThinkingFrontierSWE72.63 / 6Tracked evidence
GPT-5 · GPT-5.5 ThinkingToolathlon55.63 / 33Tracked evidence
GPT-5 · GPT-5.5 ThinkingSWE-Marathon123 / 5Tracked evidence
GPT-5 · GPT-5.5 ThinkingGDPVal-AA17694 / 19Tracked evidence
GPT-5 · GPT-5.2 ThinkingGDPVal70.94 / 13Tracked evidence
GPT-5 · GPT-5.4 ThinkingToolathlon54.64 / 33Tracked evidence
GPT-5 · GPT-5.0Seal-051.44 / 16Tracked evidence
GPT-5 · GPT-5.4 ThinkingDeepSearchQA73.65 / 7Tracked evidence
GPT-5 · GPT-5.3 CodexGDPVal70.95 / 13Tracked evidence
GPT-5 · GPT-5.5 ThinkingExploitBench345 / 5Tracked evidence
GPT-5 · GPT-5.4 ThinkingGDPVal-AA16726 / 19Tracked evidence
GPT-5 · GPT-5.3 CodexToolathlon51.96 / 33Tracked evidence
GPT-5 · GPT-5.5 ThinkingOSWorld · verified78.77 / 35Tracked evidence
GPT-5 · GPT-5.5 ThinkingAutomation Bench12.97 / 9Tracked evidence
GPT-5 · GPT-5.2 ThinkingOSWorld38.29 / 10Tracked evidence
GPT-5 Mini · Thinking (5.4)GDPVal-AA · v2117110 / 14Tracked evidence
GPT-5 · GPT-5.2 ThinkingBFCL v463.110 / 18Tracked evidence
GPT-5 · GPT-5.2 ThinkingGDPVal-AA146211 / 19Tracked evidence
GPT-5 · GPT-5.4 ThinkingOSWorld · verified7511 / 35Tracked evidence
GPT-5 Mini · Thinking (5.0)BFCL v455.511 / 18Tracked evidence
GPT-5 · GPT-5.2 ThinkingSeal-04511 / 16Tracked evidence
GPT-5 Mini · Thinking (5.0)DeepPlanning17.911 / 16Tracked evidence
GPT-5 Mini · Thinking (5.0)WideSearch47.212 / 13Tracked evidence
GPT-5 · GPT-5.3 CodexOSWorld · verified7413 / 35Tracked evidence
GPT-5 · GPT-5.2 ThinkingToolathlon46.315 / 33Tracked evidence
GPT-5 Mini · Thinking (5.0)Seal-034.215 / 16Tracked evidence
GPT-5 Mini · Thinking (5.4)Toolathlon42.917 / 33Tracked evidence
GPT-5 Mini · Thinking (5.4)OSWorld · verified72.118 / 35Tracked evidence
GPT-5 Nano · Thinking (5.4)Toolathlon35.525 / 33Tracked evidence
GPT-5 Mini · Thinking (5.0)Toolathlon26.928 / 33Tracked evidence
GPT-5 · GPT-5.2 ThinkingOSWorld · verified47.329 / 35Tracked evidence
GPT-5 Mini · Thinking (5.0)OSWorld · verified4230 / 35Tracked evidence
GPT-5 Nano · Thinking (5.4)OSWorld · verified3932 / 35Tracked evidence

Multimodal

Model / VariantBenchmarkScoreRankScoring
GPT-5 · GPT-5.2 ThinkingScreenSpot-Pro86.31 / 24Tracked evidence
GPT-5 · GPT-5.2 ThinkingMMVU80.81 / 20Tracked evidence
GPT-5 · GPT-5.2 ThinkingMVBench78.11 / 18Tracked evidence
GPT-5 · GPT-5.4 ThinkingZEROBench231 / 27Tracked evidence
GPT-5 · GPT-5.2 ThinkingDynaMath86.82 / 23Tracked evidence
GPT-5 · GPT-5.2 ThinkingVideoMME · without_sub85.82 / 21Tracked evidence
GPT-5 · GPT-5.4 ThinkingMedXpertQA · text59.62 / 5Tracked evidence
GPT-5 · GPT-5.4 ThinkingMedXpertQA · mm77.13 / 32Tracked evidence
GPT-5 · GPT-5.2 ThinkingMotionBench64.83 / 4Tracked evidence
GPT-5 · GPT-5.2 ThinkingVideo-MMMU85.94 / 28Tracked evidence
GPT-5 · GPT-5.4 ThinkingERQA65.44 / 27Tracked evidence
GPT-5 · GPT-5.2 ThinkingWorldVQA284 / 5Tracked evidence
GPT-5 · GPT-5.5 ThinkingCharXiv Reasoning84.15 / 54Tracked evidence
GPT-5 · GPT-5.2 ThinkingLVBench73.75 / 18Tracked evidence
GPT-5 · GPT-5.2 ThinkingMedXpertQA · mm73.35 / 32Tracked evidence
GPT-5 · GPT-5.2 ThinkingMLVU · mavg85.66 / 22Tracked evidence
GPT-5 · GPT-5.2 ThinkingAI2D · test92.27 / 33Tracked evidence
GPT-5 · GPT-5.4 ThinkingCharXiv Reasoning82.87 / 54Tracked evidence
GPT-5 · GPT-5.2 ThinkingRealWorldQA83.38 / 24Tracked evidence
GPT-5 · GPT-5.2 ThinkingMathVision838 / 17Tracked evidence
GPT-5 · GPT-5.2 ThinkingSLAKE76.98 / 22Tracked evidence
GPT-5 · GPT-5.2 ThinkingZEROBench · sub33.28 / 23Tracked evidence
GPT-5 · GPT-5.2 ThinkingZEROBench98 / 27Tracked evidence
GPT-5 · GPT-5.2 ThinkingVideoMME · with_sub869 / 22Tracked evidence
GPT-5 · GPT-5.2 ThinkingEmbSpatialBench81.39 / 24Tracked evidence
GPT-5 Mini · Thinking (5.0)VLMs Are Blind75.89 / 18Tracked evidence
GPT-5 · GPT-5.2 ThinkingLingoQA68.89 / 16Tracked evidence
GPT-5 · GPT-5.2 ThinkingCharXiv Reasoning82.110 / 54Tracked evidence
GPT-5 · GPT-5.4 ThinkingSimpleVQA61.110 / 29Tracked evidence
GPT-5 · GPT-5.2 ThinkingERQA59.810 / 27Tracked evidence
GPT-5 · GPT-5.2 ThinkingBabyVision34.410 / 22Tracked evidence
GPT-5 · GPT-5.2 ThinkingCountBench91.911 / 23Tracked evidence
GPT-5 Mini · Thinking (5.0)MLVU · mavg83.311 / 22Tracked evidence
GPT-5 Mini · Thinking (5.0)Video-MMMU82.511 / 28Tracked evidence
GPT-5 Mini · Thinking (5.0)EmbSpatialBench80.711 / 24Tracked evidence
GPT-5 Mini · Thinking (5.0)VideoMME · without_sub78.911 / 21Tracked evidence
GPT-5 · GPT-5.2 ThinkingMMStar77.111 / 33Tracked evidence
GPT-5 Mini · Thinking (5.0)MMVU69.811 / 20Tracked evidence
GPT-5 Mini · Thinking (5.0)AI2D · test88.212 / 33Tracked evidence
GPT-5 Mini · Thinking (5.0)VideoMME · with_sub83.512 / 22Tracked evidence
GPT-5 Mini · Thinking (5.0)DynaMath81.412 / 23Tracked evidence
GPT-5 Mini · Thinking (5.0)LingoQA62.412 / 16Tracked evidence
GPT-5 Mini · Thinking (5.0)ZEROBench · sub27.312 / 23Tracked evidence
GPT-5 Mini · Thinking (5.0)CountBench9113 / 23Tracked evidence
GPT-5 · GPT-5.2 ThinkingMathVista · mini83.113 / 36Tracked evidence
GPT-5 Mini · Thinking (5.0)RealWorldQA7913 / 24Tracked evidence
GPT-5 Mini · Thinking (5.0)MathVision71.913 / 17Tracked evidence
GPT-5 Mini · Thinking (5.0)SLAKE70.513 / 22Tracked evidence
GPT-5 Mini · Thinking (5.0)ERQA5413 / 27Tracked evidence
GPT-5 · GPT-5.1 ThinkingVideo-MMMU80.414 / 28Tracked evidence
GPT-5 Nano · Thinking (5.0)LingoQA5714 / 16Tracked evidence
GPT-5 · GPT-5.2 ThinkingMMBench · en_dev_v1_188.215 / 24Tracked evidence
GPT-5 Mini · Thinking (5.0)MMStar74.115 / 33Tracked evidence
GPT-5 Nano · Thinking (5.0)VLMs Are Blind66.715 / 18Tracked evidence
GPT-5 Mini · Thinking (5.0)SimpleVQA56.815 / 29Tracked evidence
GPT-5 Mini · Thinking (5.0)BabyVision20.915 / 22Tracked evidence
GPT-5 Mini · Thinking (5.0)MMBench · en_dev_v1_186.816 / 24Tracked evidence
GPT-5 Mini · Thinking (5.4)CharXiv Reasoning80.316 / 54Tracked evidence
GPT-5 Nano · Thinking (5.0)DynaMath7816 / 23Tracked evidence
GPT-5 Nano · Thinking (5.0)MMVU63.116 / 20Tracked evidence
GPT-5 Nano · Thinking (5.0)MathVision62.216 / 17Tracked evidence
GPT-5 Nano · Thinking (5.0)ZEROBench · sub22.216 / 23Tracked evidence
GPT-5 Mini · Thinking (5.0)ZEROBench316 / 27Tracked evidence
GPT-5 · GPT-5.2 ThinkingV*75.918 / 23Tracked evidence
GPT-5 Nano · Thinking (5.0)EmbSpatialBench74.218 / 24Tracked evidence
GPT-5 · GPT-5.2 ThinkingHallusionBench65.218 / 33Tracked evidence
GPT-5 · GPT-5.2 ThinkingSimpleVQA55.818 / 29Tracked evidence
GPT-5 Nano · Thinking (5.0)RefSpatialBench12.618 / 21Tracked evidence
GPT-5 Nano · Thinking (5.0)RealWorldQA71.819 / 24Tracked evidence
GPT-5 Mini · Thinking (5.0)V*71.719 / 23Tracked evidence
GPT-5 Nano · Thinking (5.0)VideoMME · without_sub66.219 / 21Tracked evidence
GPT-5 Nano · Thinking (5.0)ERQA45.819 / 27Tracked evidence
GPT-5 Nano · Thinking (5.0)CountBench8020 / 23Tracked evidence
GPT-5 Nano · Thinking (5.0)VideoMME · with_sub71.720 / 22Tracked evidence
GPT-5 Nano · Thinking (5.0)MLVU · mavg69.220 / 22Tracked evidence
GPT-5 · GPT-5.4 ThinkingScreenSpot-Pro3920 / 24Tracked evidence
GPT-5 Mini · Thinking (5.0)RefSpatialBench920 / 21Tracked evidence
GPT-5 Nano · Thinking (5.0)ZEROBench120 / 27Tracked evidence
GPT-5 Mini · Thinking (5.0)MathVista · mini79.121 / 36Tracked evidence
GPT-5 Nano · Thinking (5.0)V*68.121 / 23Tracked evidence
GPT-5 Nano · Thinking (5.0)SLAKE5721 / 22Tracked evidence
GPT-5 Nano · Thinking (5.0)BabyVision14.421 / 22Tracked evidence
GPT-5 Nano · Thinking (5.0)MMBench · en_dev_v1_180.322 / 24Tracked evidence
GPT-5 Nano · Thinking (5.0)SimpleVQA4623 / 29Tracked evidence
GPT-5 Mini · Thinking (5.0)MedXpertQA · mm34.423 / 32Tracked evidence
GPT-5 Nano · Thinking (5.0)MMStar68.624 / 33Tracked evidence
GPT-5 Mini · Thinking (5.0)HallusionBench63.224 / 33Tracked evidence
GPT-5 Nano · Thinking (5.0)Video-MMMU6324 / 28Tracked evidence
GPT-5 · GPT-5.1 ThinkingScreenSpot-Pro3.524 / 24Tracked evidence
GPT-5 Nano · Thinking (5.0)AI2D · test81.925 / 33Tracked evidence
GPT-5 Mini · Thinking (5.0)CharXiv Reasoning75.526 / 54Tracked evidence
GPT-5 Nano · Thinking (5.0)MedXpertQA · mm26.726 / 32Tracked evidence
GPT-5 Nano · Thinking (5.0)HallusionBench58.427 / 33Tracked evidence
GPT-5 Nano · Thinking (5.0)MathVista · mini71.530 / 36Tracked evidence
GPT-5 · GPT-5.1 ThinkingCharXiv Reasoning69.534 / 54Tracked evidence
GPT-5 Nano · Thinking (5.0)CharXiv Reasoning50.149 / 54Tracked evidence

Document/OCR

Model / VariantBenchmarkScoreRankScoring
GPT-5 · GPT-5.2 ThinkingOmniDocBench · v1_50.14 / 6Tracked evidence
GPT-5 Mini · Thinking (5.0)MMLongBench-Doc50.312 / 22Tracked evidence
GPT-5 Mini · Thinking (5.0)OCRBench82.120 / 35Tracked evidence
GPT-5 Nano · Thinking (5.0)MMLongBench-Doc31.821 / 22Tracked evidence
GPT-5 · GPT-5.2 ThinkingOCRBench80.723 / 35Tracked evidence
GPT-5 Nano · Thinking (5.0)OCRBench75.330 / 35Tracked evidence

Where this family sits in the market

GPT-5 mini and nano sit on the price-efficiency frontier within the family. Full GPT-5 trades cost for headroom on the hardest workloads.

AnthropicCohereDeepSeekGoogleMetaMicrosoftMiniMaxMistralMoonshotnvidiaOpenAIQwenthinking-machinesxAIZhipu

Dashed line = Pareto frontier (no model both cheaper and better). Thinking/non-thinking pairs of the same model are connected; line length = cost of reasoning. Hover any dot for details.

The GPT-5 family

Every variant we track in this family, grouped by license. Use this to orient before drilling into the variant table.

Closed · API only (4)

  • GPT-515 variants
  • GPT-5 Mini2 variants
  • GPT-5 Nano3 variants
  • GPT-5 Codex1 variant

Alternatives to consider

Peer families that solve overlapping problems. Pick by your binding constraint (cost, latency, open weights, vendor lock-in), not by leaderboard order.

Editor's notes

By borisLast verified AI-assisted, human-reviewed

Why this family matters

GPT-5 is OpenAI's flagship line. The decision is rarely "do we use it" (most teams already have an OpenAI key); it is which of the four tiers to run. The family is structured as a price ladder (nanomini → full → codex), and the price gap between adjacent tiers is large enough that picking the wrong one is a 5x to 25x cost mistake at production scale.

Each tier ships with multiple effort settings on the same model name, which is the part that is easy to miss: "GPT-5 mini" can mean a 5.0 routing or a 5.4 routing depending on which API knob is set, and the per-token cost roughly triples between the two. The variant table on this page flattens that ambiguity.

Which variant to start with

Default to openai-gpt-5-mini at the 5.0-thinking effort tier. On our current data it sits at Quality Score 77.3 with input pricing of $0.25 per million tokens, which puts it on the family's price-efficiency frontier. Step up to the 5.4-thinking tier of mini (QS 84.2, $0.75 input / $4.5 output per million) before you step up to full GPT-5; the per-token cost is still well under the flagship, and the score jump is large enough to absorb most of the "do I need full GPT-5?" workloads.

Reach for full GPT-5 only when you can name the workload that justifies the price gap: long-context recall over genuinely large documents, multi-step agentic plans where the ceiling matters, or evals where mini measurably underperforms. Without that named workload, you are paying for headroom you will not use.

When to deviate:

  • Coding agents: use openai-gpt-5-codex. Same headline price as full GPT-5 ($1.25 input / $10 output per million) but tuned for agentic-coding loops. The price premium over mini is the cost of the tool-use and multi-step reliability profile; reach for codex when agentic-coding throughput is the binding constraint, not when the occasional code question comes up in a chat workload.
  • High-volume chat at scale: drop to openai-gpt-5-nano ($0.05 input / $0.4 output). The score gap to mini is real (LiveBench, GPQA Diamond), but for repetitive low-stakes turns the per-token cost cut is the dominant factor in the unit economics.
  • Long-context RAG: use full openai-gpt-5. Standard pricing covers a 400K-context window (enough for most document workloads). A 1M-context premium tier is listed at $2.5 input / $15 output per million; reach for it only after measuring that recall over the upper range of your documents actually degrades answer quality.
  • You already use mini for everything: before adding full GPT-5 to the rotation, run an A/B on your specific eval rather than relying on the headline benchmark deltas. The benchmark you read about and the workload you ship are rarely the same distribution; the cheaper way to learn whether full GPT-5 earns its 5x cost on your traffic is one evening of side-by-side runs, not a procurement debate.

Where the data is weak

We aggregate benchmark scores from multiple sources but coverage across the family is uneven. Specifically:

  • The 5.4-thinking tier has thinner benchmark coverage than 5.0-thinking in our index. Several benchmarks (SWE-Bench Verified, LiveBench, Terminal-Bench, MMLU Pro) only have 5.0-thinking numbers; the 5.4-thinking figures will fill in as more eval houses re-run.
  • openai-gpt-5-codex shows a single price point and a single context window in our index. If OpenAI exposes a longer-context Codex variant through a dedicated SKU, treat the codex line on this page as covering only the standard tier until we backfill.
  • Pricing on this page is the published API list price. Many teams negotiate volume discounts that change the unit economics for full GPT-5 vs mini significantly. The price ladder framing on this page is structurally right; the absolute multipliers may compress at scale.
  • "Quality Score" combines several public benchmarks into a single comparable number. It is useful for ranking within the family and rough cross-family comparison; it is not a substitute for running your own eval on the workload you actually ship.

If you are making a procurement decision, the variant table on this page is the load-bearing artifact. Cross-check pricing against the OpenAI docs before you commit. Pricing changes faster than our scrape cadence.

When to reach for which alternative

  • Your workload is dominated by data-sovereignty or self-hosting requirements: GPT-5 is API-only, full stop. The conversation moves to open-weights families (Qwen3, Llama, DeepSeek). Compare on the specific benchmark that matters for your workload; on broad general-purpose evals the flagship closed models still hold a lead, but the gap on hosted-API quality-per-dollar narrows once you factor self-host economics.
  • Long-form reasoning is the binding workload: check Claude Opus and DeepSeek-R1 scores on the same benchmark in our index before committing. Long chain-of-thought is the workload where ranking is most likely to flip family.
  • Cost ceiling is the binding constraint: mini and nano are already the answer within OpenAI; if even nano is too expensive, the question becomes which open-weights variant fits your hardware budget, not which OpenAI tier.

Sources worth reading

How we score

Model pages mix public benchmark rows, published API prices, model metadata, and VoidSource commentary. First-party runs are labelled when we measured them ourselves; aggregated public rows stay attributed to their source. We do not accept paid placements.

Author: Boris. Read the full methodology.

Get the next GPT-5 update

New variants, repriced models, and recommendation changes, in plain English. No spam, no paid placements.

Subscribe →

Need help picking for production?

Independent evaluation against your real workload, your real data, and your real cost ceiling. No vendor incentives.

See services →