# CompareLLM > Continuous empirical AI model leaderboard & Pareto frontier. Every benchmark metric has a named public source and an as-of timestamp. Aggregates LMSYS Arena Elo, SWE-bench Verified, LiveBench, and real-time token pricing. Site: https://www.comparellm.ai Methodology: https://www.comparellm.ai/methodology Open API (JSON): https://www.comparellm.ai/api/v1/models Stack Engine: https://www.comparellm.ai/stack Guides: https://www.comparellm.ai/guides News & Launches: https://www.comparellm.ai/news All Models Catalog: https://www.comparellm.ai/models Compare Hub: https://www.comparellm.ai/compare Best Lists Hub: https://www.comparellm.ai/best ## Benchmark Metric Definitions - Preference Elo (Elo): Unit: Elo (higher is better). [Leaderboard](https://www.comparellm.ai/leaderboards/elo) - Coding Elo (Code Elo): Unit: Elo (higher is better). [Leaderboard](https://www.comparellm.ai/leaderboards/elo_coding) - LiveBench (LiveBench): Unit: % (higher is better). [Leaderboard](https://www.comparellm.ai/leaderboards/livebench) - SWE-bench (SWE-bench): Unit: % (higher is better). [Leaderboard](https://www.comparellm.ai/leaderboards/swe_bench) - GPQA Diamond (GPQA): Unit: % (higher is better). [Leaderboard](https://www.comparellm.ai/leaderboards/gpqa) - Time to first token (TTFT): Unit: ms (lower is better). [Leaderboard](https://www.comparellm.ai/leaderboards/ttft_ms) - Output speed (Speed): Unit: tok/s (higher is better). [Leaderboard](https://www.comparellm.ai/leaderboards/tokens_per_sec) - Input price (In $): Unit: $/1M (lower is better). [Leaderboard](https://www.comparellm.ai/leaderboards/input_price_per_m) - Output price (Out $): Unit: $/1M (lower is better). [Leaderboard](https://www.comparellm.ai/leaderboards/output_price_per_m) - Context window (Context): Unit: tokens (higher is better). [Leaderboard](https://www.comparellm.ai/leaderboards/context_window) ## Models Fact Sheets - [Claude Opus 4.5](https://www.comparellm.ai/models/claude-opus-4-5): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-opus-4-5/vs - [Claude Opus 4.6](https://www.comparellm.ai/models/claude-opus-4-6): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-opus-4-6/vs - [Claude Sonnet 4.5](https://www.comparellm.ai/models/claude-sonnet-4-5): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-sonnet-4-5/vs - [Claude 3.7 Sonnet](https://www.comparellm.ai/models/claude-3-7-sonnet): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-3-7-sonnet/vs - [GPT-5](https://www.comparellm.ai/models/gpt-5): OpenAI (Closed API). VS Hub: https://www.comparellm.ai/models/gpt-5/vs - [GPT-5 mini](https://www.comparellm.ai/models/gpt-5-mini): OpenAI (Closed API). VS Hub: https://www.comparellm.ai/models/gpt-5-mini/vs - [GPT-4o](https://www.comparellm.ai/models/gpt-4o): OpenAI (Closed API). VS Hub: https://www.comparellm.ai/models/gpt-4o/vs - [GPT-4o mini](https://www.comparellm.ai/models/gpt-4o-mini): OpenAI (Closed API). VS Hub: https://www.comparellm.ai/models/gpt-4o-mini/vs - [Gemini 3 Pro](https://www.comparellm.ai/models/gemini-3-pro): Google (Closed API). VS Hub: https://www.comparellm.ai/models/gemini-3-pro/vs - [Gemini 3 Flash](https://www.comparellm.ai/models/gemini-3-flash): Google (Closed API). VS Hub: https://www.comparellm.ai/models/gemini-3-flash/vs - [Gemini 2.5 Pro](https://www.comparellm.ai/models/gemini-2-5-pro): Google (Closed API). VS Hub: https://www.comparellm.ai/models/gemini-2-5-pro/vs - [Gemini 2.5 Flash](https://www.comparellm.ai/models/gemini-2-5-flash): Google (Closed API). VS Hub: https://www.comparellm.ai/models/gemini-2-5-flash/vs - [Grok 4.6](https://www.comparellm.ai/models/grok-4-6): xAI (Closed API). VS Hub: https://www.comparellm.ai/models/grok-4-6/vs - [Grok 4](https://www.comparellm.ai/models/grok-4): xAI (Closed API). VS Hub: https://www.comparellm.ai/models/grok-4/vs - [DeepSeek V4 Pro](https://www.comparellm.ai/models/deepseek-v4-pro): DeepSeek (Open-weights). VS Hub: https://www.comparellm.ai/models/deepseek-v4-pro/vs - [DeepSeek R1](https://www.comparellm.ai/models/deepseek-r1): DeepSeek (Open-weights). VS Hub: https://www.comparellm.ai/models/deepseek-r1/vs - [Qwen 3 Max](https://www.comparellm.ai/models/qwen-3-max): Alibaba (Closed API). VS Hub: https://www.comparellm.ai/models/qwen-3-max/vs - [Qwen3 235B](https://www.comparellm.ai/models/qwen-3-235b): Alibaba (Open-weights). VS Hub: https://www.comparellm.ai/models/qwen-3-235b/vs - [Llama 4 Maverick](https://www.comparellm.ai/models/llama-4-maverick): Meta (Open-weights). VS Hub: https://www.comparellm.ai/models/llama-4-maverick/vs - [Llama 3.3 70B](https://www.comparellm.ai/models/llama-3-3-70b): Meta (Open-weights). VS Hub: https://www.comparellm.ai/models/llama-3-3-70b/vs - [Kimi K3](https://www.comparellm.ai/models/kimi-k3): Moonshot (Closed API). VS Hub: https://www.comparellm.ai/models/kimi-k3/vs - [MoonshotAI: Kimi K2.5](https://www.comparellm.ai/models/kimi-k2-5): Moonshot (Closed API). VS Hub: https://www.comparellm.ai/models/kimi-k2-5/vs - [MoonshotAI: Kimi K2 0711](https://www.comparellm.ai/models/kimi-k2): Moonshot (Closed API). VS Hub: https://www.comparellm.ai/models/kimi-k2/vs - [Kimi Chat 1.5](https://www.comparellm.ai/models/kimi-1-5-long): Moonshot (Closed API). VS Hub: https://www.comparellm.ai/models/kimi-1-5-long/vs - [Qwen QwQ 32B](https://www.comparellm.ai/models/qwq-32b): Alibaba (Open-weights). VS Hub: https://www.comparellm.ai/models/qwq-32b/vs - [Qwen 2.5 Plus](https://www.comparellm.ai/models/qwen-2-5-plus): Alibaba (Closed API). VS Hub: https://www.comparellm.ai/models/qwen-2-5-plus/vs - [Doubao Pro 1.5](https://www.comparellm.ai/models/doubao-1-5-pro-128k): ByteDance (Closed API). VS Hub: https://www.comparellm.ai/models/doubao-1-5-pro-128k/vs - [Doubao Lite 1.5](https://www.comparellm.ai/models/doubao-1-5-lite): ByteDance (Closed API). VS Hub: https://www.comparellm.ai/models/doubao-1-5-lite/vs - [Yi-Lightning](https://www.comparellm.ai/models/yi-lightning): 01.AI (Closed API). VS Hub: https://www.comparellm.ai/models/yi-lightning/vs - [Yi-Large](https://www.comparellm.ai/models/yi-large): 01.AI (Closed API). VS Hub: https://www.comparellm.ai/models/yi-large/vs - [Ernie 4.5 Turbo](https://www.comparellm.ai/models/ernie-4-5): Baidu (Closed API). VS Hub: https://www.comparellm.ai/models/ernie-4-5/vs - [OpenAI: o3 Mini](https://www.comparellm.ai/models/o3-mini): OpenAI (Closed API). VS Hub: https://www.comparellm.ai/models/o3-mini/vs - [OpenAI: o1](https://www.comparellm.ai/models/o1): OpenAI (Closed API). VS Hub: https://www.comparellm.ai/models/o1/vs - [GPT-4.5 Orion](https://www.comparellm.ai/models/gpt-4-5): OpenAI (Closed API). VS Hub: https://www.comparellm.ai/models/gpt-4-5/vs - [Gemini 2.0 Flash Thinking](https://www.comparellm.ai/models/gemini-2-flash-thinking): Google (Closed API). VS Hub: https://www.comparellm.ai/models/gemini-2-flash-thinking/vs - [GLM-5.2](https://www.comparellm.ai/models/glm-5-2): Zhipu (Open-weights). VS Hub: https://www.comparellm.ai/models/glm-5-2/vs - [MiniMax M2.5](https://www.comparellm.ai/models/minimax-m2-5): MiniMax (Open-weights). VS Hub: https://www.comparellm.ai/models/minimax-m2-5/vs - [Mistral Large 3](https://www.comparellm.ai/models/mistral-large-3): Mistral (Closed API). VS Hub: https://www.comparellm.ai/models/mistral-large-3/vs - [Codestral 25.01](https://www.comparellm.ai/models/codestral-25): Mistral (Closed API). VS Hub: https://www.comparellm.ai/models/codestral-25/vs - [Command A](https://www.comparellm.ai/models/command-a): Cohere (Closed API). VS Hub: https://www.comparellm.ai/models/command-a/vs - [Claude Opus 5](https://www.comparellm.ai/models/claude-opus-5): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-opus-5/vs - [Claude Fable 5](https://www.comparellm.ai/models/claude-fable-5): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-fable-5/vs - [Claude Opus 4.8](https://www.comparellm.ai/models/claude-opus-4-8): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-opus-4-8/vs - [Claude Sonnet 5](https://www.comparellm.ai/models/claude-sonnet-5): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-sonnet-5/vs - [GPT-5.6 Sol](https://www.comparellm.ai/models/gpt-5-6-sol): OpenAI (Closed API). VS Hub: https://www.comparellm.ai/models/gpt-5-6-sol/vs - [GPT-5.6 Terra](https://www.comparellm.ai/models/gpt-5-6-terra): OpenAI (Closed API). VS Hub: https://www.comparellm.ai/models/gpt-5-6-terra/vs - [GPT-5.6 Luna](https://www.comparellm.ai/models/gpt-5-6-luna): OpenAI (Closed API). VS Hub: https://www.comparellm.ai/models/gpt-5-6-luna/vs - [Gemini 3.6 Pro](https://www.comparellm.ai/models/gemini-3-6-pro): Google (Closed API). VS Hub: https://www.comparellm.ai/models/gemini-3-6-pro/vs - [Gemini 3.6 Flash](https://www.comparellm.ai/models/gemini-3-6-flash): Google (Closed API). VS Hub: https://www.comparellm.ai/models/gemini-3-6-flash/vs - [Gemini 3.7 Flash](https://www.comparellm.ai/models/gemini-3-7-flash): Google (Closed API). VS Hub: https://www.comparellm.ai/models/gemini-3-7-flash/vs - [GLM-5.3](https://www.comparellm.ai/models/glm-5-3): Zhipu (Closed API). VS Hub: https://www.comparellm.ai/models/glm-5-3/vs - [Qwen3.8 27B](https://www.comparellm.ai/models/qwen-3-8-27b): Alibaba (Open-weights). VS Hub: https://www.comparellm.ai/models/qwen-3-8-27b/vs - [DeepSeek V4 Flash](https://www.comparellm.ai/models/deepseek-v4-flash): DeepSeek (Open-weights). VS Hub: https://www.comparellm.ai/models/deepseek-v4-flash/vs - [Seed 2.1 Turbo](https://www.comparellm.ai/models/seed-2-1-turbo): ByteDance (Closed API). VS Hub: https://www.comparellm.ai/models/seed-2-1-turbo/vs - [Claude Haiku 4.5](https://www.comparellm.ai/models/claude-haiku-4-5): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-haiku-4-5/vs - [Llama 4 Scout](https://www.comparellm.ai/models/llama-4-scout): Meta (Open-weights). VS Hub: https://www.comparellm.ai/models/llama-4-scout/vs - [Claude 3 Opus](https://www.comparellm.ai/models/claude-3-opus): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-3-opus/vs - [Claude Opus 4](https://www.comparellm.ai/models/claude-opus-4): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-opus-4/vs - [Claude 3.5 Sonnet](https://www.comparellm.ai/models/claude-3-5-sonnet): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-3-5-sonnet/vs - [Claude Sonnet 4](https://www.comparellm.ai/models/claude-sonnet-4): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-sonnet-4/vs - [Claude 3.5 Haiku](https://www.comparellm.ai/models/claude-3-5-haiku): Anthropic (Closed API). VS Hub: https://www.comparellm.ai/models/claude-3-5-haiku/vs - [GPT-4 Turbo](https://www.comparellm.ai/models/gpt-4-turbo): OpenAI (Closed API). VS Hub: https://www.comparellm.ai/models/gpt-4-turbo/vs - [Grok 3](https://www.comparellm.ai/models/grok-3): xAI (Closed API). VS Hub: https://www.comparellm.ai/models/grok-3/vs - [DeepSeek V3](https://www.comparellm.ai/models/deepseek-v3): DeepSeek (Open-weights). VS Hub: https://www.comparellm.ai/models/deepseek-v3/vs - [Llama 3.1 70B](https://www.comparellm.ai/models/llama-3-1-70b): Meta (Open-weights). VS Hub: https://www.comparellm.ai/models/llama-3-1-70b/vs - [Gemini 1.5 Pro](https://www.comparellm.ai/models/gemini-1-5-pro): Google (Closed API). VS Hub: https://www.comparellm.ai/models/gemini-1-5-pro/vs - [Llama 3.1 405B](https://www.comparellm.ai/models/llama-3-1-405b): Meta (Open-weights). VS Hub: https://www.comparellm.ai/models/llama-3-1-405b/vs - [Qwen 2.5 Coder 32B](https://www.comparellm.ai/models/qwen-2-5-coder-32b): Alibaba (Open-weights). VS Hub: https://www.comparellm.ai/models/qwen-2-5-coder-32b/vs - [OpenAI o1-mini](https://www.comparellm.ai/models/o1-mini): OpenAI (Closed API). VS Hub: https://www.comparellm.ai/models/o1-mini/vs - [DeepSeek Coder V2](https://www.comparellm.ai/models/deepseek-coder-v2): DeepSeek (Open-weights). VS Hub: https://www.comparellm.ai/models/deepseek-coder-v2/vs ## Stack Engine Presets - [cheap coding agents](https://www.comparellm.ai/stack/cheap-coding): SWE-bench first, then price. For CI bots and repo agents that cannot burn Opus prices. - [open-weight reasoning](https://www.comparellm.ai/stack/open-weights-reasoning): Highest reasoning signal among models you can self-host or buy as open weights. - [lowest-latency chat](https://www.comparellm.ai/stack/lowest-latency-chat): TTFT and tokens/sec first. For support widgets and voice-adjacent loops. - [long-context RAG](https://www.comparellm.ai/stack/long-context-rag): Context window and input price for stuffing large corpora. - [frontier agents](https://www.comparellm.ai/stack/frontier-agents): Coding + preference Elo for computer-use and multi-step tools. - [vision and screenshots](https://www.comparellm.ai/stack/vision-multimodal): Multimodal models only. Preference Elo and latency for UI-understanding jobs. - [cheapest hosted API](https://www.comparellm.ai/stack/cheapest-api): Output price first among models we still consider usable for chat. - [highest coding accuracy](https://www.comparellm.ai/stack/best-coding): SWE-bench first with no budget cap. For when the patch quality matters more than the invoice. - [writing and editing](https://www.comparellm.ai/stack/writing-prose): Preference Elo first for long-form drafts. Price still counts if you generate all day. - [mid-tier workhorse](https://www.comparellm.ai/stack/mid-tier-workhorse): Sonnet / Terra / Flash class. Usable Elo without Opus or Sol prices. - [cheapest frontier](https://www.comparellm.ai/stack/cheapest-frontier): Models that still clear a high Elo bar, sorted so price hurts. ## High-Intent Best Rankings - [Best coding LLM in 2026 (SWE-bench)](https://www.comparellm.ai/best/best-coding-llm): Models ranked for repo work using dated SWE-bench snapshots, then price and speed. Not a single lab score. - [Best cheap LLM in 2026](https://www.comparellm.ai/best/best-cheap-llm): Lowest list-price models that still clear a usability bar. For high-volume chat and batch jobs. - [Fastest LLM in 2026 (TTFT and tok/s)](https://www.comparellm.ai/best/fastest-llm): Time-to-first-token and output speed from dated snapshots. For voice, widgets, and tight loops. - [Best open-source LLM in 2026](https://www.comparellm.ai/best/best-open-source-llm): Open-weight models ranked on preference Elo, LiveBench, and SWE-bench. Check the license before you ship. - [Best LLM for RAG in 2026](https://www.comparellm.ai/best/best-llm-for-rag): Context window and input list price first. For stuffing corpora, not for coding agents. - [Best LLM for agents in 2026](https://www.comparellm.ai/best/best-llm-for-agents): SWE-bench and preference Elo for tool-using and computer-use stacks. - [Best vision LLM in 2026](https://www.comparellm.ai/best/best-vision-llm): Models marked multimodal, ranked on Elo and latency for screenshot and document jobs. - [Best LLM for writing in 2026](https://www.comparellm.ai/best/best-llm-for-writing): Preference Elo first for long-form writing. Price still matters if you generate all day. - [Best mid-range LLM in 2026](https://www.comparellm.ai/best/best-mid-range-llm): Workhorse models under $12/1M output. For daily coding and chat without Opus or Sol invoices. - [Cheapest frontier LLM in 2026](https://www.comparellm.ai/best/cheapest-frontier-llm): Models that still clear a high preference-Elo bar, ranked so list price hurts. - [Best local / open-weight LLM in 2026](https://www.comparellm.ai/best/best-local-llm): Open-weight rows you can self-host. Not a laptop VRAM guide — check the license and your box. - [Cheapest Claude alternative in 2026](https://www.comparellm.ai/best/cheapest-claude-alternative): Low list-price hosted models if Opus/Sonnet is too expensive. Then open the vs page against Sonnet 5. - [Cheapest coding LLM in 2026](https://www.comparellm.ai/best/cheapest-coding-llm): Repo agents ranked with SWE-bench first under a mid-tier budget. For CI bots that cannot burn Opus prices. - [Best LLM for chat in 2026](https://www.comparellm.ai/best/best-llm-for-chat): General assistants ranked for conversation quality. Elo first, then price if you chat all day. - [Claude vs GPT benchmark (2026)](https://www.comparellm.ai/best/claude-vs-gpt-benchmark): Current top Anthropic vs top OpenAI model: Elo, SWE-bench, speed, and price. - [Gemini vs GPT benchmark (2026)](https://www.comparellm.ai/best/gemini-vs-gpt-benchmark): Current top Google vs top OpenAI model on preference Elo, SWE-bench, and list price. - [Grok vs ChatGPT benchmark (2026)](https://www.comparellm.ai/best/grok-vs-chatgpt-benchmark): Current top xAI vs top OpenAI row. Price and Elo, not a personality contest. - [Claude vs Gemini benchmark (2026)](https://www.comparellm.ai/best/claude-vs-gemini-benchmark): Current top Anthropic vs top Google model. Coding, Elo, and output price. - [DeepSeek vs Claude benchmark (2026)](https://www.comparellm.ai/best/deepseek-vs-claude-benchmark): Current top DeepSeek vs top Anthropic. The usual cheap-vs-frontier question. - [Llama vs Claude benchmark (2026)](https://www.comparellm.ai/best/llama-vs-claude-benchmark): Current top Meta open-weight row versus current top Anthropic row. Elo, SWE-bench, and price. - [Kimi vs GPT benchmark (2026)](https://www.comparellm.ai/best/kimi-vs-gpt-benchmark): Current top Moonshot row versus current top OpenAI row. Open-weight-adjacent vs closed flagship. - [GLM vs Claude benchmark (2026)](https://www.comparellm.ai/best/glm-vs-claude-benchmark): Current top Zhipu GLM row versus current top Anthropic row. Coding and list price. ## Practical Evaluation Guides - [How CompareLLM compares AI models](https://www.comparellm.ai/guides/how-we-compare-ai-models): What Elo, LiveBench, SWE-bench, TTFT, and list price mean on this site — and what we refuse to invent. - [How to pick an LLM in 2026](https://www.comparellm.ai/guides/how-to-pick-an-llm): A practical order of operations: task, budget, latency, then Elo. Links into CompareLLM stacks and compares. - [Open-weight vs closed API models](https://www.comparellm.ai/guides/open-weights-vs-closed): When to self-host or buy open weights versus calling a frontier API. Catalog flags and trade-offs. - [SWE-bench vs preference Elo](https://www.comparellm.ai/guides/swe-bench-vs-elo): Why the best coding model is not always the best chatbot, and how CompareLLM keeps both numbers visible. - [How CompareLLM updates every day](https://www.comparellm.ai/guides/how-comparellm-updates): Plain-language walkthrough of the daily ingest: OpenRouter, LiveBench, SWE-bench, Arena Elo, then pages refresh. - [How to read LLM prices ($/1M tokens)](https://www.comparellm.ai/guides/how-to-read-llm-prices): List price is not your invoice. Cache, retries, long context, and output tokens move the real bill. - [What is TTFT in an LLM?](https://www.comparellm.ai/guides/what-is-ttft): Time-to-first-token versus tokens per second — which one matters for chat, voice, and coding agents. - [Claude Sonnet vs Opus in 2026](https://www.comparellm.ai/guides/sonnet-vs-opus): When Sonnet 5 is enough and when you still pay for Opus 5. Links into the live pair page. - [Gemini Flash vs Pro](https://www.comparellm.ai/guides/gemini-flash-vs-pro): Google’s workhorse versus Pro-class rows: price, context, and when Flash is the whole product. - [Grok vs ChatGPT in 2026](https://www.comparellm.ai/guides/grok-vs-chatgpt): How to read Grok 4.6 against GPT-5.6 Sol on Elo, price, and what this site will not invent. - [How to read LLM benchmarks without getting fooled](https://www.comparellm.ai/guides/how-to-read-llm-benchmarks): A short checklist: same split, same date, named source, no composite index you cannot audit. - [What is Elo on an AI leaderboard?](https://www.comparellm.ai/guides/what-is-elo): Elo is a crowd vote: people pick which hidden answer they like more. A higher Elo means more people preferred that model — not that it passed a test. - [What is LiveBench?](https://www.comparellm.ai/guides/what-is-livebench): Contamination-resistant objective tasks. Only compare scores from the same LiveBench release. - [How a new model joins the CompareLLM catalog](https://www.comparellm.ai/guides/how-new-models-join-comparellm): OpenRouter discovery, preview hold, second-source promote, then the compare matrix grows automatically.