IS IT COOKED?
The same tests, every model, every day. When a model silently gets worse — quantized, throttled, or “improved” — the scores drop and the verdict flips. Receipts included.
last run 2026-08-10 · nothing cooked today
| Model | Bench score | Verdict | Structured Extraction | Math & Reasoning | Code Generation | Instruction Following | Report Analysis | Summarization | Customer Service | Web Design | Game Design | Creative Writing |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Claude Fable 5Anthropic | 97.0 | SUSPICIOUS | ||||||||||
| Claude Sonnet 5Anthropic | 91.1 | NOT COOKED | ||||||||||
| Gemini 3.1 ProGoogle | 87.9 | NOT COOKED | ||||||||||
| Nex N2 ProNex AGI | 85.7 | NOT COOKED | ||||||||||
| GPT-5.5OpenAI | 85.2 | NOT COOKED | ||||||||||
| GLM 5.2Z.AI | 82.4 | NOT COOKED | ||||||||||
| MiMo V2.5 ProXiaomi | 79.4 | SUSPICIOUS | ||||||||||
| MiniMax M3MiniMax | 74.6 | SUSPICIOUS | ||||||||||
| Grok 4.3xAI | 70.9 | NOT COOKED | ||||||||||
| GPT-5.4 MiniOpenAI | 68.2 | SUSPICIOUS | ||||||||||
| Claude Haiku 4.5Anthropic | 58.6 | NOT COOKED | ||||||||||
| Gemini 3.6 FlashGoogle | — | NOT COOKED | 55 | |||||||||
| Grok 4.5xAI | — | SUSPICIOUS | ||||||||||
| Kimi K3Moonshot | — | no data | — | — | — | — | — | — | — | — | — | — |
| Muse Spark 1.1Meta | — | NOT COOKED | 95 | |||||||||
| GPT-5.6 SolOpenAI | — | NOT COOKED | ||||||||||
| GPT-5.6 TerraOpenAI | — | NOT COOKED | ||||||||||
| GPT-5.6 LunaOpenAI | — | NOT COOKED | ||||||||||
| Claude Opus 5Anthropic | — | SUSPICIOUS | 97 | 99 |
Bench score aggregates public benchmarks (LMArena, MMLU-Pro, GPQA, SWE-bench, AIME). Sparklines are 14 days of our own daily tests. Methodology →