BLK · COMPARE · MODELS · CUSTOM
Compare any two local AI models Pick any two open-weight models. Get a 10-dimension matrix + a hardware-fit table showing where each one runs across 8 common GPU tiers — 12 GB consumer cards to 192 GB Mac Studio M3 Ultra.
PICK ANY TWO MODELS
Model A — pick a model — Baichuan 4 13B (13B) Command R7B (12-2024) (8B) Aya Expanse 32B (32B) Command R 35B (35B) Command R+ (Aug 2024) (104B) Command R+ 104B (104B) DBRX Instruct (132B) DBRX Base (132B) DeepSeek R1 Distill Qwen 1.5B (1.5B) DeepSeek R1 Distill Qwen 7B (7B) DeepSeek R1 Distill Llama 8B (8B) DeepSeek R1 Distill Qwen 14B (14B) DeepSeek V2 Lite Chat (15.7B) DeepSeek MoE 16B Base (16B) DeepSeek V3 Lite (16B MoE) (16B) DeepSeek Coder V2 Lite (16B) (16B) DeepSeek R1 Distill Mistral 24B (24B) DeepSeek R1 Distill Qwen 32B (32B) DeepSeek R1 Distill Qwen 3 32B (32B) DeepSeek Coder V3 (33B) DeepSeek R1 Distill Llama 70B (70B) DeepSeek Coder V2 236B (236B) DeepSeek V2.5 236B (236B) DeepSeek V4 Flash (284B MoE) (284B) DeepSeek R1 (671B reasoning) (671B) DeepSeek V3 (671B MoE) (671B) DeepSeek V4 (745B) DeepSeek V4 Pro (1.6T MoE) (1600B) Dolphin 3.0 Llama 3.2 3B (3B) Dolphin 3.0 8B (8B) Dolphin 3.0 Mistral 24B (24B) Dolphin 3 Llama 3.3 70B (70B) EXAONE 3.5 2.4B Instruct (2.4B) EXAONE 3.5 2.4B (2.4B) EXAONE 3.5 8B (7.8B) EXAONE 3.5 32B (32B) EXAONE 4.0.1 32B (32B) K-EXAONE 236B A23B (236B) Falcon 3 3B Instruct (3B) Falcon 3 7B Instruct (7B) Falcon Mamba 7B (7B) Falcon 3 10B (10B) Falcon 40B Instruct (40B) Gemma 3 270M (0.27B) Gemma 3 1B (1B) Gemma 4 E2B (Effective 2B) (2B) Gemma 2 2B Instruct (2B) PaliGemma 2 3B (3B) ColPali v1.3 (3B) Gemma 4 E4B (Effective 4B) (4B) Gemma 3 4B (4B) CodeGemma 7B (7B) Gemma 2 9B Instruct (9B) Turkish Gemma 9B T1 (9B) YTU Turkish Gemma 9B v0.1 (9.2B) PaliGemma 2 10B (10B) Trendyol LLM Asure 12B (11.8B) Gemma 4 12B (12B) Gemma 3 12B (12B) Gemma 4 Turkish 26B (4B active) (26B) Gemma 4 26B MoE (26B) Gemma 4 26B-A4B (26B) MedGemma 27B (27B) Gemma 3 27B (27B) Gemma 4 31B Dense (31B) GLM-4 9B (9B) GLM-4V 9B (13.9B) GLM-4.7-Flash (31B) GLM-5 Pro (144B) GLM-5.2 (753B) Granite 3.0 2B Instruct (2B) Granite 3.1 2B Instruct (2B) Granite 4.1 3B Instruct (3.4B) Granite 3.0 8B Instruct (8B) Granite 3.2 8B (8B) Granite 3.3 8B (8B) Granite 4.1 8B Instruct (8.79B) Granite 3 MoE (3B active) (16B) Granite 4.1 30B Instruct (28.87B) Granite 4.1 30B (30B) Hermes 3 Llama 3.2 3B (3B) Hermes 3 Llama 3.1 8B (8B) Hermes 4 Llama 3.3 70B (70B) Hermes 3 Llama 3.1 70B (70B) Hunyuan 3.0 (Hy3) (295B) Hunyuan Large 389B MoE (389B) InternLM 2.5 7B Chat (7B) InternLM 3 8B (8B) Janus-Pro 7B (7B) Llama 3.2 1B Instruct (1B) TinyLlama 1.1B Chat v1.0 (1.1B) Salamandra 2B Instruct (2B) Salamandra 2B (2.25B) Llama 3.2 3B Instruct (3B) Salamandra 7B Instruct (7B) Swallow 7B (7B) Salamandra 7B (7B) Trendyol LLM 7B Chat v0.1 (7B) OpenThaiGPT 7B 1.0.0 Chat (7B) Trendyol LLM 7B Base v0.1 (7B) Cosmos Llama 3 8B Turkish (8B) Llama 3.1 8B Instruct (8B) RefinedNeuro RN TR R2 (8B) RefinedNeuro RN TR R1 (8B) Saiga Llama3 8B GGUF (8B) Llama 3.3 8B Instruct (8B) LLM-jp 4 8B Thinking (8B) LLM-jp 4 8B Instruct (8B) Gervásio 8B PTPT (8B) Turkish Llama 8B Instruct v0.1 (8B) Llama 3.1 Nemotron Nano 8B (8B) SOLAR 10.7B v1.0 (10.7B) Llama 3.2 11B Vision (11B) Bielik 11B v3.0 Instruct GGUF (11B) Llama 3.2 11B Vision Instruct (11B) Bielik-11B v3.0 Instruct FP8 Dynamic (11B) OpenThaiGPT 1.0.0 Beta 13B Chat (13B) Phind CodeLlama 34B v2 (34B) ALIA 40b instruct 2601 (40B) Llama 3.1 70B Instruct (70B) Hermes 4 70B FP8 (70B) Llama 4 70B (70B) Llama 3.1 Nemotron 70B Instruct (70B) EVA Llama 3.3 70B (70B) Llama 3.3 70B Instruct (70B) Llama 3.2 90B Vision Instruct (90B) Llama 3.2 90B Vision (90B) Llama 4 Scout (109B) Llama 3.1 Nemotron Ultra 253B (253B) Llama 4 Maverick (400B) Llama 4 405B (405B) MiniCPM 3 4B (4B) MiniCPM-V 2.6 8B (8B) MiniCPM-V 3 8B (8B) Kumru 2B (2.4B) Ministral 3B Instruct (3B) Mistral 7B Instruct v0.1 (7B) Mistral 7B OpenOrca GGUF (7B) Bielik 7B Instruct v0.1 GGUF (7B) Mistral 7B Instruct v0.3 (7B) Bielik 7B v0.1 (7B) Mistral 7B Instruct v0.2 (7B) Mistral 7B Instruct v0.2 (7B) Turkish Mistral 7B Instruct v0.2 (7B) Japanese StableLM Instruct Gamma 7B (7B) Codestral Mamba 7B (7B) Mistral Turkish v2 (brooqs) (7.2B) Malhajar Mistral 7B Turkish (7.2B) Turkcell LLM 7B v1 (7.4B) Ministral 8B Instruct (8B) Bielik 11B v2.3 Instruct (11B) Bielik 11B v2.2 Instruct GGUF (11B) Bielik 11B v2.3 Instruct (11B) Mistral Nemo 12B Instruct (12B) Pixtral 12B (12B) Ministral 3 14B (14B) Codestral 22B (22B) Mistral Medium 3 24B (dense) (24B) Devstral Small 2 24B (24B) Sarvam M (24B) Mistral Small 3.2 24B (24B) Mistral Small 3 24B (24B) Mistral Saba 24B (24B) Magistral 32B (32B) Mistral Large 2 (123B) (123B) Mistral Medium 3.5 (675B MoE) (675B) Mixtral 8X7B Instruct v0.1 GPTQ (46.7B) Mixtral 8x7B Instruct (47B) Mixtral 8x22B Instruct (141B) Kimi K1.5 (200B) Kimi K2.7-Code (1000B) OLMo 2 1B Instruct (1B) OLMo 2 13B (13B) OpenBioLLM Llama 3 70B (70B) OpenCoder 8B (8B) all-MiniLM-L6-v2 (0.022B) Piper (0.025B) Whisper Tiny (0.039B) Whisper Base (0.074B) Kokoro 82M (0.082B) all-mpnet-base-v2 (0.109B) paraphrase-multilingual-MiniLM-L12-v2 (0.118B) gpt2-base-french (0.124B) GPT-2 Spanish (0.124B) SmolLM2 135M Instruct (0.135B) Nomic Embed Text v1.5 (0.137B) GTE ModernBERT Base (0.149B) Dostoevsky Doesn't Write It GPT2 (0.175B) LFM2.5-230M (0.23B) Whisper Small (0.244B) Jina Reranker v2 Base Multilingual (0.278B) mxbai-embed-large-v1 (0.335B) BGE Large EN v1.5 (0.335B) F5-TTS (0.336B) GPT-2 Spanish Medium (0.355B) SmolLM2 360M Instruct (0.36B) SmolLM 2 360M Instruct (0.36B) VBART Large (Turkish Summarization) (0.4B) SigLIP SO400M (patch14-384) (0.428B) XTTS v2 (0.46B) Vikhr Qwen 2.5 0.5B Instruct (0.5B) Multilingual E5 Large Instruct (0.56B) Snowflake Arctic Embed L v2.0 (0.568B) BGE Reranker v2 M3 (0.57B) BGE M3 (0.57B) Jina Embeddings v3 (0.572B) Parakeet TDT 0.6B v2 (0.6B) Turkish GPT-2 Large (0.7B) Kanarya 750M (0.75B) Distil-Whisper Large v3 (0.756B) Florence-2 Large (0.77B) Whisper Large v3 Turbo (0.81B) TinyLlama 1.1B Chat v0.3 AWQ (1.1B) TinyLlama 1.1B Chat v0.3 GPTQ (1.1B) mGPT 1.3B Mongol (1.3B) mGPT 1.3B Uzbek (1.3B) mxbai-rerank-large-v2 (1.54B) Whisper Large v3 (1.55B) SmolLM 2 1.7B Instruct (1.7B) Moondream 2 (1.9B) Kanarya 2B (2B) SmolVLM Instruct (2.25B) Stable Diffusion 3.5 Medium (2.5B) SDXL Turbo (2.6B) StarCoder 2 3B (3B) Orpheus 3B 0.1 FT (3B) OpenELM 3B Instruct (3B) SmolLM 3 3B (3B) PhoGPT 4B Chat (3.7B) PhoGPT 4B (3.7B) Nemotron Mini 4B Instruct (4B) StarCoder 2 7B (7B) LLaVA-OneVision 7B (7B) OpenThaiGPT 1.5 7B Instruct (7B) LLaVA 1.6 Mistral 7B (7B) E5 Mistral 7B Instruct (7.11B) EXAONE 3.5 7.8B Instruct (7.8B) EXAONE Deep 7.8B (7.8B) NV-Embed v2 (7.85B) Molmo 7B-D (8B) Aya 23 8B (8B) Tulu 3 8B (8B) Typhoon S ThaiLLM 8B Instruct Research Preview (8B) Nemotron 3 Nano 9B (9B) NVIDIA Nemotron Nano 9B v2 Japanese (9B) Ornith 1.0 9B (9B) Stable LM 2 12B (12B) Merlyn Education Safety 12B AWQ (12B) FLUX.1 [dev] (12B) FLUX.1 [schnell] (12B) Mellum2 12B-A2.5B (12.15B) mGPT 13B (13B) StarCoder 2 15B (15B) GPT-OSS Swallow 20B RL v0.1 (20B) GPT-NeoX 20B (20B) GPT-OSS 20B (20.9B) InternVL 2.5 26B (26B) Nemotron 3 Nano (30B-A3B) (30B) North Mini Code 1.0 (30B) Sarvam 30B (30B) Omni 31B Turkish Reasoning (31B) EXAONE 3.5 32B Instruct AWQ (32B) Pollux Judge 32B (32B) OLMo 2 32B (32B) llm-jp 4 32B A3B Thinking (32B) EXAONE 3.5 32B Instruct (32B) Nemotron 3 Nano Omni 33B (33B) Laguna XS 2.1 (33B) Ornith 1.0 35B (35B) Mihenk LLM v2 35B (Turkish Financial) (35B) Aya 23 35B (35B) Nemotron 3 Super 49B (49B) Jamba 1.5 Mini (52B) Tulu 3 70B (70B) Molmo 72B (72B) InternVL 2.5 78B (78B) Sarvam 105B FP8 (105B) Sarvam 105B (105B) Nemotron 3 Super (120B-A12B) (120B) GLM-5 (200B) Jamba 1.5 Large (398B) MiniMax-M3 (428B) Nemotron 3 Ultra (550B-A55B) (550B) Ring-2.6-1T (1000B) Kimi K2.6 (1000B) LongCat-2.0 (1600B) Phi-3.5 Mini Instruct (3.8B) Phi-4 Reasoning Mini 4B (3.8B) Phi-4 Mini 4B (3.8B) Phi-3.5 Vision (4.2B) Phi-4 14B (14B) Phi-4 Reasoning 14B (14B) Phi-4 Multimodal (14B) Qwen 2.5 0.5B Instruct (0.5B) Qwen3 0.6B Hindi Instruct v1 GGUF (0.6B) Qwen 3 0.6B (0.6B) Qwen 2.5 1.5B Instruct (1.5B) Qwen 2.5 Coder 1.5B (1.5B) Qwen 3 1.7B (1.7B) Qwen 3.5 2B Turkish SFT (2B) Qwen2-VL 2B Instruct (2B) Qwen 2.5 3B Instruct (3B) Qwen 2.5 Coder 3B (3B) Qwen 2.5-VL 3B (3B) VibeThinker-3B (3B) Qwen 3 4B (4B) Qwen 3 7B (7B) Qwen 2.5 Math 7B (7B) Qwen 2.5 7B Instruct (7B) Qwen 2-VL 7B (7B) Qwen 2.5 Coder 7B Instruct (7B) Qwen 2.5-VL 7B (7B) CodeQwen 1.5 7B (7B) Qwen 3 Embedding 8B (8B) Qwen 3 8B (8B) Qwen3.5 9B Thai Law Base (8.95B) Qwen3.5 9B (9B) Qwen 2.5 Coder 14B Instruct (14B) Qwen 3 14B (14B) Qwen 2.5 14B Instruct (14B) Qwen3.5 27B (27B) Qwen 3.6 27B (MTP) (27B) Qwen3.6 27B (27B) Qwen3 Coder 30B-A3B (30B) Qwen 3 30B-A3B (30B) Qwen 3 32B (32B) Qwen3 Swallow 32B RL v0.2 (32B) Qwen 2.5 Coder 32B Instruct (32B) QwQ 32B Preview (32B) Qwen 3 Coder 32B (32B) Qwen 2.5 32B Instruct (32B) Qwen3.5 35B-A3B (35B) Qwen 3.6 35B-A3B (MTP) (35B) Qwen3.6 35B-A3B (35B) Qwen 2.5 72B Instruct (72B) Qwen 2.5-VL 72B (72B) Qwen 2.5 Math 72B (72B) Qwen 3 235B-A22B (235B) Qwen 3.5 235B-A17B (MoE) (397B) RWKV 7 'Goose' 1.5B (1.5B) GOT-OCR 2.0 (0.58B) Step-3 (1000B) WizardLM-2 8x22B (141B) Yi Coder 9B (9B) Yi 1.5 34B (34B)
⇄ Model B — pick a model — Baichuan 4 13B (13B) Command R7B (12-2024) (8B) Aya Expanse 32B (32B) Command R 35B (35B) Command R+ (Aug 2024) (104B) Command R+ 104B (104B) DBRX Instruct (132B) DBRX Base (132B) DeepSeek R1 Distill Qwen 1.5B (1.5B) DeepSeek R1 Distill Qwen 7B (7B) DeepSeek R1 Distill Llama 8B (8B) DeepSeek R1 Distill Qwen 14B (14B) DeepSeek V2 Lite Chat (15.7B) DeepSeek MoE 16B Base (16B) DeepSeek V3 Lite (16B MoE) (16B) DeepSeek Coder V2 Lite (16B) (16B) DeepSeek R1 Distill Mistral 24B (24B) DeepSeek R1 Distill Qwen 32B (32B) DeepSeek R1 Distill Qwen 3 32B (32B) DeepSeek Coder V3 (33B) DeepSeek R1 Distill Llama 70B (70B) DeepSeek Coder V2 236B (236B) DeepSeek V2.5 236B (236B) DeepSeek V4 Flash (284B MoE) (284B) DeepSeek R1 (671B reasoning) (671B) DeepSeek V3 (671B MoE) (671B) DeepSeek V4 (745B) DeepSeek V4 Pro (1.6T MoE) (1600B) Dolphin 3.0 Llama 3.2 3B (3B) Dolphin 3.0 8B (8B) Dolphin 3.0 Mistral 24B (24B) Dolphin 3 Llama 3.3 70B (70B) EXAONE 3.5 2.4B Instruct (2.4B) EXAONE 3.5 2.4B (2.4B) EXAONE 3.5 8B (7.8B) EXAONE 3.5 32B (32B) EXAONE 4.0.1 32B (32B) K-EXAONE 236B A23B (236B) Falcon 3 3B Instruct (3B) Falcon 3 7B Instruct (7B) Falcon Mamba 7B (7B) Falcon 3 10B (10B) Falcon 40B Instruct (40B) Gemma 3 270M (0.27B) Gemma 3 1B (1B) Gemma 4 E2B (Effective 2B) (2B) Gemma 2 2B Instruct (2B) PaliGemma 2 3B (3B) ColPali v1.3 (3B) Gemma 4 E4B (Effective 4B) (4B) Gemma 3 4B (4B) CodeGemma 7B (7B) Gemma 2 9B Instruct (9B) Turkish Gemma 9B T1 (9B) YTU Turkish Gemma 9B v0.1 (9.2B) PaliGemma 2 10B (10B) Trendyol LLM Asure 12B (11.8B) Gemma 4 12B (12B) Gemma 3 12B (12B) Gemma 4 Turkish 26B (4B active) (26B) Gemma 4 26B MoE (26B) Gemma 4 26B-A4B (26B) MedGemma 27B (27B) Gemma 3 27B (27B) Gemma 4 31B Dense (31B) GLM-4 9B (9B) GLM-4V 9B (13.9B) GLM-4.7-Flash (31B) GLM-5 Pro (144B) GLM-5.2 (753B) Granite 3.0 2B Instruct (2B) Granite 3.1 2B Instruct (2B) Granite 4.1 3B Instruct (3.4B) Granite 3.0 8B Instruct (8B) Granite 3.2 8B (8B) Granite 3.3 8B (8B) Granite 4.1 8B Instruct (8.79B) Granite 3 MoE (3B active) (16B) Granite 4.1 30B Instruct (28.87B) Granite 4.1 30B (30B) Hermes 3 Llama 3.2 3B (3B) Hermes 3 Llama 3.1 8B (8B) Hermes 4 Llama 3.3 70B (70B) Hermes 3 Llama 3.1 70B (70B) Hunyuan 3.0 (Hy3) (295B) Hunyuan Large 389B MoE (389B) InternLM 2.5 7B Chat (7B) InternLM 3 8B (8B) Janus-Pro 7B (7B) Llama 3.2 1B Instruct (1B) TinyLlama 1.1B Chat v1.0 (1.1B) Salamandra 2B Instruct (2B) Salamandra 2B (2.25B) Llama 3.2 3B Instruct (3B) Salamandra 7B Instruct (7B) Swallow 7B (7B) Salamandra 7B (7B) Trendyol LLM 7B Chat v0.1 (7B) OpenThaiGPT 7B 1.0.0 Chat (7B) Trendyol LLM 7B Base v0.1 (7B) Cosmos Llama 3 8B Turkish (8B) Llama 3.1 8B Instruct (8B) RefinedNeuro RN TR R2 (8B) RefinedNeuro RN TR R1 (8B) Saiga Llama3 8B GGUF (8B) Llama 3.3 8B Instruct (8B) LLM-jp 4 8B Thinking (8B) LLM-jp 4 8B Instruct (8B) Gervásio 8B PTPT (8B) Turkish Llama 8B Instruct v0.1 (8B) Llama 3.1 Nemotron Nano 8B (8B) SOLAR 10.7B v1.0 (10.7B) Llama 3.2 11B Vision (11B) Bielik 11B v3.0 Instruct GGUF (11B) Llama 3.2 11B Vision Instruct (11B) Bielik-11B v3.0 Instruct FP8 Dynamic (11B) OpenThaiGPT 1.0.0 Beta 13B Chat (13B) Phind CodeLlama 34B v2 (34B) ALIA 40b instruct 2601 (40B) Llama 3.1 70B Instruct (70B) Hermes 4 70B FP8 (70B) Llama 4 70B (70B) Llama 3.1 Nemotron 70B Instruct (70B) EVA Llama 3.3 70B (70B) Llama 3.3 70B Instruct (70B) Llama 3.2 90B Vision Instruct (90B) Llama 3.2 90B Vision (90B) Llama 4 Scout (109B) Llama 3.1 Nemotron Ultra 253B (253B) Llama 4 Maverick (400B) Llama 4 405B (405B) MiniCPM 3 4B (4B) MiniCPM-V 2.6 8B (8B) MiniCPM-V 3 8B (8B) Kumru 2B (2.4B) Ministral 3B Instruct (3B) Mistral 7B Instruct v0.1 (7B) Mistral 7B OpenOrca GGUF (7B) Bielik 7B Instruct v0.1 GGUF (7B) Mistral 7B Instruct v0.3 (7B) Bielik 7B v0.1 (7B) Mistral 7B Instruct v0.2 (7B) Mistral 7B Instruct v0.2 (7B) Turkish Mistral 7B Instruct v0.2 (7B) Japanese StableLM Instruct Gamma 7B (7B) Codestral Mamba 7B (7B) Mistral Turkish v2 (brooqs) (7.2B) Malhajar Mistral 7B Turkish (7.2B) Turkcell LLM 7B v1 (7.4B) Ministral 8B Instruct (8B) Bielik 11B v2.3 Instruct (11B) Bielik 11B v2.2 Instruct GGUF (11B) Bielik 11B v2.3 Instruct (11B) Mistral Nemo 12B Instruct (12B) Pixtral 12B (12B) Ministral 3 14B (14B) Codestral 22B (22B) Mistral Medium 3 24B (dense) (24B) Devstral Small 2 24B (24B) Sarvam M (24B) Mistral Small 3.2 24B (24B) Mistral Small 3 24B (24B) Mistral Saba 24B (24B) Magistral 32B (32B) Mistral Large 2 (123B) (123B) Mistral Medium 3.5 (675B MoE) (675B) Mixtral 8X7B Instruct v0.1 GPTQ (46.7B) Mixtral 8x7B Instruct (47B) Mixtral 8x22B Instruct (141B) Kimi K1.5 (200B) Kimi K2.7-Code (1000B) OLMo 2 1B Instruct (1B) OLMo 2 13B (13B) OpenBioLLM Llama 3 70B (70B) OpenCoder 8B (8B) all-MiniLM-L6-v2 (0.022B) Piper (0.025B) Whisper Tiny (0.039B) Whisper Base (0.074B) Kokoro 82M (0.082B) all-mpnet-base-v2 (0.109B) paraphrase-multilingual-MiniLM-L12-v2 (0.118B) gpt2-base-french (0.124B) GPT-2 Spanish (0.124B) SmolLM2 135M Instruct (0.135B) Nomic Embed Text v1.5 (0.137B) GTE ModernBERT Base (0.149B) Dostoevsky Doesn't Write It GPT2 (0.175B) LFM2.5-230M (0.23B) Whisper Small (0.244B) Jina Reranker v2 Base Multilingual (0.278B) mxbai-embed-large-v1 (0.335B) BGE Large EN v1.5 (0.335B) F5-TTS (0.336B) GPT-2 Spanish Medium (0.355B) SmolLM2 360M Instruct (0.36B) SmolLM 2 360M Instruct (0.36B) VBART Large (Turkish Summarization) (0.4B) SigLIP SO400M (patch14-384) (0.428B) XTTS v2 (0.46B) Vikhr Qwen 2.5 0.5B Instruct (0.5B) Multilingual E5 Large Instruct (0.56B) Snowflake Arctic Embed L v2.0 (0.568B) BGE Reranker v2 M3 (0.57B) BGE M3 (0.57B) Jina Embeddings v3 (0.572B) Parakeet TDT 0.6B v2 (0.6B) Turkish GPT-2 Large (0.7B) Kanarya 750M (0.75B) Distil-Whisper Large v3 (0.756B) Florence-2 Large (0.77B) Whisper Large v3 Turbo (0.81B) TinyLlama 1.1B Chat v0.3 AWQ (1.1B) TinyLlama 1.1B Chat v0.3 GPTQ (1.1B) mGPT 1.3B Mongol (1.3B) mGPT 1.3B Uzbek (1.3B) mxbai-rerank-large-v2 (1.54B) Whisper Large v3 (1.55B) SmolLM 2 1.7B Instruct (1.7B) Moondream 2 (1.9B) Kanarya 2B (2B) SmolVLM Instruct (2.25B) Stable Diffusion 3.5 Medium (2.5B) SDXL Turbo (2.6B) StarCoder 2 3B (3B) Orpheus 3B 0.1 FT (3B) OpenELM 3B Instruct (3B) SmolLM 3 3B (3B) PhoGPT 4B Chat (3.7B) PhoGPT 4B (3.7B) Nemotron Mini 4B Instruct (4B) StarCoder 2 7B (7B) LLaVA-OneVision 7B (7B) OpenThaiGPT 1.5 7B Instruct (7B) LLaVA 1.6 Mistral 7B (7B) E5 Mistral 7B Instruct (7.11B) EXAONE 3.5 7.8B Instruct (7.8B) EXAONE Deep 7.8B (7.8B) NV-Embed v2 (7.85B) Molmo 7B-D (8B) Aya 23 8B (8B) Tulu 3 8B (8B) Typhoon S ThaiLLM 8B Instruct Research Preview (8B) Nemotron 3 Nano 9B (9B) NVIDIA Nemotron Nano 9B v2 Japanese (9B) Ornith 1.0 9B (9B) Stable LM 2 12B (12B) Merlyn Education Safety 12B AWQ (12B) FLUX.1 [dev] (12B) FLUX.1 [schnell] (12B) Mellum2 12B-A2.5B (12.15B) mGPT 13B (13B) StarCoder 2 15B (15B) GPT-OSS Swallow 20B RL v0.1 (20B) GPT-NeoX 20B (20B) GPT-OSS 20B (20.9B) InternVL 2.5 26B (26B) Nemotron 3 Nano (30B-A3B) (30B) North Mini Code 1.0 (30B) Sarvam 30B (30B) Omni 31B Turkish Reasoning (31B) EXAONE 3.5 32B Instruct AWQ (32B) Pollux Judge 32B (32B) OLMo 2 32B (32B) llm-jp 4 32B A3B Thinking (32B) EXAONE 3.5 32B Instruct (32B) Nemotron 3 Nano Omni 33B (33B) Laguna XS 2.1 (33B) Ornith 1.0 35B (35B) Mihenk LLM v2 35B (Turkish Financial) (35B) Aya 23 35B (35B) Nemotron 3 Super 49B (49B) Jamba 1.5 Mini (52B) Tulu 3 70B (70B) Molmo 72B (72B) InternVL 2.5 78B (78B) Sarvam 105B FP8 (105B) Sarvam 105B (105B) Nemotron 3 Super (120B-A12B) (120B) GLM-5 (200B) Jamba 1.5 Large (398B) MiniMax-M3 (428B) Nemotron 3 Ultra (550B-A55B) (550B) Ring-2.6-1T (1000B) Kimi K2.6 (1000B) LongCat-2.0 (1600B) Phi-3.5 Mini Instruct (3.8B) Phi-4 Reasoning Mini 4B (3.8B) Phi-4 Mini 4B (3.8B) Phi-3.5 Vision (4.2B) Phi-4 14B (14B) Phi-4 Reasoning 14B (14B) Phi-4 Multimodal (14B) Qwen 2.5 0.5B Instruct (0.5B) Qwen3 0.6B Hindi Instruct v1 GGUF (0.6B) Qwen 3 0.6B (0.6B) Qwen 2.5 1.5B Instruct (1.5B) Qwen 2.5 Coder 1.5B (1.5B) Qwen 3 1.7B (1.7B) Qwen 3.5 2B Turkish SFT (2B) Qwen2-VL 2B Instruct (2B) Qwen 2.5 3B Instruct (3B) Qwen 2.5 Coder 3B (3B) Qwen 2.5-VL 3B (3B) VibeThinker-3B (3B) Qwen 3 4B (4B) Qwen 3 7B (7B) Qwen 2.5 Math 7B (7B) Qwen 2.5 7B Instruct (7B) Qwen 2-VL 7B (7B) Qwen 2.5 Coder 7B Instruct (7B) Qwen 2.5-VL 7B (7B) CodeQwen 1.5 7B (7B) Qwen 3 Embedding 8B (8B) Qwen 3 8B (8B) Qwen3.5 9B Thai Law Base (8.95B) Qwen3.5 9B (9B) Qwen 2.5 Coder 14B Instruct (14B) Qwen 3 14B (14B) Qwen 2.5 14B Instruct (14B) Qwen3.5 27B (27B) Qwen 3.6 27B (MTP) (27B) Qwen3.6 27B (27B) Qwen3 Coder 30B-A3B (30B) Qwen 3 30B-A3B (30B) Qwen 3 32B (32B) Qwen3 Swallow 32B RL v0.2 (32B) Qwen 2.5 Coder 32B Instruct (32B) QwQ 32B Preview (32B) Qwen 3 Coder 32B (32B) Qwen 2.5 32B Instruct (32B) Qwen3.5 35B-A3B (35B) Qwen 3.6 35B-A3B (MTP) (35B) Qwen3.6 35B-A3B (35B) Qwen 2.5 72B Instruct (72B) Qwen 2.5-VL 72B (72B) Qwen 2.5 Math 72B (72B) Qwen 3 235B-A22B (235B) Qwen 3.5 235B-A17B (MoE) (397B) RWKV 7 'Goose' 1.5B (1.5B) GOT-OCR 2.0 (0.58B) Step-3 (1000B) WizardLM-2 8x22B (141B) Yi Coder 9B (9B) Yi 1.5 34B (34B)
Your hardware (optional, biases the verdict) — don't bias — NVIDIA GB200 NVL72 (13824 GB) AMD Instinct MI350X (288 GB) AMD Instinct MI355X (288 GB) NVIDIA B300 (Blackwell Ultra) (288 GB) AMD Instinct MI325X (256 GB) AMD Instinct MI300X (192 GB) NVIDIA B200 (192 GB) NVIDIA H100 NVL (188 GB) NVIDIA H200 (141 GB) NVIDIA H200 NVL (PCIe) (141 GB) AMD Instinct MI250X (128 GB) AMD Instinct MI300A (APU) (128 GB) Intel Gaudi 3 (128 GB) Intel Gaudi 2 (96 GB) NVIDIA H20 (96GB) (96 GB) NVIDIA RTX PRO 6000 Blackwell (96 GB) NVIDIA A100 80GB SXM (80 GB) NVIDIA H100 PCIe (80 GB) NVIDIA H100 SXM (80 GB) AMD Instinct MI210 (64 GB) NVIDIA A40 (48 GB) NVIDIA L40 (48 GB) NVIDIA L40S (48 GB) NVIDIA RTX 4090 48GB (China-mod) (48 GB) NVIDIA RTX 5000 PRO Blackwell 48GB (48 GB) NVIDIA RTX 6000 Ada Generation (48 GB) NVIDIA RTX A6000 (Ampere) (48 GB) NVIDIA A100 40GB (40 GB) NVIDIA GeForce RTX 5090 (32 GB) NVIDIA RTX 5000 Ada Generation (32 GB) NVIDIA RTX PRO 4500 Blackwell (32 GB) AMD Radeon RX 7900 XTX (24 GB) ASUS ROG Strix Scar 18 (RTX 5090 Mobile) (24 GB) Intel Arc Pro B60 24GB (24 GB) NVIDIA GeForce RTX 3090 (24 GB) NVIDIA GeForce RTX 3090 Ti (24 GB) NVIDIA GeForce RTX 4090 (24 GB) NVIDIA GeForce RTX 5090 Mobile (24 GB) NVIDIA L4 (24 GB) NVIDIA RTX A5000 (24 GB)
Use case Chat / daily driver Coding agents Reasoning + math Agentic loops RAG + long context Creative writing Multimodal / vision
Verdict for chat Weighted: 0% (Qwen 3 30B-A3B) vs 0% (Qwen 3 32B)
Neither model is the clear better fit for chat. They split the 10 dimensions roughly evenly (0 for Qwen 3 30B-A3B, 0 for Qwen 3 32B, 10 ties). The pick is contextual — check the per-row notes, and remember that "better for this use case" isn't "better overall."
WILL IT RUN — HARDWARE FIT
For each common hardware tier, the best-fitting quant for each model + predicted decode tok/s. ✓ comfortable, ~ tight, ✗ doesn't fit. tok/s extrapolated from bandwidth × active-footprint — measure on your stack.
Hardware tier Qwen 3 30B-A3B Qwen 3 32B Verdict RTX 3060 12 GB budget consumer · 360 GB/s
✗ doesn't fit ✗ doesn't fit Neither RTX 4060 Ti 16 GB consumer 16 GB · 288 GB/s
✗ doesn't fit ✗ doesn't fit Neither RTX 3090 24 GB used flagship · 936 GB/s
~ Q5_K_M ~23 GB · 27 tok/s est.
~ Q4_K_M ~22 GB · 29 tok/s est.
Both fit RTX 4090 24 GB consumer flagship · 1008 GB/s
~ Q5_K_M ~23 GB · 29 tok/s est.
~ Q4_K_M ~22 GB · 31 tok/s est.
Both fit RTX 5090 32 GB next-gen flagship · 1792 GB/s
✓ Q4_K_M ~21 GB · 59 tok/s est.
✓ Q4_K_M ~22 GB · 56 tok/s est.
Both fit RTX PRO 6000 Blackwell 96 GB workstation · 1792 GB/s
✓ Q8_0 ~35 GB · 34 tok/s est.
✓ Q8_0 ~37 GB · 32 tok/s est.
Both fit Mac Studio M4 Max 128 GB apple unified · 546 GB/s
✓ Q8_0 ~35 GB · 12 tok/s est.
✓ Q8_0 ~37 GB · 11 tok/s est.
Both fit Mac Studio M3 Ultra 192 GB apple unified flagship · 800 GB/s
✓ Q8_0 ~35 GB · 18 tok/s est.
✓ Q8_0 ~37 GB · 16 tok/s est.
Both fit
✓ Comfortable (≥30% headroom)~ Tight (fits, <30% headroom)✗ Doesn't fit