GPU compatibility

What LLMs can run on 24 GB VRAM homelab workstation?

Heavy local models and homelab inference. Examples: RTX 3090, RTX 4090.

Open calculator with this GPU preset

Clean local fits23
Offload / slower10
Too large4
Planning capacity22.5 GB usable VRAM

Recommended route: local-first

This preset has enough clean Q4 headroom for most curated local models in this dataset.

Use locally forcoding assistants, chat, routing, agents, and larger 14B-32B class models depending on context length.
Watch out forvery large models, long context windows, and parallel workloads can still exceed practical memory.
Fallback triggerUse cloud/API when you need 70B+ models, long context, or reliable multi-user throughput.
Green

23 models fit inside the clean planning capacity.

Yellow

10 models can run with RAM/offload tradeoffs.

Red

Examples to avoid locally: gpt-oss 120B, gpt-oss-safeguard 120B, Devstral 2 123B.

Best clean fits

Start here for responsive local inference.
23 models

Possible with offload

Use only when slower generation and tighter settings are acceptable.
10 models

Full Q4 model fit table

ModelSizeQ4 needStatusCalculator
Qwen3 4B Thinking 25074.02B3.2 GBRuns locallyOpen calculator
Gemma 3 4B4B3.5 GBRuns locallyOpen calculator
Qwen2.5 Coder 7B7B5.5 GBRuns locallyOpen calculator
Mistral 7B7B5.5 GBRuns locallyOpen calculator
Llama 3.1 8B Instruct8B6 GBRuns locallyOpen calculator
Qwen3 8B8B6 GBRuns locallyOpen calculator
DeepSeek-R1-0528-Qwen3-8B8B6 GBRuns locallyOpen calculator
Qwen3-VL 8B Instruct8B6.5 GBRuns locallyOpen calculator
Qwen3.5 9B9B6.6 GBRuns locallyOpen calculator
Gemma 3 12B12B9 GBRuns locallyOpen calculator
Gemma 4 E4B4B9.6 GBRuns locallyOpen calculator
Qwen2.5 Coder 14B14B10.5 GBRuns locallyOpen calculator
DeepSeek R1 Distill Qwen 14B14B10.5 GBRuns locallyOpen calculator
Phi-4 14B14B10.5 GBRuns locallyOpen calculator
gpt-oss 20B20B14 GBRuns locallyOpen calculator
gpt-oss-safeguard 20B21B14 GBRuns locallyOpen calculator
Devstral Small 2 24B24B15 GBRuns locallyOpen calculator
Qwen3.5 27B27B17 GBRuns locallyOpen calculator
Qwen3.6 27B27B17 GBRuns locallyOpen calculator
Gemma 3 27B27B18 GBRuns locallyOpen calculator
Qwen3 30B-A3B Instruct 250730.5B19 GBRuns locallyOpen calculator
Qwen3-Coder 30B-A3B30B19 GBRuns locallyOpen calculator
GLM-4.7-Flash30B19 GBRuns locallyOpen calculator
Gemma 4 31B31B20 GBRAM offloadOpen calculator
Qwen3-VL 30B-A3B Instruct30B20 GBRAM offloadOpen calculator
Qwen2.5 Coder 32B32B21 GBRAM offloadOpen calculator
DeepSeek R1 Distill Qwen 32B32B21 GBRAM offloadOpen calculator
Qwen3.8 27B27B22 GBRAM offloadOpen calculator
Qwen3.6 35B-A3B35B24 GBRAM offloadOpen calculator
Mixtral 8x7B46.7B28 GBRAM offloadOpen calculator
Llama 3.1 70B Instruct70B44 GBRAM offloadOpen calculator
Qwen3-Next 80B-A3B Instruct80B50 GBRAM offloadOpen calculator
Qwen3-Coder-Next80B52 GBRAM offloadOpen calculator
gpt-oss 120B120B65 GBToo largeOpen calculator
gpt-oss-safeguard 120B117B65 GBToo largeOpen calculator
Devstral 2 123B123B75 GBToo largeOpen calculator
GLM-5.2744B466 GBToo largeOpen calculator