LLM VRAM Calculator
Estimate model weights, KV cache, runtime overhead, and GPU count for inference.
- Useful for
- Sizing a local server, inference node, or GPU request
- Inputs
- Architecture, precision, context, concurrency, GPU memory
- Output
- GiB required and minimum GPU count