lyogavin/airllm
⭐ 27.1K (+1.1K)
AirLLM is an engineering-focused inference toolkit that optimizes VRAM and disk-loading to make large language models usable on resource-constrained single GPUs or desktops, suited for teams needing local deployment and fast experimentation.