#quantization

Wiki 9

Toolbox 2

  • CrofAI Cheap hosted inference for open-weights models, unusual for publishing each model's quantization
  • ik_llama.cpp ikawrakow's llama.cpp fork with IQK quants, Q6 KV cache and faster long-context prompt processing