-
Updated
Aug 11, 2026 - Python
#
weight-compression
Here are 3 public repositories matching this topic...
open-source machine-learning deep-learning transformers pytorch quantization frequency-domain gemma frequency-analysis model-compression low-rank-approximation neural-network-compression huggingface large-language-models llm safetensors vision-language-model multimodal-ai gemma-3 weight-compression
Post-training weight compression for low-RAM machines: Q4/Q8 quantization, green-format repair, AVX2 CPU inference, optional CUDA. ~45% less RAM at ~99.9% quality.
rust inference simd transformer neural-networks avx2 quantization int8 model-compression memory-optimization model-quantization post-training-quantization cpu-inference int4 llm gguf green-compression weight-compression low-memory-inference greencompress
-
Updated
Jul 31, 2026 - Rust
A deterministic, random-access archive format and toolkit for compressing, storing, diffing and patching large language model weights.
rust machine-learning inference llama quantization model-compression model-weights tensor-compression huggingface llm safetensors gguf llm-compression model-distribution weight-compression
-
Updated
May 27, 2026 - Rust
Improve this page
Add a description, image, and links to the weight-compression topic page so that developers can more easily learn about it.
Add this topic to your repo
To associate your repository with the weight-compression topic, visit your repo's landing page and select "manage topics."