Quantization

Quantization is a promising technique to reduce the computation cost of neural network training, which can replace high-cost floating-point numbers (e.g., float32) with low-cost fixed-point numbers (e.g., int8/int16).

Source: Adaptive Precision Training: Quantify Back Propagation in Neural Networks with Fixed-point Numbers

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 226–250 of 4925 papers

Title	Date	Tasks	Status	Hype
Harmonizing Visual Representations for Unified Multimodal Understanding and Generation	Mar 27, 2025	Image GenerationQuantization	CodeCode Available	2
Atom: Low-bit Quantization for Efficient and Accurate LLM Serving	Oct 29, 2023	GPUQuantization	CodeCode Available	2
HAQ: Hardware-Aware Automated Quantization with Mixed Precision	Nov 21, 2018	QuantizationReinforcement Learning	CodeCode Available	2
GuidedQuant: Large Language Model Quantization via Exploiting End Loss Guidance	May 11, 2025	Language ModelingLanguage Modelling	CodeCode Available	2
Scaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%	Jun 17, 2024	image-classificationImage Classification	CodeCode Available	2
A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image Generation	Oct 2, 2024	Image GenerationQuantization	CodeCode Available	2
hls4ml: An Open-Source Codesign Workflow to Empower Scientific Low-Power Machine Learning Devices	Mar 9, 2021	BIG-bench Machine LearningDiagnostic	CodeCode Available	2
Similarity search in the blink of an eye with compressed indices	Apr 7, 2023	Quantization	CodeCode Available	2
SimLayerKV: A Simple Framework for Layer-Level KV Cache Reduction	Oct 17, 2024	Quantization	CodeCode Available	2
I-ViT: Integer-only Quantization for Efficient Vision Transformer Inference	Jul 4, 2022	Quantization	CodeCode Available	2
GENIUS: A Generative Framework for Universal Multimodal Search	Mar 25, 2025	Information RetrievalQuantization	CodeCode Available	2
GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM	Mar 8, 2024	Quantization	CodeCode Available	2
Spectra: Surprising Effectiveness of Pretraining Ternary Language Models at Scale	Jul 17, 2024	GPULAMBADA	CodeCode Available	2
GLARE: Low Light Image Enhancement via Generative Latent Feature based Codebook Retrieval	Jul 17, 2024	DecoderImage Enhancement	CodeCode Available	2
From Tiny Machine Learning to Tiny Deep Learning: A Survey	Jun 21, 2025	AutoMLModel Optimization	CodeCode Available	2
GaussianToken: An Effective Image Tokenizer with 2D Gaussian Splatting	Jan 26, 2025	Quantization	CodeCode Available	2
FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching	May 26, 2025	QuantizationSpeech Enhancement	CodeCode Available	2
any4: Learned 4-bit Numeric Representation for LLMs	Jul 7, 2025	GPUGSM8K	CodeCode Available	2
Any-Precision LLM: Low-Cost Deployment of Multiple, Different-Sized LLMs	Feb 16, 2024	Quantization	CodeCode Available	2
Accurate LoRA-Finetuning Quantization of LLMs via Information Retention	Feb 8, 2024	MMLUQuantization	CodeCode Available	2
Efficient LLM Inference on CPUs	Nov 1, 2023	Quantization	CodeCode Available	2
An Empirical Study of Qwen3 Quantization	May 4, 2025	Natural Language UnderstandingQuantization	CodeCode Available	2
SymphonyQG: Towards Symphonious Integration of Quantization and Graph for Approximate Nearest Neighbor Search	Nov 19, 2024	QuantizationRe-Ranking	CodeCode Available	2
Efficient Video Face Enhancement with Enhanced Spatial-Temporal Consistency	Nov 25, 2024	QuantizationVideo Restoration	CodeCode Available	2
FBGEMM: Enabling High-Performance Low-Precision Deep Learning Inference	Jan 13, 2021	Code GenerationDeep Learning	CodeCode Available	2

Show:10 25 50

← PrevPage 10 of 197Next →

All datasets ImageNet CIFAR-10 Wiki-40B AgeDB-30 CFP-FP COCO (Common Objects in Context)IJB-B IJB-C Knowledge-based:LFW

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	FQ-ViT (ViT-L)	Top-1 Accuracy (%)	85.03	—	Unverified
2	FQ-ViT (ViT-B)	Top-1 Accuracy (%)	83.31	—	Unverified
3	FQ-ViT (Swin-B)	Top-1 Accuracy (%)	82.97	—	Unverified
4	FQ-ViT (Swin-S)	Top-1 Accuracy (%)	82.71	—	Unverified
5	FQ-ViT (DeiT-B)	Top-1 Accuracy (%)	81.2	—	Unverified
6	FQ-ViT (Swin-T)	Top-1 Accuracy (%)	80.51	—	Unverified
7	FQ-ViT (DeiT-S)	Top-1 Accuracy (%)	79.17	—	Unverified
8	Xception W8A8	Top-1 Accuracy (%)	78.97	—	Unverified
9	ADLIK-MO-ResNet50-W4A4	Top-1 Accuracy (%)	77.88	—	Unverified
10	ADLIK-MO-ResNet50-W3A4	Top-1 Accuracy (%)	77.34	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	3DCNN_VIVA_3	MAP	160,327.04	—	Unverified
2	DTQ	MAP	0.79	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	OutEffHop-Bert_base	Perplexity	6.3	—	Unverified
2	OutEffHop-Bert_base	Perplexity	6.21	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1		Accuracy	98.13	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1		Accuracy	92.92	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SSD ResNet50 V1 FPN 640x640	MAP	34.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1		TAR @ FAR=1e-4	95.13	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1		TAR @ FAR=1e-4	96.38	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	3DCNN_VIVA_5	All	84,809,664	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1		Accuracy	99.8	—	Unverified