SOTAVerified

Quantization

Quantization is a promising technique to reduce the computation cost of neural network training, which can replace high-cost floating-point numbers (e.g., float32) with low-cost fixed-point numbers (e.g., int8/int16).

Source: Adaptive Precision Training: Quantify Back Propagation in Neural Networks with Fixed-point Numbers

Papers

Showing 51–100 of 4925 papers

TitleStatusHype
Relative Entropy Regularized Reinforcement Learning for Efficient Encrypted Policy Synthesis—0
FIMA-Q: Post-Training Quantization for Vision Transformers by Fisher Information Matrix ApproximationCode1
Deep Learning Model Acceleration and Optimization Strategies for Real-Time Recommendation Systems—0
GPLQ: A General, Practical, and Lightning QAT Method for Vision Transformers—0
Starting Positions Matter: A Study on Better Weight Initialization for Neural Network Quantization—0
Post-Training Quantization for Video Matting—0
MNN-LLM: A Generic Inference Engine for Fast Large Language Model Deployment on Mobile Devices—0
Discrete Audio Tokens: More Than a Survey!—0
SLED: A Speculative LLM Decoding Framework for Efficient Edge Serving—0
Q-SAM2: Accurate Quantization for Segment Anything Model 2—0
HadaNorm: Diffusion Transformer Quantization through Mean-Centered Transformations—0
AWP: Activation-Aware Weight Pruning and Quantization with Projected Gradient Descent—0
Hardware Limitations and Optimization Approach in 1-Bit RIS Design at 28 GHz—0
Implementing Keyword Spotting on the MCUX947 Microcontroller with Integrated NPU—0
POLARON: Precision-aware On-device Learning and Adaptive Runtime-cONfigurable AI acceleration—0
Optimizing Learned Image Compression on Scalar and Entropy-Constraint Quantization—0
Decentralized Optimization on Compact Submanifolds by Quantized Riemannian Gradient Tracking—0
BitVLA: 1-bit Vision-Language-Action Models for Robotics ManipulationCode2
Evaluating Large Language Models on the Frame and Symbol Grounding Problems: A Zero-shot BenchmarkCode0
LiteVLM: A Low-Latency Vision-Language Model Inference Pipeline for Resource-Constrained Environments—0
Highly Compressed Tokenizer Can Generate Without TrainingCode3
Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test—0
QForce-RL: Quantized FPGA-Optimized Reinforcement Learning Compute Engine—0
Enabling On-Device Medical AI Assistants via Input-Driven Saliency Adaptation—0
Towards AI-Native Fronthaul: Neural Compression for NextG Cloud RAN—0
Bridging the Modality Gap: Softly Discretizing Audio Representation for LLM-based Automatic Speech Recognition—0
EdgeProfiler: A Fast Profiling Framework for Lightweight LLMs on Edge Using Analytical ModelCode0
RecGPT: A Foundation Model for Sequential RecommendationCode2
BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning—0
PCDVQ: Enhancing Vector Quantization for Large Language Models via Polar Coordinate Decoupling—0
Massive MIMO with 1-Bit DACs: Data Detection for Quantized Linear Precoding with Dithering—0
Kernel k-Medoids as General Vector Quantization—0
FPTQuant: Function-Preserving Transforms for LLM Quantization—0
TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering—0
FPSAttention: Training-Aware FP8 and Sparsity Co-Design for Fast Video Diffusion—0
Nonlinear Sparse Bayesian Learning Methods with Application to Massive MIMO Channel Estimation with Hardware Impairments—0
BitTTS: Highly Compact Text-to-Speech Using 1.58-bit Quantization and Weight Indexing—0
STAR: Learning Diverse Robot Skill Abstractions through Rotation-Augmented Vector QuantizationCode0
MUC-G4: Minimal Unsat Core-Guided Incremental Verification for Deep Neural Network Compression—0
Quantized Dissipative Uncertain Model for Fractional T_S Fuzzy systems with Time_Varying Delays Under Networked Control System—0
Enhancing Convergence, Privacy and Fairness for Wireless Personalized Federated Learning: Quantization-Assisted Min-Max Fair Scheduling—0
Flexible Mixed Precision Quantization for Learned Image CompressionCode0
Structured Pruning and Quantization for Learned Image CompressionCode0
Quantitative Error Feedback for Quantization Noise Reduction of Filtering over Graphs—0
Parameter Efficient Fine Tuning Llama 3.1 for Answering Arabic Legal Questions: A Case Study on Jordanian LawsCode0
Enhancing Speech Emotion Recognition with Graph-Based Multimodal Fusion and Prosodic Features for the Speech Emotion Recognition in Naturalistic Conditions Challenge at Interspeech 2025—0
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer—0
Quantization-based Bounds on the Wasserstein Metric—0
Power-of-Two (PoT) Weights in Large Language Models (LLMs)—0
LittleBit: Ultra Low-Bit Quantization via Latent Factorization—0
Show:102550
← PrevPage 2 of 99Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1FQ-ViT (ViT-L)Top-1 Accuracy (%)85.03—Unverified
2FQ-ViT (ViT-B)Top-1 Accuracy (%)83.31—Unverified
3FQ-ViT (Swin-B)Top-1 Accuracy (%)82.97—Unverified
4FQ-ViT (Swin-S)Top-1 Accuracy (%)82.71—Unverified
5FQ-ViT (DeiT-B)Top-1 Accuracy (%)81.2—Unverified
6FQ-ViT (Swin-T)Top-1 Accuracy (%)80.51—Unverified
7FQ-ViT (DeiT-S)Top-1 Accuracy (%)79.17—Unverified
8Xception W8A8Top-1 Accuracy (%)78.97—Unverified
9ADLIK-MO-ResNet50-W4A4Top-1 Accuracy (%)77.88—Unverified
10ADLIK-MO-ResNet50-W3A4Top-1 Accuracy (%)77.34—Unverified
#ModelMetricClaimedVerifiedStatus
13DCNN_VIVA_3MAP160,327.04—Unverified
2DTQMAP0.79—Unverified
#ModelMetricClaimedVerifiedStatus
1OutEffHop-Bert_basePerplexity6.3—Unverified
2OutEffHop-Bert_basePerplexity6.21—Unverified
#ModelMetricClaimedVerifiedStatus
1Accuracy98.13—Unverified
#ModelMetricClaimedVerifiedStatus
1Accuracy92.92—Unverified
#ModelMetricClaimedVerifiedStatus
1SSD ResNet50 V1 FPN 640x640MAP34.3—Unverified
#ModelMetricClaimedVerifiedStatus
1TAR @ FAR=1e-495.13—Unverified
#ModelMetricClaimedVerifiedStatus
1TAR @ FAR=1e-496.38—Unverified
#ModelMetricClaimedVerifiedStatus
13DCNN_VIVA_5All84,809,664—Unverified
#ModelMetricClaimedVerifiedStatus
1Accuracy99.8—Unverified