Final Year Research & Engineering Project — A hardware-aware compression pipeline that profiles layer-by-layer CPU execution metrics. It balances model perplexity against physical latency, eliminates microarchitectural overhead, and compiles optimized mixed-precision graphs into deployable .gguf format.
pytorch avx2 avx512 microarchitecture model-compression inference-optimization hardware-aware structured-pruning post-training-quantization cpu-inference low-bit-quantization llamacpp latency-profiling gguf llm-optimization edge-llm mixed-precision-quantization systems-research deep-learning-compilers post-training-compression
-
Updated
Aug 29, 2026 - Python