AI 技术博客 - 最新的 AI 模型资讯、API 使用教程与行业动态
本文将带你深入探究如何从底层架构出发,用 PyTorch 手写一个大语言模型(LLM),并通过自定义量化(Quantization)算法将 FP32 参数压缩至 INT8。这是一篇兼具理论与实战的深度技术指南。