- 主题
- 4
- 笔记
- 4
- 维护方式
- 持续校正
按顺序开始
先建立完整地图,再进入具体系统与故障现场。
按主题浏览
文章之间互相引用,不追求孤立的知识点。
学习路线
先建立 LLMOps 全局地图,再逐层深入模型、推理、可观测性与平台工程。
基础体系
理解模型生命周期、GPU 资源、分布式计算和生产环境中的关键约束。
推理服务
围绕 SGLang、调度、KV Cache、并行策略与性能调优积累实践。
可观测性
从指标、日志和 Trace 还原请求生命周期,建立可复用的诊断方法。
维护约束
一份公开知识库,也是一套约束自己的学习方法。
- 证据优先
- 区分日志事实、代码事实与推断,不用结论代替证据。
- 结构优先
- 先回答它在系统中的位置,再解释局部原理。
- 持续校正
- 保留更新时间和状态,让过时知识有迹可循。