共 1 篇 · 按时间倒序
评估是地基,先改检索和上下文,再改系统,最后才训练模型。13 场分享覆盖错误分析、模型级联、多向量检索、OCR 选型、推理延迟、Agent 沙箱和后训练,每场都有能照着做的方法和实测数字。