这是制造业 GLM 数智员工项目的复盘。目标是用 GLM-4.5 构建合同审查 Agent:上传合同 → 按审查清单逐条核对 → 输出风险点与修改建议。最终法务初审时间从 3 小时压缩到 15 分钟,审查准确率从第一版的 72% 提升到 95%。
工具调用:把"自由发挥"变成"按剧本走"
第一版我们让模型直接输出审查报告,结果格式飘忽、字段缺失。第二版改用 GLM 的 Function Call,把每个审查项定义成独立工具(金额条款核对、违约责任检查、知识产权归属……),用 JSON Schema 约束输出。三个原则:
- 工具粒度要小:一个工具只做一类条款的审查,模型单次任务的注意力更集中;
- 失败要可重试:解析失败自动重试并降级到更宽松的 schema;
- 流程要可编排:审查项之间的依赖关系由编排层控制,不依赖模型自己规划。
幻觉抑制:三道防线
法律场景对幻觉零容忍。我们建了三道防线:第一道,RAG 限定上下文——模型只能基于检索到的合同原文和制度条款回答,禁止使用参数知识;第二道,强制引用——每个风险点必须附带原文条款号和原文摘录,系统校验摘录确实存在于原文中,否则丢弃该结论;第三道,拒答机制——检索置信度低于阈值时,明确输出"本条需人工复核",而不是硬编一个答案。
从 72% 到 95% 的三个关键动作
- Few-shot 示例从 2 个扩充到 8 个,覆盖各类合同模板的表述差异;
- 建立坏例回流机制:法务纠正过的结论自动进入评测集与微调语料;
- 用 GLM-4-Long 处理超长合同,避免截断导致的漏审。
私有化部署方面,GLM-4.5 在客户内网 GPU 集群上稳定运行,配合量化优化后推理成本可控。模型能力决定了 Agent 的下限,工程体系决定了上限。