CGL AGENT LAB2026-09
这一页讲清楚我们最近在折腾的一套逻辑:怎么让 AI 不瞎猜、有记性、还不泄密。没有黑话,全部说人话。
你问"这条客户消息急不急",它回你三段分析。你要的其实就一个词:急 / 不急。而且同一句话问三遍,答案可能不一样。
昨天踩过的坑、你交代过的偏好,今天全部归零。每个对话都是失忆重启,好经验攒不下来。
我们的解法分两层:判断交给"决策引擎",记性交给"记忆系统"。下面分开讲,最后讲它俩怎么配合。
决策引擎(国外叫 Jev,我们另部署了开源平替 Laya)是专门训练来"回答窄问题"的小模型。它不生成文章,只出三种答案:
🔸 是非题(noul):"客户是否明确要求退款?" → 是,把握 99%
🔹 选择题(choice):"这消息归谁处理?" → 账单组,把握 94%
🔺 打分题(score):"这预算有竞争力吗?" → 1.9 / 2,偏上
三个关键好处:
1️⃣ 不可能胡编——它只能从你给的选项里挑,结构上没法输出别的;
2️⃣ 自带把握度——它会说"我不确定"(置信度低),这时候机器自动转人工,不硬拍;
3️⃣ 便宜到可以放开用——一次判断约万分之二美元,一天调一万次也就几毛钱。
我们装了两个引擎,各管一摊:
| ☁️ Jev(云端) | 🏠 Laya(本机) | |
|---|---|---|
| 擅长 | 中文分类、打分,复杂语义 | 是非判断,英文题 |
| 数据出网? | 会 | 不会(纯本地) |
| 花钱吗 | 极少 | 零 |
| 稳定性 | 高 | 同题问三遍,答案一模一样 |
写了一个统一入口:问题丢进来,它自动判断该给谁——涉及隐私的、要复现的,绝不出网;要精细分类的,交给云端。哪个引擎坏了自动切另一个,你无感。
例:一条客户消息进来 "是否含机密?" → 🏠 Laya 本地判断(不过外网) "归哪个部门?" → ☁️ Jev 云端判断(分类更准)
每个 Agent 配一本"工作日志"(journal),规则很简单:
📝 踩了坑、学了招、做错事,必须记一笔——场景是什么、下次怎么做,缺一样不许入库(防套话);
🛡️ 入库先过安检——本机引擎先扫一遍"有没有密码、有没有隐私",扫的时候日志内容不出网;
🔄 每周复盘——把散的观察合并成经验,写进"心智模型";该谁负责的事不乱记,以人定的规矩为准;
📉 会遗忘——没用的条目自动降权,不占地方。
一句话:日记本 + 安检门 + 周复盘 + 遗忘曲线。
这是最有意思的部分——引擎和记忆互相喂:
引擎每次都是白纸,没有历史。把日志里"类似场景上次判了什么、后来结局如何"打包塞给它 → 判断从"凭感觉"变成"有先例"。原来没把握(39%)的判断,喂了 20 条历史后把握能上一个台阶。
新观察进来,引擎先判"是不是和最近 5 条重复"——重复的合并,不堆噪音;周复盘时判"这条经验还有没有用"——没用的进衰减区。日记本从"只进不出"变成"有新陈代谢"。
每次判断的"谁答的、多快、多大把握"都记进日志。攒一个月,我们就知道哪个引擎在什么场景可靠 → 据此修订路由规则 → 判断更准 → 记录更可信。飞轮转起来。
但不越线:"什么值得记住"这种价值判断永远留给人(规则 + 人工复核),不交给机器自动裁。机器管效率和把关,人管方向和取舍。
| 测试 | 结果 |
|---|---|
| 中文退款判断(是非) | 99.5% 把握,答对 |
| 工单分类(中文选择题) | 94~100% 把握,答对 |
| 同题问三遍 | 答案完全一致(极差 0) |
| 单次判断速度 | 本地 0.2~0.3 秒 / 云端 0.8 秒 |
| 故障切换 | 引擎挂了自动切备用,带标记可审计 |
测试环境:Mac 本地 + 云端 API,2026-09-29/30。中文选择题给本地 Laya 确实不行(把握 <50%),所以路由层硬性划给云端——知道自己不行也是能力。
一句话收尾:让 AI 写东西的是模型,让 AI 拍板的是引擎,让 AI 长记性的是记忆——三层各干各的,谁也别越位。
© 2026 CGL Agent Lab · 本页由 Hiro 构建 · 详细技术版见 /tech/