1. 支持工单分流
在一次调用中,将新消息分类到账单、技术支持、销售或其他队列,检测明确的退款请求并估计紧急程度。明确案例可以自动分流,模糊案例交给人工处理。
适合条件
队列数量不多、历史工单有标签、队列描述具体,并且有人工升级路径。
需要注意
多重意图、新队列、把非英语文本送进英语检查点,以及依据未经验证的置信度盲目自动处理。
2. 明确事实检测
noul 适合判断状态中可见的事实:“用户是否要求退款?”“消息是否提到账户被接管?”“是否明确威胁取消服务?”多个事实性答案可作为确定性业务规则的输入。
若没有精确标准,避免直接询问客户是否“好”、消息是否“合适”或操作是否“安全”。宽泛判断隐藏了多个问题,也让概率更难校准。
3. 模型与工具路由
调用昂贵模型之前,先按领域或所需能力分类请求。简单案例可交给小模型;编程、法律或高度模糊的请求可交给更强模型或专门流程。
检查请求
就领域、敏感性和任务类型提出范围较窄的问题。
执行由代码定义的规则
把类型化输出作为特征;预算和权限仍由确定性代码管理。
测量后续效果
只看路由准确率不够,还要追踪选定路径是否真正解决任务。
4. 提示词防护
在调用 LLM 前,Laya 可以筛查提示词中可观察的越狱或注入模式。项目在留出数据上的防护结果约为 0.71–0.76,远非完美;因此它应当与输入规范化、权限、工具约束和输出检查共同使用。
不要把单个分类器当作安全边界。漏报会放过恶意提示词,误报则会阻碍正常工作。
5. RAG 段落相关性
给定查询和检索到的段落,可估计该段落是否包含与问题相关的证据。这能在生成前过滤较弱片段,或辅助选择检索策略。
项目应用测试列出的最佳结果为 0.657,足以探索重排序或过滤,但不足以在没有任务专项评估的情况下假定它能可靠核实事实。
6. 垃圾邮件与钓鱼邮件分流
Laya 报告在垃圾邮件和钓鱼邮件测试上取得很高结果,但这两类任务都出现在训练中。因此,它们展示的是学到的任务适配,而非广泛的零样本检测能力。应在组织当前的消息分布上重新训练和测试,包括新出现的攻击模式。
7. 本地优先的级联处理
用专项 Laya 检查点处理明确且频繁的案例,再把不确定的案例交给 Jev、通用 LLM 或人工。这通常比要求一个模型同时在准确率、延迟、隐私和成本上达到最优更实际。
阈值是产品决策
阈值会改变自动处理覆盖率和错误成本。应依据每项任务的验证曲线选择,再监控分布漂移。choice、score 和 noul 统一使用一个全局阈值,通常并不合适。
不适合的任务
| 任务 | Laya 不适合的原因 | 可替代方案 |
|---|---|---|
| 撰写客户回复 | 不生成文本 | 分流后使用生成式 LLM |
| 总结文档 | 答案范围开放 | 摘要模型或 LLM |
| 从数百个冗长标签中选择 | 默认选项 token 预算不足 | Jev、层级路由或先检索候选项 |
| 高风险最终审批 | 校准和分布变化仍取决于具体任务 | 决策辅助、确定性检查和人工复核 |
| 解释决策 | 不会生成理由 | 单独保存证据或使用解释流程 |
实施之前
- 准确界定决策,列出可接受的全部输出。
- 收集有代表性的标注样本,包括模糊案例和“以上皆非”。
- 有意识地选择检查点;不要靠置信度来识别语言不匹配。
- 测量高置信度错误和各类别表现。
- 决定置信度低或输入超出范围时如何处理。
- 不可逆的副作用应置于确定性的权限控制与审核之后。
证据来源:Laya 汇总基准测试。接口与预设示例:Laya 仓库。建议为独立解读,并非维护者的声明。
