← 返回概览

应用场景 · 约 9 分钟阅读

在答案范围明确的任务中使用 Laya。

最适合的是高频决策:标签清楚、证据可观察,而且有安全的后备路径。如果任务要求写作或开放式推理,应选择其他模型。

适配判断。你应该能够说清:“给定这个状态,从这些已知结果中选择或评估一个。”若无法事先定义结果,Laya 很可能不是合适的工具。

1. 支持工单分流

在一次调用中,将新消息分类到账单、技术支持、销售或其他队列,检测明确的退款请求并估计紧急程度。明确案例可以自动分流,模糊案例交给人工处理。

适合条件

队列数量不多、历史工单有标签、队列描述具体,并且有人工升级路径。

需要注意

多重意图、新队列、把非英语文本送进英语检查点,以及依据未经验证的置信度盲目自动处理。

2. 明确事实检测

noul 适合判断状态中可见的事实:“用户是否要求退款?”“消息是否提到账户被接管?”“是否明确威胁取消服务?”多个事实性答案可作为确定性业务规则的输入。

若没有精确标准,避免直接询问客户是否“好”、消息是否“合适”或操作是否“安全”。宽泛判断隐藏了多个问题,也让概率更难校准。

3. 模型与工具路由

调用昂贵模型之前,先按领域或所需能力分类请求。简单案例可交给小模型;编程、法律或高度模糊的请求可交给更强模型或专门流程。

读取

检查请求

就领域、敏感性和任务类型提出范围较窄的问题。

路由

执行由代码定义的规则

把类型化输出作为特征;预算和权限仍由确定性代码管理。

验证

测量后续效果

只看路由准确率不够,还要追踪选定路径是否真正解决任务。

4. 提示词防护

在调用 LLM 前,Laya 可以筛查提示词中可观察的越狱或注入模式。项目在留出数据上的防护结果约为 0.71–0.76,远非完美;因此它应当与输入规范化、权限、工具约束和输出检查共同使用。

不要把单个分类器当作安全边界。漏报会放过恶意提示词,误报则会阻碍正常工作。

5. RAG 段落相关性

给定查询和检索到的段落,可估计该段落是否包含与问题相关的证据。这能在生成前过滤较弱片段,或辅助选择检索策略。

项目应用测试列出的最佳结果为 0.657,足以探索重排序或过滤,但不足以在没有任务专项评估的情况下假定它能可靠核实事实。

6. 垃圾邮件与钓鱼邮件分流

Laya 报告在垃圾邮件和钓鱼邮件测试上取得很高结果,但这两类任务都出现在训练中。因此,它们展示的是学到的任务适配,而非广泛的零样本检测能力。应在组织当前的消息分布上重新训练和测试,包括新出现的攻击模式。

7. 本地优先的级联处理

用专项 Laya 检查点处理明确且频繁的案例,再把不确定的案例交给 Jev、通用 LLM 或人工。这通常比要求一个模型同时在准确率、延迟、隐私和成本上达到最优更实际。

阈值是产品决策

阈值会改变自动处理覆盖率和错误成本。应依据每项任务的验证曲线选择,再监控分布漂移。choice、score 和 noul 统一使用一个全局阈值,通常并不合适。

不适合的任务

任务Laya 不适合的原因可替代方案
撰写客户回复不生成文本分流后使用生成式 LLM
总结文档答案范围开放摘要模型或 LLM
从数百个冗长标签中选择默认选项 token 预算不足Jev、层级路由或先检索候选项
高风险最终审批校准和分布变化仍取决于具体任务决策辅助、确定性检查和人工复核
解释决策不会生成理由单独保存证据或使用解释流程

实施之前

  1. 准确界定决策,列出可接受的全部输出。
  2. 收集有代表性的标注样本,包括模糊案例和“以上皆非”。
  3. 有意识地选择检查点;不要靠置信度来识别语言不匹配。
  4. 测量高置信度错误和各类别表现。
  5. 决定置信度低或输入超出范围时如何处理。
  6. 不可逆的副作用应置于确定性的权限控制与审核之后。

证据来源:Laya 汇总基准测试。接口与预设示例:Laya 仓库。建议为独立解读,并非维护者的声明。