大有娱乐平台注册

大有娱乐平台注册

你的位置:大有娱乐平台注册 > 新闻动态 >

美国苹果AI再出狠活,能自动标出生成错误,中国企业又面临新挑战

点击次数:190 发布日期:2025-10-29

文 | 金锐点

编辑 | 金锐点

写报告时核对AI生成内容的错漏要逐句扒,做论文时担心LLM输出幻觉却找不到具体问题,这是不少职场人、研究者的头疼事。

长期以来,幻觉检测技术多是笼统提示有错误,却没法精准指出错在哪,大量时间耗在无效核对上。

而2025年10月苹果刚发布的一篇重磅论文,直接解决了这个痛点,其研发的RL4HSAI框架能自动标出生成内容里的具体错误片段,精准度甚至超过了GPT-5、o3等主流商用模型。

这一突破不仅让AI用起来更省心,也给依赖AI提效的中国企业敲了个警钟,在LLM可靠性竞争里,咱们得跟上节奏了?

想明白苹果这项技术的价值,得先说说传统幻觉检测的短板在哪,过去做幻觉检测,大多是简单的二选一判断。

要么说有错误,要么说没错误,比如用AI写产品介绍,即便检测出问题,也得自己从头读到尾找漏洞,遇到长文本时,光核对就要花上半小时甚至更久。

这种只给结论、不给位置的模式,让很多用户即便知道AI输出有问题,也难以高效修正,对企业来说,内容审核效率始终提不上来。

苹果正好推出了RL4HS框架基,于强化学习的幻觉片段检测,不过这项技术并非凭空出现,研究者先做了组实验验证关键思路。

显式推理能不能帮AI更精准定位幻觉片段?他们用Qwen2.5-7B、Qwen3-8B等主流开源模型做测试,分别对比先推理后判断和直接判断两种模式。

结果很清晰,预测1次时,两种模式差距不大,但随着预测次数增加,启用思维链的模型在Span-F1@K指标上优势越来越明显。

这意味着,让AI多想想,确实能提升错误定位的准确率,这个发现,成了RL4HS框架的设计基础。

RL4HS能精准标错,关键藏在两个设计里,第一个是片段级奖励机制,AI只有精准找到错误片段的位置,才能拿到高奖励,不像以前那样随便说句有错误就能得分。

这就倒逼模型放弃偷懒,主动去定位具体问题,框架基于组相对策略优化(GRPO)搭建,但研究者很快发现新问题。

GRPO存在奖励不平衡,判断无幻觉时,模型只需输出没有错误就能拿高分,可判断有幻觉时,只要定位有一点偏差,靠F1算出来的奖励就会掉很多。

时间长了,模型就会刻意回避找错误,漏检率自然升高,为了修正这个偏差,苹果团队加入了CAPO,给无幻觉类别的奖励加了个缩放因子α。

这相当于给容易拿分的任务降了分,让模型不再害怕找错,而是主动精准定位,正是这两个设计的配合,让RL4HS真正学会了核查依据、标错到位,技术好不好,得用数据说话。

苹果团队在RAGTruth基准测试集上做了验证,这个数据集涵盖摘要生成、问答、数据到文本三大高频任务,基本覆盖了企业和个人用AI的主要场景。

实验以Qwen2.5-7B-Instruct和Qwen2.5-14B-Instruct为基础模型,同时对比了预训练指令微调模型、预训练推理模型(如Qwen3-14B)、监督微调(SFT)模型,以及GPT-5、o3、GPT-4o-mini等商用模型。

2025年10月公布的测试结果显示,预训练指令微调模型不管有没有启用CoT,F1值都低于30,说明单靠提示词没法实现片段级定位。

预训练推理模型比如Qwen3-14B,在摘要任务上F1达35.8,虽比Qwen2.5-14B-Instruct高一点,但还是比不上微调模型。

监督微调模型表现不错,14B规模下F1值达到55.4,而RL4HS直接实现了超越,7B规模的RL4HS在三个任务上平均F1达55.9,超过SFT模型的50.1。

14B规模的RL4HS更突出,摘要、问答、数据到文本任务的F1值分别达57.6、54.8、62.6,不仅超过Qwen3系列,连GPT-5、o3这些公认的强模型也被比了下去。

最能说明问题的是一个具体测试案例,RAGTruth数据集中有段关于某场所提供餐饮服务的文本,对应的结构化数据里其实没有任何餐饮相关属性。

传统预训练模型检查了营业时间、用户评价等信息,却漏掉了这个关键矛盾,最终没标注任何幻觉。

而RL4HS不仅精准标出提供餐饮服务是错误片段,推理过程还和人工核查逻辑高度契合,先核对结构化数据属性,再匹配文本表述,最后判定不一致。

这说明它的标错不是碰运气,而是真的学会了系统化校验,对中国企业来说,苹果这步突破带来的不只是技术参考,更是实实在在的新挑战。

当前很多中国企业用AI还停留在能用就行的阶段,对幻觉检测的需求多集中在有没有错,而非错在哪。

但随着AI深入报告撰写、金融分析、媒体创作等核心场景,精准纠错的需求会越来越迫切,银行用AI写市场分析,错一个数据就可能干扰决策。

若中国企业若能结合强化学习与幻觉检测技术,完全有机会实现突破,毕竟核心技术最终要靠自主研发,苹果的突破只是让行业看到了更清晰的方向。

焦让AI更可靠这个核心需求,把精准纠错技术当成下一个研发重点,才是最扎实的竞争力。