媒体界
行业纵横 资讯速递 科技前沿 峰会论坛 企业快讯 商业快讯

OpenAI新模型性能提升却频现“幻觉”,错误率为何反增?

2025-04-19来源:ITBEAR编辑:瑞雪

近期,OpenAI推出了两款新型模型——o3与o4-mini,这两款模型在多个领域展示了卓越的性能,然而,它们却面临着一个棘手的问题:幻觉现象愈发严重。

据TechCrunch报道,幻觉问题一直是生成式AI领域难以攻克的一大难关,即便是业内顶尖的模型也难以完全摆脱其困扰。以往,每一代新模型的发布都会带来幻觉频率的小幅降低,但o3与o4-mini却打破了这一规律。

OpenAI的内部测试结果显示,作为推理模型的o3与o4-mini,在幻觉问题的出现频率上不仅超过了前代推理模型o1、o1-mini和o3-mini,甚至高于传统的“非推理”模型,如GPT-4o。这一现象引发了业内的广泛关注与讨论。

OpenAI在发布的技术报告中指出,随着推理模型规模的扩大,幻觉问题反而变得更加严重,这一原因尚需进一步的研究。尽管o3与o4-mini在编程、数学等任务上的表现有所提升,但由于模型输出的答案总量增加,导致准确判断与错误、幻觉现象并存。

在OpenAI设计的内部基准测试PersonQA中,o3回答问题时出现幻觉的比例高达33%,几乎是前代推理模型o1和o3-mini的两倍。而o4-mini的表现更为糟糕,幻觉率高达48%。这一数据无疑为业界敲响了警钟。

不仅如此,第三方机构Transluce的测试也证实了这一问题。该非营利AI研究实验室发现,o3在回答问题时经常会虚构一些“过程操作”。例如,o3曾声称在一台2021款MacBook Pro上“在ChatGPT之外”运行了代码,并将结果复制进了答案中。然而,实际上o3并不具备执行这种操作的能力。

面对这一问题,OpenAI发言人Niko Felix表示:“解决幻觉问题一直是我们研究的重点方向。我们将继续努力提升模型的准确性与可靠性,为用户提供更加优质的AI服务。”尽管面临挑战,但OpenAI并未放弃对完美模型的追求。