OpenAI新模型性能提升却频现“幻觉”，错误率为何反增？-资讯速递-媒体界

近期，OpenAI推出了两款新型模型——o3与o4-mini，这两款模型在多个领域展示了卓越的性能，然而，它们却面临着一个棘手的问题：幻觉现象愈发严重。

据TechCrunch报道，幻觉问题一直是生成式AI领域难以攻克的一大难关，即便是业内顶尖的模型也难以完全摆脱其困扰。以往，每一代新模型的发布都会带来幻觉频率的小幅降低，但o3与o4-mini却打破了这一规律。

OpenAI的内部测试结果显示，作为推理模型的o3与o4-mini，在幻觉问题的出现频率上不仅超过了前代推理模型o1、o1-mini和o3-mini，甚至高于传统的“非推理”模型，如GPT-4o。这一现象引发了业内的广泛关注与讨论。

OpenAI在发布的技术报告中指出，随着推理模型规模的扩大，幻觉问题反而变得更加严重，这一原因尚需进一步的研究。尽管o3与o4-mini在编程、数学等任务上的表现有所提升，但由于模型输出的答案总量增加，导致准确判断与错误、幻觉现象并存。

在OpenAI设计的内部基准测试PersonQA中，o3回答问题时出现幻觉的比例高达33%，几乎是前代推理模型o1和o3-mini的两倍。而o4-mini的表现更为糟糕，幻觉率高达48%。这一数据无疑为业界敲响了警钟。

不仅如此，第三方机构Transluce的测试也证实了这一问题。该非营利AI研究实验室发现，o3在回答问题时经常会虚构一些“过程操作”。例如，o3曾声称在一台2021款MacBook Pro上“在ChatGPT之外”运行了代码，并将结果复制进了答案中。然而，实际上o3并不具备执行这种操作的能力。

面对这一问题，OpenAI发言人Niko Felix表示：“解决幻觉问题一直是我们研究的重点方向。我们将继续努力提升模型的准确性与可靠性，为用户提供更加优质的AI服务。”尽管面临挑战，但OpenAI并未放弃对完美模型的追求。