媒体界
行业纵横 资讯速递 科技前沿 企业动态 峰会论坛

OpenAI推出SimpleQA新基准:治理大模型“信口开河”有招了?

2024-10-31来源:ITBEAR编辑:瑞雪

OpenAI于近日推出了一项名为SimpleQA的新基准,旨在评估语言模型在回答简短事实寻求问题时的准确性。这一举措是AI领域追求更高事实正确性的重要一步。

据悉,SimpleQA通过一系列严格的标准来确保评估的公正性和有效性。其中包括高正确性,即参考答案需经两名独立AI训练师验证;多样性,涵盖从科学技术到娱乐等多个主题;以及前沿挑战性,相比早期的基准,SimpleQA更能测试出前沿模型的实力。

SimpleQA还注重高效用户体验,问题与答案设计得简洁明了,便于快速操作和评分。通过OpenAI API等工具,用户可以轻松地进行模型评估。

OpenAI表示,尽管SimpleQA在短查询的受限设置中测量事实准确性,但其希望这一基准的开源能够推动AI研究在更广泛领域的应用和发展。同时,SimpleQA也揭示了当前语言模型在生成事实正确回答方面仍面临的挑战,即如何减少错误输出和未经证实的答案,这一问题也被称为“幻觉”。

通过SimpleQA的推出,OpenAI期望能够进一步促进语言模型的优化和完善,使其在更多场景中发挥出更大的价值。

降到14万断臂求生?中国新能源市场,已将MINI拒之门外
从市场遇冷到被动降价,这其实也折射出一个MINI在当下尴尬的境遇:这个专注小车的英伦品牌,在中国市场,在全面开向电动化智能化的中国市场,已经水土不服。不好意思,电动MINI虽然采用了长城旗下的核心驱动部件,但…

2024-10-31

“爱自己”的消费主义陷阱
作为最早研究「广告如何塑造女性形象」的人之一,JeanKilbourne说:「这种有问题的广告图,我能给你截一百张」。爱自己并不是永远对自己说「是」,说「可以」,爱自己也要求我们对自己说「不」,因为自由总是伴…

2024-10-30