媒体界
行业纵横 资讯速递 科技前沿 峰会论坛 企业快讯 商业快讯

苹果杜克联手,新“交错推理”法让大语言模型更聪明更快!

2025-05-31来源:ITBEAR编辑:瑞雪

近期,一项由苹果公司与杜克大学携手推出的创新强化学习方法“交错推理”,在人工智能领域掀起了波澜。该方法旨在显著增强大语言模型的推理能力,为复杂问题的解决提供了新的视角。

在探讨这一突破之前,我们不得不提及当前大语言模型在处理多步骤复杂问题时所面临的挑战。它们往往遵循一种线性的“思考-回答”模式,虽然逻辑清晰,但响应速度较慢,且在推理链的任一环节出错都可能影响最终答案的准确性。这种模式与人类的交流方式大相径庭,人类倾向于在思考过程中逐步表达想法,而模型则倾向于在完成整个推理后才给出答案,这在一定程度上限制了其效率和互动性。

为了打破这一僵局,“交错推理”应运而生。该方法的核心在于,在模型的推理过程中,巧妙地交替进行内部计算和输出中间答案的操作,从而大幅提升响应速度和实用性。为了实现这一目标,研究团队设计了一个基于强化学习的训练框架,其中嵌入了特定的指示标签,这些标签能够引导模型在达到关键推理节点时输出阶段性成果。

为了确保模型在追求局部输出效率的同时,不牺牲整体推理的准确性,研究团队精心构建了一套基于规则的奖励机制。该机制综合考虑了格式合规性、最终准确率以及条件性中间准确率等多个维度,以确保模型在推理过程中的每一步都能得到恰当的激励。

实验数据表明,“交错推理”在Qwen2.5模型(包括1.5B和7B参数版本)上取得了显著成效。与传统方法相比,该方法的响应速度提升了超过80%,推理准确率也提高了近19.3%。更令人振奋的是,尽管模型仅在问答类和逻辑类数据集上进行了训练,但它在MATH、GPQA和MMLU等更具挑战性的任务中也展现出了强大的泛化能力。

研究团队还尝试了多种奖励机制,包括全或无奖励、部分积分奖励及时间折扣奖励等。结果显示,条件性奖励和时间折扣奖励的效果最为突出,远远超越了传统训练方式。

“交错推理”的提出,不仅为提升大语言模型在复杂推理任务中的表现提供了一条切实可行的技术路径,也为未来模型的设计与优化提供了新的思路。这一创新成果无疑将推动人工智能领域向更加高效、智能的方向发展。

宇树机器人成都演唱会惊艳伴舞王力宏,王兴兴回应马斯克点赞盛赞
据了解,近日,在王力宏的成都演唱会上,6台身着银色战袍的宇树科技G1人形机器人惊艳亮相,与王力宏共同演绎了经典曲目“火力全开”,打造了全球首个演唱会机器人舞台。 这一场别开生面的演唱会,迅速引发了全球范围内…

2025-12-27

九安智能拟募资10.64亿冲刺创业板 申万宏源保荐 百度成上半年前五大客户
瑞财经 吴文婷12月25日,广东九安智能科技股份有限公司(以下简称“九安智能”)创业板IPO获受理。 本次IPO的保荐机构为申万宏源证券承销保荐有限责任公司,保荐代表人为黄彪、刘令,会计师事务所为天职国际会…

2025-12-27

2025江西省级工业互联网平台及培育名单公示 邀您共鉴
按照《江西省工业和信息化厅关于组织开展2025年工业互联网平台申报和动态评价工作的通知》(赣工信信推字〔2025〕250号),经企业自主申报、地方推荐、专家评审等环节,形成了2025年江西省省级工业互联网平台…

2025-12-27

华为2025智驱三重奏:筑基、赋智、共生,助力行业跨越AI“落地鸿沟”
回顾华为2025年的行业智能化实践,“基建筑基-场景赋智-生态共生”的智驱三重奏,实则是一套完整的“价值创造逻辑”,它精准回应了数智化转型中的三大核心挑战,成为行业痛点的破局之钥:基础设施是前提,ACT 闭…

2025-12-27