OpenAI发布最强推理模型o1:可解答83%的奥数问题

北京时间9月13日凌晨,美国OpenAI公司发布全新模型技术产品o1,包括两种版本o1-preview和o1-mini,前者具有高级推理功能,在推理数学、编程、科学等问题的能力上有显著提高,性能接近理化生博士水平;后者则是一款更小巧、专为代码生成优化的模型。

这就是此前传言中高级推理能力强大模型的“Strawberry”项目。也有人分析称,o1是Orion大模型简称。

OpenAI表示,对于复杂推理任务而言,新模型代表着AI能力的崭新水平,因此值得将计数重置为1,给它一个有别于“GPT-4”系列的全新名号。同时,这也预示着,AI时代迎来崭新的起点——能够进行通用复杂推理的大模型重要到来。

需要注意的是,o1目前的聊天体验还比较基础。不同于其前身GPT-4o,o1目前无法浏览网页或处理文件分析功能。尽管它具备图像分析功能,但该功能暂时关闭,等待进一步测试。此外,o1还有消息量限制——目前o1-preview每周限额30条、o1-mini每周50条。

即日起,o1-preview 和 o1-mini两个版本已经在ChatGPT Plus/Team和API接口渠道上线,企业和教育用户将于下周初获得优先访问权限。

OpenAI CEO奥尔特曼(Sam Altman)表示,“这是我们迄今为止功能最强大、最一致的模型系列 o1,也是迄今为止我们最好的推理模型。虽然o1仍然存在缺陷并有限,但使用时的感觉依然更加令人印象深刻。”

具体来看,OpenAIo1可以解决比以前GPT时期的科学、编码和数学模型更难的问题。

OpenAI的研究负责人Jerry Tworek透露,o1模型背后的训练与之前的产品有着根本性的区别。之前的GPT模型旨在模仿其训练数据中的模式,而o1的训练旨在让其独立解决问题。在强化学习的过程中,使用奖励和惩罚机制来“教育”AI使用“思维链”来处理问题,就像人类习得拆解、分析问题的方式一样。

o1上线之后,现在ChatGPT可以在回答问题前先仔细思考,而不是立即脱口而出答案。就像人类大脑的系统1和系统2,ChatGPT已经从仅使用系统1(快速、自动、直观、易出错)进化到了可使用系统2思维(缓慢、深思熟虑、有意识、可靠)。这让它能够解决以前无法解决的问题。

所谓推理大模型,就是AI会在回答之前花更多时间进行思考,就像人类思考解决问题的过程一样,而非预测单词生成的序列。比如通过文字点开AI思考的过程,还会出现AI表示“我在思考这个事情这么做行不行”、“啊时间不够了得尽快给出答案”等。OpenAI确认,这里展示的并不是原始的思维链,而是“模型生成的摘要”,公司也坦率承认这里有保持“竞争优势”的因素。

根据测试,在国际数学奥林匹克(IMO)资格考试中,GPT-4o仅正确解答了13%的问题,而o1模型正确解答了83%的问题。而在编程能力比赛Codeforces中,o1模型拿到89%百分位的成绩,而GPT-4o只有11%。

OpenAI发现,随着更多的强化学习(训练时计算)和更多的思考时间(测试时计算),o1的性能持续提高。而且扩展这种方法的限制与大模型预训练的限制有很大不同,OpenAI也还在继续研究。

OpenAI技术文件称,实验结果表明:o1超越了人类专家的表现,性能接近理科博士水平,成为第一个在该基准测试中做到这一点的模型。而在下一个更新的版本中,AI在物理、化学和生物学的挑战性基准测试中,表现能够与博士生水平类似。

除了OpenAI o1-preview外,OpenAI今晨也同步推出了o1-mini模型,更快、更便宜,定价也比preview版本降低了80%,适用于需要推理但不需要广泛世界知识的场景。

很显然,尽管新的OpenAI o1还不具备更全面问题解决能力,但显著提升的推理能力使其在科学、编程、数学等专业领域具备了更大的用途,以及 AI Agent 相关技术的下限和上限被整体拉高,大幅提升科学研究和生产端的能力,对于消费端来说意义不算太大。

英伟达首席科学家Jim Fan表示,新的o1需要消耗更大的算力和数据,并且能够形成数据飞轮效应,正确的答案及其思考过程可以成为很好的训练数据。从而不断改进推理核心,类似AlphaGo的价值网络随着MCTS生成更多精炼数据而改进。

天风国际称,OpenAI o1系列模型大幅增强推理能力,并宣布新的Scaling范式:通过RL解锁Test time compute(推理时间)。

此外,9月11日彭博社报道称,OpenAI正在商谈以1500亿美元(约合10675.35亿元,1.07万亿元)的估值进行新一轮融资,有望从投资者那里筹集65亿美元,投资方包括苹果、英伟达、微软等。同时,OpenAI还在谈判以循环信贷安排的形式从银行借款50亿美元。

成立于2015年的OpenAI,一直处于科技行业向 AI 快速转变的中心,其发布的聊天机器人产品ChatGPT于2022年首次亮相,引发全球 AI 投资热潮。OpenAI首席财务官Sarah Friar近日在内部备忘录中表示,新一轮融资将支持公司对计算能力和其他运营费用的需求。她强调,该公司的目标是允许员工在今年晚些时候的收购要约中出售部分股份。

特别声明:以上文章内容仅代表作者本人观点,不代表菜鸟理财观点或立场。发布者:菜鸟理财,转转请注明出处:https://www.citui.cn/2024/09/14/13773.html

(0)
菜鸟理财的头像菜鸟理财
上一篇 2024年9月14日 下午12:40
下一篇 2024年9月14日 下午12:43

相关推荐

  • 方便面业绩下滑,康师傅业绩靠茶饮独撑

    文|李振兴 康师傅不愧为最早推出茶饮的企业。2024年上半年康师傅茶饮的业绩增长支撑起康师傅的整体业绩增长。 康师傅发布的2024年上半年业绩显示,2024年上半年康师傅的收益同比上升0.7%至412.01亿元。股东应占溢利同比提高15.1%至18.85亿元。康师傅桶装面虽然实现增长,但整体方便面收益同比衰退1%,茶饮实现了增长,抵消了水、果汁、碳酸饮品等品…

    2024年8月30日
    5600
  • 掌舵八年,卢敏放挥别蒙牛

    10月10日晚,蒙牛乳业宣布卢敏放已辞任公司执行董事、董事会副主席、战略及发展委员会和可持续发展委员会成员等职务。 在此之前的3月,卢敏放已辞任蒙牛乳业总裁一职。这意味着,此番辞职后,卢敏放将不再担任蒙牛任何职务。至此,现年55岁的卢敏放结束了自己在蒙牛乳业历经8年1个月的职业生涯。 回顾卢敏放掌舵的八年时间,他给蒙牛带来了什么? 恢复狼性战略 2016年的…

    2024年10月12日
    9700
  • 120人的A轮公司,卖了20亿

    一直未消停的文生图赛道再次掀起波澜,这次的主角是今年流量刚刚反超Midjourney的年轻公司Leonardo.ai。 近日,澳大利亚超级独角兽Canva宣布收购图像生成初创公司Leonardo.ai,这是其今年的第二笔收购。就在几个月前,Canva刚刚宣传以数亿英镑的价格,收购了深受苹果用户喜爱的Affinity软件套件。 据了解,Leonardo.ai的…

    2024年8月5日
    10400
  • 新诺威拟76亿并购石药百克,石药集团玩转“左手倒右手”资本术

    图源:网络 新诺威76亿并购石药百克的交易正在加快落地,本次交易是石药集团在创新药资产方面的再度腾挪。而随着收购的完成,石药集团的创新转型有望再进一步。 石药集团再度上演“资产腾挪术”。 10月16日,新诺威公告称,公司拟以发行股份及支付现金的方式购买维生药业、石药上海、恩必普药业合计持有的石药百克100%股权,交易金额为76亿元。同时,公司拟定增募集不超过…

    2024年10月21日
    3600
  • 北京二手住宅网签量站上“荣枯线”

    图源:网络 在北京“930新政”的持续推动下,北京二手房市场迎来加速回暖。根据北京市住建委的最新数据,10月1日至10月30日,北京二手住宅的网签量达到15967套,较去年同期大幅增长61.1%,比9月同期增长了20.3%,成功打破7月15575套的纪录,创下自2023年4月以来近18个月的最高值。业内专家认为,北京二手房交易量重回1.5万套的“荣枯线”,是…

    2024年11月1日
    2100

发表回复

您的电子邮箱地址不会被公开。 必填项已用 * 标注

联系我们

400-800-8888

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信