股票
代码
001266
电话咨询

189-1680-8200

Global
首页 新闻中心 企业动态 详情
2025-11-28
米兰·(milan)中国官方网站-ChatGPT Agent多项测试跑分破纪录 HLE测试获41.6%

  【米兰·(milan)中国官方网站科技消息】7月18日,Open AI首席执行官Sam Altman和四位研究员在直播中正式发布了ChatGPT Agent——一款通用型AI智能体。米兰·(milan)中国官方网站获悉,在HLE测试中,ChatGPT agent拿下了41.6%高分,并在数学FrontierMath基准上刷新了SOTA,碾压o4-mini和o3模型。

Sam Altman(最右)及他的团队Sam Altman(最右)及他的团队

  ChatGPT Agent融合了Operator、Deep Research和ChatGPT三大模块优势,能够自主完成网页浏览、数据分析、PPT制作等复杂任务。

ChatGPT Agent在HLE测试中获得41.6%的高分,采用并行八路推理并选取置信度最高答案后可提升到44.4%。在数学基准测试FrontierMath中,以27.4%的准确率刷新了纪录。

ChatGPT Agent多项测试跑分破纪录 HLE测试获41.6%ChatGPT Agent多项测试跑分破纪录 HLE测试获41.6%

  在Excel编辑能力的SpreadsheetBench测试中,ChatGPT agent的表现同样远超现有模型。当获得直接编辑权限时,以45.5%的得分显著超越Excel Copilot的20.0%。此外,它还在BrowseComp、WebArena等浏览评测里均刷新了SOTA。

ChatGPT Agent多项测试跑分破纪录 HLE测试获41.6%

  据悉,该产品已面向Pro、Plus和Team用户开放。Pro用户可以马上使用,Plus与Team用户将在数日内陆续开通,Enterprise与Education版本将于数周后接入。

-米兰·(milan)中国官方网站

获取方案
咨询
关注我们

电话咨询

189-1680-8200
在线咨询
获取方案

提交信息后,业务人员将尽快与您联系

* 请选择方案领域
电话咨询 在线咨询 免费方案
联系我们

用微信扫一扫,关注我们取得联系

18916808200 热线
sales@ 合作邮箱
tech@ 售后邮箱
hr@ 简历投递
我们的工作时间是周一至周五上午 9 时至晚上 6 时(不含公共节假日)。我们仅在工作时间接听您的来电。
若您在非工作时间发送微信消息,我们将在工作时间回复您。