C114
通信人家园
English
公众号矩阵

投稿
举报

量子大观

通信人家园

C114通信网

光通信观察

DVBCN中广5G

2025/4/16 08:43

初探 OpenAI GPT-4.1 性能：AI 编程能力大增，但谷歌 Gemini 依然称王

IT之家故渊

0

0

科技媒体 bleepingcomputer 昨日（4 月 15 日）发布博文，报道称 OpenAI 最新发布的 GPT-4.1 系列模型，其性能相比 GPT-4o 虽然实现重大飞跃，但多项跑分未能超越谷歌的 Gemini 系列。

IT之家昨日报道，OpenAI 公司发布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano，官方公布的跑分数据来看，这些模型在编程方面的能力，远超 GPT-4o 及 GPT-4o mini。

例如在 SWE-bench Verified 跑分中，GPT-4o 的得分为 21.4%，GPT-4.5 的得分为 26.6%，而 GPT-4.1 的得分为 54.6%。

尽管性能有较大提升，不过根据多位专家测试，相比较谷歌的 Gemini 系列，GPT-4.1 对比中却显露劣势。

根据 Stagehand（一款生产级浏览器自动化框架）发布的基准数据，Gemini 2.0 Flash 的错误率仅为 6.67%，精确匹配率高达 90%，且价格低廉、速度更快。相比之下，GPT-4.1 的错误率高达 16.67%，成本更是 Gemini 2.0 Flash 的 10 倍以上。

此外，哈佛大学 RNA 科学家 Pierre Bongrand 提供的数据也指出，GPT-4.1 的性价比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等竞品。

在编码专项测试中，GPT-4.1 同样未能占据上风。Aider Polyglot 的测试结果显示，GPT-4.1 的编码得分仅为 52%，而 Gemini 2.5 则以 73% 的成绩遥遥领先。

值得注意的是，GPT-4.1 被归类为非推理模型（non-reasoning model），但其编码能力仍属行业顶尖。

免责声明：本文仅代表作者个人观点，与C114通信网无关。其原创性以及文中陈述文字和内容未经本站证实，对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺，请读者仅作参考，并请自行核实相关内容。

给作者点赞

0 VS 0

写得不太好

相关链接

测试 OpenAI

软银完成对 OpenAI 的 100 亿美元追加投资，10 月 1 日将再投 100 亿美元
IT之家远洋7-1
韩反垄断机构指控谷歌滥用Android支配地位或罚款超5亿美元
凤凰网科技箫雨7-1
第三方行业深度分析：51.2T 高端数据中心交换芯片市场发展研判
C114通信网 7-1
OpenAI研发高效推理方案：模型运行成本降低50%
快科技鹿角7-1

特别策划

热门文章

中国移动G.654光缆集采，长飞、亨通、烽火中标

6/29

28亿元投入：大族激光加码高端光纤产业

6/26

中信科移动李铁钧： AI驱动网络价值，筑牢Token 经营根基

6/27

于英涛辞职，王竑弢接任新华三集团总裁兼首席执行官

6/29

中国电信5G无线网八期工程集采：华为、中兴、中信科移动、爱立信中标

6/29

最新视频

人事变动 | 邱宝华任中国联通副总经理、党组成员

7/1

中兴通讯亮相MWC26 上海 | 以创新AIOS技术底座，重塑AI商业服务新模式

7/1

GTI主席高同庆：人和人工智能将会成为社会发展的共同主体

7/1

千台终端重磅交付，通宇通讯纵深推进卫星物联网市场拓展

6/30

华为数据通信展台直击 | 华为王武伟详解Token目标网，助力运营商加速迈向Token经营

6/29

为您推荐

C114简介联系我们网站地图

Copyright©1999-2025 c114 All Rights Reserved 沪ICP备12002291号-4

C114通信网版权所有举报电话：021-54451141 用户注销