初探 OpenAI GPT-4.1 性能:AI 编程能力大增,但谷歌 Gemini 依然称王
作者:五福软件园时间:2025-04-17 12:57:05
本站 4 月 16 日消息,科技媒体 bleepingcomputer 昨日(4 月 15 日)发布博文,报道称 OpenAI 最新发布的 GPT-4.1 系列模型,其性能相比 GPT-4o 虽然实现重大飞跃,但多项跑分未能超越谷歌的 Gemini 系列。
本站昨日报道,OpenAI 公司发布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,官方公布的跑分数据来看,这些模型在编程方面的能力,远超 GPT-4o 及 GPT-4o mini。
例如在 SWE-bench Verified 跑分中,GPT-4o 的得分为 21.4%,GPT-4.5 的得分为 26.6%,而 GPT-4.1 的得分为 54.6%。
尽管性能有较大提升,不过根据多位专家测试,相比较谷歌的 Gemini 系列,GPT-4.1 对比中却显露劣势。
根据 Stagehand(一款生产级浏览器自动化框架)发布的基准数据,Gemini 2.0 Flash 的错误率仅为 6.67%,精确匹配率高达 90%,且价格低廉、速度更快。相比之下,GPT-4.1 的错误率高达 16.67%,成本更是 Gemini 2.0 Flash 的 10 倍以上。
此外,哈佛大学 RNA 科学家 Pierre Bongrand 提供的数据也指出,GPT-4.1 的性价比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等竞品。
在编码专项测试中,GPT-4.1 同样未能占据上风。Aider Polyglot 的测试结果显示,GPT-4.1 的编码得分仅为 52%,而 Gemini 2.5 则以 73% 的成绩遥遥领先。
值得注意的是,GPT-4.1 被归类为非推理模型(non-reasoning model),但其编码能力仍属行业顶尖。
相关文章
-
奇迹sf封神之路!爆肝分享三大职业终极攻略,秒变大佬不迷路!
一、三大职业核心定位详解1 铸梦剑士:团队钢铁壁垒推荐人群:喜欢近战肉盾的热血玩家 核心优势:高防御值+群体嘲讽技能,副本输出位的守护神 技能搭配:必点「狂兽突袭」破甲+「钢铁护体」反伤,35级
-
传世私服隐藏福利大公开!这5个冷门地址让我尖叫!
一、实测超稳的5个冷门地址变态单职业隐藏服服务器地址:bjpz ssvip360 com 入门赠送稀有紫装+坐骑 每日5小时双倍经验时段 宠物技能随机自带暴击属性 高爆率福利服务器服务器地址:
-
龙族幻想摄影家酒德麻衣任务崩溃怎么办?手把手教你3步通关!
一、镜头卡在雕花窗的玄机那个戴圆框眼镜的茶馆伙计不要轻易送酒。他背后挂着的三枚铜板纪念章会召唤流动商人,交付第三张古画碎片时,别忘了让镜头对准柜台上的青花瓷罐——罐身上缠绕的龙纹会显形为密道机关。
-
新手必看!王牌战士灵敏度设置技巧,手残党也能秒变大神!
一、灵敏度调整三大黄金法则区分武器调校手枪建议设置2 5-3 0,保证近战走位同时快速点射。步枪与狙击枪需分别调至4 2和5 8,这个数值让AK系列自动步枪能实现90度瞬转,AWM狙击枪在移动中也能稳
-
魔域SF封神之路!血泪史+爆装备技巧,这篇必看!
一、三大职业的养成密码圣愈使徒的生存美学暗黑神殿副本中,治疗职业必须掌握「余光微光」预判机制。当BOSS释放深渊之拥时,提前在场地边缘布置光盾,可同时抵消群体嘲讽与削减治疗量的效果。暗黑龙骑的连击奥义
-
LOL自走棋入口藏哪儿?手把手教你秒登游戏不迷路!
一、解锁自走棋模式的三大关键操作客户端版本检测登录游戏后先检查更新,确保已下载2 0版本补丁。在右上角「客户端信息」处显示版本号为「2 0 4 227」才算完全准备好。隐藏入口精准定位点击游戏大厅左侧