初探 OpenAI GPT-4.1 性能：AI 编程能力大增，但谷歌 Gemini 依然称王

2025-04-16 09:29:46若宝软件园

本站 4 月 16 日消息，科技媒体 bleepingcomputer 昨日（4 月 15 日）发布博文，报道称 OpenAI 最新发布的 GPT-4.1 系列模型，其性能相比 GPT-4o 虽然实现重大飞跃，但多项跑分未能超越谷歌的 Gemini 系列。

本站昨日报道，OpenAI 公司发布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano，官方公布的跑分数据来看，这些模型在编程方面的能力，远超 GPT-4o 及 GPT-4o mini。

例如在 SWE-bench Verified 跑分中，GPT-4o 的得分为 21.4%，GPT-4.5 的得分为 26.6%，而 GPT-4.1 的得分为 54.6%。

尽管性能有较大提升，不过根据多位专家测试，相比较谷歌的 Gemini 系列，GPT-4.1 对比中却显露劣势。

根据 Stagehand（一款生产级浏览器自动化框架）发布的基准数据，Gemini 2.0 Flash 的错误率仅为 6.67%，精确匹配率高达 90%，且价格低廉、速度更快。相比之下，GPT-4.1 的错误率高达 16.67%，成本更是 Gemini 2.0 Flash 的 10 倍以上。

此外，哈佛大学 RNA 科学家 Pierre Bongrand 提供的数据也指出，GPT-4.1 的性价比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等竞品。

在编码专项测试中，GPT-4.1 同样未能占据上风。Aider Polyglot 的测试结果显示，GPT-4.1 的编码得分仅为 52%，而 Gemini 2.5 则以 73% 的成绩遥遥领先。

值得注意的是，GPT-4.1 被归类为非推理模型（non-reasoning model），但其编码能力仍属行业顶尖。

声明：本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人，不代表本站立场。文章及其配图仅供学习分享之

3819

555

上一篇：这次能兑现吗？马斯克押注今年实现特斯拉完全自动驾驶下一篇：Meta 逐梦元宇宙，4 年狂烧 450 亿美元却几乎未见成效

同类推荐更多

如何通过17c.com提升网站流量和SEO优化效果？

最火的全能攻略库

2025-03-24

17c com是一个提供全球网站流量分析、SEO工具、数据报告以及网络营销解决方案的平台。随着互联网的发展，越来越多的企业开始重视网站的SEO优化和流量分析。那么，如何利用17c com来提升自己网站的流量和优化效果呢？本文将为您详细解析如何使用17c com的各种功能，帮助您更好地理解和运用它。 17c com：全球网站流量分析的强大工具 17c com提供了一系列的全球网站流量分析工具，可以

新品榜/热门榜

资讯推荐更多