内容更新: 2026-10-09

ChatGPT vs Gemini:公开评测分数对照

公开证据对照

先看共有测试,再自己验证

本页汇总双方共同出现在同一公开第三方评测中的结果,并标明精确模型版本与原始来源。条形图只比较同一测试内的分数,不能替代你用真实任务亲自试用。

ChatGPT vs Gemini:差异集中在哪

公开评测快照里的差异

  • 指令遵循与真实代码修复:在 2026-09-29 抓取的公开快照里,有两项是 Gemini 领先的:LiveBench 指令遵循 gemini-3.8-flash-high 81.4 排全榜第 1(ChatGPT 75.6,第 8);SWE-bench Verified 上 Gemini 侧提交(live-SWE-agent + Gemini 3 Pro Preview)修好 77.4%(第 4)。被标成 ChatGPT 的最高分 74.6% 来自 JoyCode + Claude 4 Sonnet + GPT-4.1,不是独立 ChatGPT 配置。
  • 推理、数据与搜索类:其余分项 ChatGPT 全面领先:推理 92.7(第 1)对 Gemini 89.3(第 16);数据分析 83.0(第 1)对 78.5(第 21);Arena 搜索类 1257(第 1)对 1210(第 9);代码偏好 1792(第 2)对 1593(第 23)。文本偏好例外:Gemini 1492(第 10)略高于 ChatGPT 1483(第 19)。

产品与使用条件的差异

  • 访问与登录:Gemini 官网 gemini.google.com 需要Google 账号,中国大陆访问需相应网络条件;ChatGPT 同样需要非大陆地区的访问条件。两者的实测门槛相当。
  • 产品定位:Gemini 与 Google 全家桶(搜索接地、Workspace、Android 端)整合最深,长上下文窗口大;ChatGPT 的插件与多模态生态更成熟。已有 Google 工作流的团队值得把 Gemini 放进同题实测。
  • 价格与套餐:两边定价结构不同且经常调整,本页不引用具体数字。请在 Google One / Gemini 与 OpenAI 定价页(见下方官方来源)核对当前套餐与免费额度。

建议的同题实测任务

  1. 指令遵循:给一段含 5 条以上硬性格式要求的复杂提示词,核对谁一条不漏(Gemini 该分项第 1)
  2. 数据分析:给同一份带脏数据的表格,要求清洗思路 + 结论,核对谁的处理更可靠(ChatGPT 该分项第 1)
  3. 真实代码修复:把同一个未修复的报错分别交给两边,限定回答格式,核对谁的修复能直接跑通

怎么选:按你的任务落位

  • 选 Gemini,如果:你在意指令遵循与搜索类场景,并依赖 Google 生态(Workspace、Search、Android)的衔接。
  • 选 ChatGPT,如果:你需要覆盖更广的通用任务与成熟的插件、语音、图像工具链。
  • 不要只看这一个指标:这不是一边倒的对局:Gemini 拿下了部分第一,ChatGPT 在多数类别保持前列。两者差距的任务依赖性强,必须按你的场景实测。

这不是一边倒的对局:Gemini 拿下了指令遵循第 1 和 SWE-bench 更高的组合成绩,ChatGPT 则在推理、数据分析与代码偏好上领先。结合你已有的生态(Google 全家桶或 OpenAI 工具链)同题实测,比看总分更有意义。

快照证据的抓取时间与原始来源见下方评测表。实测任务请在你自己的账号上运行;本页提供证据与任务设计,不代你下结论。

公开评测怎么说

下面只展示这些模型共同出现在同一公开评测类别里的结果。不同来源的分数不能相加,也不能据此宣布谁全面更好。

ChatGPT

7

在共有测试中分数更高的项目

Gemini

4

在共有测试中分数更高的项目

共有测试

11

不同来源的分数不能相加

Arena · 编程偏好

Arena 让用户在不知道模型身份的情况下选出更好的回答。Elo 越高,说明该类别里偏好票越多——并不等于产品的全面最优。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-6-astra-max 2 1788 Elo Elo (Elo)
Gemini gemini-4-argon-high 9 1678 Elo Elo (Elo)

Arena · 搜索类偏好

Arena 让用户在不知道模型身份的情况下选出更好的回答。Elo 越高,说明该类别里偏好票越多——并不等于产品的全面最优。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-5.6-sol-xhigh 1 1257 Elo Elo (Elo)
Gemini gemini-3.1-pro-grounding 9 1210 Elo Elo (Elo)

Arena · 通用对话偏好

Arena 让用户在不知道模型身份的情况下选出更好的回答。Elo 越高,说明该类别里偏好票越多——并不等于产品的全面最优。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
Gemini gemini-4-argon-high 1 1525 Elo Elo (Elo)
ChatGPT gpt-5.6-sol-xhigh 20 1484 Elo Elo (Elo)

LiveBench · 智能体编程

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
Gemini gemini-3.7-flash-high 19 58.28 points Category score (points)
ChatGPT gpt-6-astra-max 21 57.32 points Category score (points)

LiveBench · 编程任务

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-5.6-sol-max 7 83.94 points Category score (points)
Gemini gemini-3.7-flash-high 29 78.89 points Category score (points)

LiveBench · 数据分析

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-6-astra-max 1 82.97 points Category score (points)
Gemini gemini-3.1-pro-preview-high 23 78.54 points Category score (points)

LiveBench · 指令遵循

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
Gemini gemini-3.8-flash-high 1 81.41 points Category score (points)
ChatGPT gpt-6-astra-max 8 75.58 points Category score (points)

LiveBench · 语言任务

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-6.1-sol-max 2 90.13 points Category score (points)
Gemini gemini-3.8-flash-high 7 87.79 points Category score (points)

LiveBench · 数学

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-6.1-sol-max 3 96.83 points Category score (points)
Gemini gemini-3.7-flash-high 21 93.47 points Category score (points)

LiveBench · 推理

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-6-astra-max 1 92.65 points Category score (points)
Gemini gemini-3.8-flash-high 18 89.29 points Category score (points)

SWE-bench Verified · 真实软件问题修复

SWE-bench Verified 衡量 AI 编程系统修好真实 GitHub 问题的比例。解决率越高,说明在该次测试设置中修好的问题越多。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
Gemini live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) 4 77.4% Resolved (%)
ChatGPT JoyCode + Claude 4 Sonnet + GPT-4.1 17 74.6% Resolved (%)

查看按场景整理的全部公开评测数据

产品入口

ChatGPT vs Gemini:官网与支持状态
产品提供方官方入口ModelAny
ChatGPT OpenAI 访问产品官网 ModelAny 当前支持
Gemini Google 访问产品官网 ModelAny 当前支持

亲自试用时可核对的事项

  • 对你的真实任务,答案是否准确、完整,以及还需要多少人工修改。
  • 当前套餐的配额、价格与地区可用性是否满足长期使用。
  • 隐私条款、登录方式与团队协作是否符合你的工作要求。

官方来源与核验时间

下列链接是本页产品身份与套餐信息的官方来源,最后核验于 2026-09-28。价格、可用模型、配额与地区限制可能变化,请在购买或部署前以官网为准。

常见问题

本页是否给出绝对排名?

不会。本站只在公开测试条件、原始来源与审校方法可核验时,才呈现限定条件下的结论;不会发布脱离场景的“全面最优”名单。

价格和套餐信息是否最终有效?

页面会链接官方来源并标注核验日期。购买或部署前,请以提供方官网及你所在地区显示的价格与条款为准。

ModelAny 会保存提示词吗?

ModelAny 采用本地优先设计:草稿、设置与历史保留在浏览器本地;提示词仅发送到你选择的 AI 服务,不会上传到 ModelAny 自有服务器。

用同一提示词比较多个模型

ModelAny 是免费的浏览器扩展,源码公开可审阅,已在 Chrome 网上应用店 与 Microsoft Edge 加载项 上架。草稿、设置与历史保留在浏览器本地。

安装扩展
安装扩展