内容更新: 2026-10-09

ChatGPT vs DeepSeek:公开评测分数对照

公开证据对照

先看共有测试,再自己验证

本页汇总双方共同出现在同一公开第三方评测中的结果,并标明精确模型版本与原始来源。条形图只比较同一测试内的分数,不能替代你用真实任务亲自试用。

ChatGPT vs DeepSeek:差异集中在哪

公开评测快照里的差异

  • 综合分项(LiveBench):在 2026-10-09 抓取的公开快照里,ChatGPT 代表配置在语言 90.13(第 2)、推理 92.65(第 1)、数学 96.83(第 3)、数据分析 82.97(第 1)领先;DeepSeek 的 deepseek-v4.1-flash-max 在 Agentic Coding 拿到 77.27、排全榜第 1,反超 ChatGPT 的 57.32(第 21)。编程这一项两家差距最大。
  • 人类偏好口吻(LMArena):代码类:ChatGPT gpt-6-astra-max 1792 Elo(第 2)明显高于 DeepSeek deepseek-v4.1-flash-max 1621(第 16);文本类两者仅差 6 分(1483 对 1477)——日常问答的盲测偏好几乎打平,代码场景差距才拉开。
  • 真实代码修复(SWE-bench Verified):被标成 ChatGPT 的最高分(JoyCode + Claude 4 Sonnet + GPT-4.1)修好 74.6%,但这是混用 Claude 的智能体组合,不是独立 ChatGPT 配置;ChatGPT 单独提交的最好成绩是 GPT 5.2 (high) 的 72.8%。DeepSeek V3.2 (high) 为 70%。

产品与使用条件的差异

  • 访问与登录:DeepSeek 官网 chat.deepseek.com 面向中国大陆用户可直接访问、手机号即可登录,开源权重可自部署;ChatGPT 需要非中国大陆地区的访问条件与相应账号。
  • 产品定位:ChatGPT 的英文任务、工具链与多模态覆盖更全;DeepSeek 以开放权重、推理与数学口碑见长,API 价格通常更低。若你的任务是中文为主、预算敏感,DeepSeek 的主场优势在榜单之外。
  • 价格与套餐:两边定价结构不同且经常调整,本页不引用具体数字。请在 DeepSeek 官网与 OpenAI 定价页(见下方官方来源)核对当前套餐、免费额度与 API 价格。

建议的同题实测任务

  1. 智能体式编程:给一个需要多步修改的真实小项目任务,观察谁更少中途丢失上下文(DeepSeek 在该分项排第 1)
  2. 多步推理:同一道多步题要求展示中间步骤,核对哪边的步骤经得起复算(ChatGPT 推理分项排第 1)
  3. 长对话续写:把同一段 20 轮对话分别接给两边,核对谁更早忘记前面的约束

怎么选:按你的任务落位

  • 选 ChatGPT,如果:你的工作覆盖语言、推理、数学与数据分析等多种任务,需要一处解决大部分场景;公开快照里它在这些类别均处于前列。
  • 选 DeepSeek,如果:你更看重开放权重、可自部署、API 成本与中文技术任务,且能接受部分类别落后于头部配置。
  • 不要只看这一个指标:公开快照覆盖面较广,但仍是特定测试与特定版本的结果。价格、区域可用性与长对话稳定性不在这些分数里。

公开快照里 ChatGPT 在语言、推理、数学、数据分析全面领先,但 DeepSeek 拿下了 Agentic Coding 单项第 1,且文本偏好几乎打平、大陆可直连——综合强不强看榜单,适不适合看你的任务与访问条件。

快照证据的抓取时间与原始来源见下方评测表。实测任务请在你自己的账号上运行;本页提供证据与任务设计,不代你下结论。

公开评测怎么说

下面只展示这些模型共同出现在同一公开评测类别里的结果。不同来源的分数不能相加,也不能据此宣布谁全面更好。

DeepSeek

1

在共有测试中分数更高的项目

ChatGPT

7

在共有测试中分数更高的项目

共有测试

8

不同来源的分数不能相加

LiveBench · 智能体编程

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
DeepSeek deepseek-v4.1-flash-max 1 77.27 points Category score (points)
ChatGPT gpt-6-astra-max 21 57.32 points Category score (points)

LiveBench · 编程任务

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-5.6-sol-max 7 83.94 points Category score (points)
DeepSeek deepseek-v4.1-flash-max 22 80.04 points Category score (points)

LiveBench · 数据分析

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-6-astra-max 1 82.97 points Category score (points)
DeepSeek deepseek-v4-flash-vision-exp 13 79.48 points Category score (points)

LiveBench · 指令遵循

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-6-astra-max 8 75.58 points Category score (points)
DeepSeek deepseek-v4-flash-vision-exp 26 70.96 points Category score (points)

LiveBench · 语言任务

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-6.1-sol-max 2 90.13 points Category score (points)
DeepSeek deepseek-v4-pro-0813 26 82.07 points Category score (points)

LiveBench · 数学

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-6.1-sol-max 3 96.83 points Category score (points)
DeepSeek deepseek-v4-pro-0813 16 95.09 points Category score (points)

LiveBench · 推理

LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT gpt-6-astra-max 1 92.65 points Category score (points)
DeepSeek deepseek-v4.1-flash-max 31 86.69 points Category score (points)

SWE-bench Verified · 真实软件问题修复

SWE-bench Verified 衡量 AI 编程系统修好真实 GitHub 问题的比例。解决率越高,说明在该次测试设置中修好的问题越多。

数据抓取时间: 2026年10月9日 11:09 · 查看原始排行榜

产品精确模型版本排名成绩指标
ChatGPT JoyCode + Claude 4 Sonnet + GPT-4.1 17 74.6% Resolved (%)
DeepSeek DeepSeek V3.2 (high) 46 70% Resolved (%)

查看按场景整理的全部公开评测数据

产品入口

ChatGPT vs DeepSeek:官网与支持状态
产品提供方官方入口ModelAny
ChatGPT OpenAI 访问产品官网 ModelAny 当前支持
DeepSeek DeepSeek 访问产品官网 ModelAny 当前支持

亲自试用时可核对的事项

  • 对你的真实任务,答案是否准确、完整,以及还需要多少人工修改。
  • 当前套餐的配额、价格与地区可用性是否满足长期使用。
  • 隐私条款、登录方式与团队协作是否符合你的工作要求。

官方来源与核验时间

下列链接是本页产品身份与套餐信息的官方来源,最后核验于 2026-09-28。价格、可用模型、配额与地区限制可能变化,请在购买或部署前以官网为准。

常见问题

本页是否给出绝对排名?

不会。本站只在公开测试条件、原始来源与审校方法可核验时,才呈现限定条件下的结论;不会发布脱离场景的“全面最优”名单。

价格和套餐信息是否最终有效?

页面会链接官方来源并标注核验日期。购买或部署前,请以提供方官网及你所在地区显示的价格与条款为准。

ModelAny 会保存提示词吗?

ModelAny 采用本地优先设计:草稿、设置与历史保留在浏览器本地;提示词仅发送到你选择的 AI 服务,不会上传到 ModelAny 自有服务器。

用同一提示词比较多个模型

ModelAny 是免费的浏览器扩展,源码公开可审阅,已在 Chrome 网上应用店 与 Microsoft Edge 加载项 上架。草稿、设置与历史保留在浏览器本地。

安装扩展
安装扩展