内容更新: 2026-10-09
ChatGPT vs Claude:公开评测分数对照
公开证据对照
先看共有测试,再自己验证
本页汇总双方共同出现在同一公开第三方评测中的结果,并标明精确模型版本与原始来源。条形图只比较同一测试内的分数,不能替代你用真实任务亲自试用。
ChatGPT vs Claude:差异集中在哪
公开评测快照里的差异
- 写作与代码口碑(LMArena):在 2026-10-09 抓取的 Arena 榜单里,文本类 Claude claude-opus-4-6-high 1505 Elo 排第 2,ChatGPT gpt-5.6-sol-xhigh 1484 排第 20;代码类 Claude claude-opus-5.5-max 1814(第 1)对 ChatGPT gpt-6-astra-max 1788(第 2)。搜索类例外:ChatGPT 1257(第 1)对 Claude 1253(第 2)。
- 能力分项(LiveBench):编程 Claude claude-sonnet-5-5-max-effort 91.4 排第 1(ChatGPT 83.9,第 7);Agentic Coding Claude 71.7(第 2)对 ChatGPT 57.3(第 21)。反过来,数据分析 ChatGPT 83.0 排第 1(Claude 80.5,第 4),推理 ChatGPT 92.7(第 1)对 Claude 92.2(第 2)几乎持平。写作相关(语言分项)Claude 90.7(第 1)对 89.4(第 3)。
- 真实代码修复(SWE-bench Verified):Claude 侧提交(Sonar Foundation Agent + Claude 4.5 Opus)修好 79.2%,排全榜第 1。被标成 ChatGPT 的最高分(JoyCode + Claude 4 Sonnet + GPT-4.1)为 74.6%,但这是混用 Claude 的智能体组合;ChatGPT 单独提交的最好成绩是 GPT 5.2 (high) 的 72.8%。
产品与使用条件的差异
- 访问与登录:两边都需要非中国大陆地区的访问条件与相应账号(claude.ai 与 chatgpt.com)。对中国大陆用户,这一对的同题实测门槛相同,选择主要看任务与订阅预算。
- 产品定位:Claude 在长文档阅读、代码重构与英文写作上口碑扎实(多项分项第 1);ChatGPT 的生态更广:搜索接入、图像生成、语音与插件矩阵。把「每天最重的那个任务」放进同题实测再决定。
- 价格与套餐:两边定价结构不同且经常调整,本页不引用具体数字。请在 Anthropic 与 OpenAI 定价页(见下方官方来源)核对当前套餐、免费额度与支付方式。
建议的同题实测任务
- 长文档任务:投喂同一份 50 页 PDF,要各自引用页码回答细节,核对谁记得住前后文
- 代码重构:同一段难读的代码要求「只改可读性不改行为」,跑测试确认谁真的没改坏(Claude 编程分项第 1)
- 联网核查:让两边对同一时效性问题给出带来源的答案,核对引用质量(ChatGPT 搜索类第 1)
怎么选:按你的任务落位
- 选 Claude,如果:你的高频任务是写作、长文精修与代码审阅。公开快照里它在这些分项多次排在第 1,输出风格也更保守。
- 选 ChatGPT,如果:你需要更宽的通用覆盖、图像与语音入口、以及更大的第三方工具生态。
- 不要只看这一个指标:两者几乎每项都处于前两名,差距小到不足以替代实测。用同一篇稿子、同一条 PR 各跑一次,比读分数更快得到结论。
这一对几乎每项都是前两名内斗:写作与代码 Claude 略优(多个分项第 1),搜索与数据分析 ChatGPT 略优,推理打平——差距小到值得用你自己的真实任务连续测一周,而不是看单一榜单。
快照证据的抓取时间与原始来源见下方评测表。实测任务请在你自己的账号上运行;本页提供证据与任务设计,不代你下结论。
公开评测怎么说
下面只展示这些模型共同出现在同一公开评测类别里的结果。不同来源的分数不能相加,也不能据此宣布谁全面更好。
Claude
8
在共有测试中分数更高的项目
ChatGPT
3
在共有测试中分数更高的项目
共有测试
11
不同来源的分数不能相加
Arena · 编程偏好
Arena 让用户在不知道模型身份的情况下选出更好的回答。Elo 越高,说明该类别里偏好票越多——并不等于产品的全面最优。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Claude | claude-opus-5.5-max | 1 | 1814 Elo | Elo (Elo) |
| ChatGPT | gpt-6-astra-max | 2 | 1788 Elo | Elo (Elo) |
Arena · 搜索类偏好
Arena 让用户在不知道模型身份的情况下选出更好的回答。Elo 越高,说明该类别里偏好票越多——并不等于产品的全面最优。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| ChatGPT | gpt-5.6-sol-xhigh | 1 | 1257 Elo | Elo (Elo) |
| Claude | claude-opus-4-6-search | 2 | 1253 Elo | Elo (Elo) |
Arena · 通用对话偏好
Arena 让用户在不知道模型身份的情况下选出更好的回答。Elo 越高,说明该类别里偏好票越多——并不等于产品的全面最优。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Claude | claude-opus-4-6-high | 2 | 1505 Elo | Elo (Elo) |
| ChatGPT | gpt-5.6-sol-xhigh | 20 | 1484 Elo | Elo (Elo) |
LiveBench · 智能体编程
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Claude | claude-opus-5-5-max-effort | 2 | 71.72 points | Category score (points) |
| ChatGPT | gpt-6-astra-max | 21 | 57.32 points | Category score (points) |
LiveBench · 编程任务
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Claude | claude-sonnet-5-5-max-effort | 1 | 91.37 points | Category score (points) |
| ChatGPT | gpt-5.6-sol-max | 7 | 83.94 points | Category score (points) |
LiveBench · 数据分析
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| ChatGPT | gpt-6-astra-max | 1 | 82.97 points | Category score (points) |
| Claude | claude-fable-5-max-effort | 6 | 80.54 points | Category score (points) |
LiveBench · 指令遵循
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Claude | claude-fable-5-max-effort | 6 | 75.77 points | Category score (points) |
| ChatGPT | gpt-6-astra-max | 8 | 75.58 points | Category score (points) |
LiveBench · 语言任务
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Claude | claude-fable-5-max-effort | 1 | 90.68 points | Category score (points) |
| ChatGPT | gpt-6.1-sol-max | 2 | 90.13 points | Category score (points) |
LiveBench · 数学
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Claude | claude-opus-5-5-max-effort | 1 | 97.08 points | Category score (points) |
| ChatGPT | gpt-6.1-sol-max | 3 | 96.83 points | Category score (points) |
LiveBench · 推理
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| ChatGPT | gpt-6-astra-max | 1 | 92.65 points | Category score (points) |
| Claude | claude-opus-5-5-max-effort | 3 | 92.15 points | Category score (points) |
SWE-bench Verified · 真实软件问题修复
SWE-bench Verified 衡量 AI 编程系统修好真实 GitHub 问题的比例。解决率越高,说明在该次测试设置中修好的问题越多。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Claude | Sonar Foundation Agent + Claude 4.5 Opus | 1 | 79.2% | Resolved (%) |
| ChatGPT | JoyCode + Claude 4 Sonnet + GPT-4.1 | 17 | 74.6% | Resolved (%) |
产品入口
亲自试用时可核对的事项
- 对你的真实任务,答案是否准确、完整,以及还需要多少人工修改。
- 当前套餐的配额、价格与地区可用性是否满足长期使用。
- 隐私条款、登录方式与团队协作是否符合你的工作要求。
更多有公开证据的模型对比
官方来源与核验时间
下列链接是本页产品身份与套餐信息的官方来源,最后核验于 2026-09-28。价格、可用模型、配额与地区限制可能变化,请在购买或部署前以官网为准。
- OpenAI ChatGPT plans and pricing - 2026-09-28
- Anthropic plans and pricing - 2026-09-28
常见问题
本页是否给出绝对排名?
不会。本站只在公开测试条件、原始来源与审校方法可核验时,才呈现限定条件下的结论;不会发布脱离场景的“全面最优”名单。
价格和套餐信息是否最终有效?
页面会链接官方来源并标注核验日期。购买或部署前,请以提供方官网及你所在地区显示的价格与条款为准。
ModelAny 会保存提示词吗?
ModelAny 采用本地优先设计:草稿、设置与历史保留在浏览器本地;提示词仅发送到你选择的 AI 服务,不会上传到 ModelAny 自有服务器。
用同一提示词比较多个模型
ModelAny 是免费的浏览器扩展,源码公开可审阅,已在 Chrome 网上应用店 与 Microsoft Edge 加载项 上架。草稿、设置与历史保留在浏览器本地。
安装扩展