内容更新: 2026-10-09
DeepSeek vs Gemini:公开评测分数对照
公开证据对照
先看共有测试,再自己验证
本页汇总双方共同出现在同一公开第三方评测中的结果,并标明精确模型版本与原始来源。条形图只比较同一测试内的分数,不能替代你用真实任务亲自试用。
DeepSeek vs Gemini:差异集中在哪
公开评测快照里的差异
- 公开快照整体格局(2026-09-29 抓取):两边共同出现在 Arena 通用对话与编程偏好、以及 LiveBench 全部类别。Gemini 在语言(87.8 对 82.1)、推理(89.3 对 86.7)与指令遵循(81.4 对 71.0)上领先;DeepSeek 在智能体编程(77.3 对 58.3)、编程(80.0 对 78.9)、数据分析(79.5 对 78.5)与数学(95.1 对 93.5)上领先。除指令遵循外分差都不算大,属于同一梯队的不同侧重。
- 真实代码修复(SWE-bench Verified):Gemini 侧 77.4%(live-SWE-agent + Gemini 3 Pro Preview,列第 4),DeepSeek 侧 70.0%(DeepSeek V3.2 (high),列第 46)。两者都是「智能体框架 + 模型」的组合成绩,不能读成模型单独能力。
产品与使用条件的差异
- 访问与登录:DeepSeek 官网 chat.deepseek.com 面向中国大陆用户可直接访问、手机号即可登录;Gemini 官网需要相应地区的访问条件与 Google 账号。
- 产品定位:DeepSeek 以开放权重、API 与推理数学见长;Gemini 与 Google 生态(Search、Workspace、Android)深度绑定。一个偏技术集成,一个偏日常入口。
- 价格与套餐:两边定价结构差异较大且经常调整,本页不引用具体数字。请在 DeepSeek 官网与 Google 定价页(见下方官方来源)核对当前套餐与 API 价格。
建议的同题实测任务
- 中文长文摘要:同一份 3000 字材料,要求先给要点清单再给 200 字摘要,核对谁漏得更少
- 智能体编程:同一个多文件修改任务,要求先给计划再给改动,核对谁的方案能直接落地
- 事实核查:挑 5 条你确定答案的事实,看谁更容易一本正经地编造
怎么选:按你的任务落位
- 选 DeepSeek,如果:你在意大陆直连、开放权重与 API 集成,或需要更强的编程与智能体任务表现。
- 选 Gemini,如果:你依赖 Google 生态入口、需要更强的语言、推理与指令遵循表现,或看重搜索类场景。
- 不要只看这一个指标:两边的分数差普遍在一到三个百分点内,且部分项目使用不同配置。真正的分水岭是访问条件与生态入口,不是榜单名次。
这是两份分值接近的答卷:Gemini 在语言与推理略优,DeepSeek 在编程与智能体任务略优。选型的第一道门槛是你能不能顺畅打开它,第二道才是任务匹配度。
快照证据的抓取时间与原始来源见下方评测表。实测任务请在你自己的账号上运行;本页提供证据与任务设计,不代你下结论。
公开评测怎么说
下面只展示这些模型共同出现在同一公开评测类别里的结果。不同来源的分数不能相加,也不能据此宣布谁全面更好。
DeepSeek
4
在共有测试中分数更高的项目
Gemini
4
在共有测试中分数更高的项目
共有测试
8
不同来源的分数不能相加
LiveBench · 智能体编程
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| DeepSeek | deepseek-v4.1-flash-max | 1 | 77.27 points | Category score (points) |
| Gemini | gemini-3.7-flash-high | 19 | 58.28 points | Category score (points) |
LiveBench · 编程任务
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| DeepSeek | deepseek-v4.1-flash-max | 22 | 80.04 points | Category score (points) |
| Gemini | gemini-3.7-flash-high | 29 | 78.89 points | Category score (points) |
LiveBench · 数据分析
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| DeepSeek | deepseek-v4-flash-vision-exp | 13 | 79.48 points | Category score (points) |
| Gemini | gemini-3.1-pro-preview-high | 23 | 78.54 points | Category score (points) |
LiveBench · 指令遵循
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Gemini | gemini-3.8-flash-high | 1 | 81.41 points | Category score (points) |
| DeepSeek | deepseek-v4-flash-vision-exp | 26 | 70.96 points | Category score (points) |
LiveBench · 语言任务
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Gemini | gemini-3.8-flash-high | 7 | 87.79 points | Category score (points) |
| DeepSeek | deepseek-v4-pro-0813 | 26 | 82.07 points | Category score (points) |
LiveBench · 数学
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| DeepSeek | deepseek-v4-pro-0813 | 16 | 95.09 points | Category score (points) |
| Gemini | gemini-3.7-flash-high | 21 | 93.47 points | Category score (points) |
LiveBench · 推理
LiveBench 用定期更新的客观题目给模型打分。类别分数越高,说明该类任务上的测量表现更好——并不构成通用总排名。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Gemini | gemini-3.8-flash-high | 18 | 89.29 points | Category score (points) |
| DeepSeek | deepseek-v4.1-flash-max | 31 | 86.69 points | Category score (points) |
SWE-bench Verified · 真实软件问题修复
SWE-bench Verified 衡量 AI 编程系统修好真实 GitHub 问题的比例。解决率越高,说明在该次测试设置中修好的问题越多。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Gemini | live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) | 4 | 77.4% | Resolved (%) |
| DeepSeek | DeepSeek V3.2 (high) | 46 | 70% | Resolved (%) |
产品入口
亲自试用时可核对的事项
- 对你的真实任务,答案是否准确、完整,以及还需要多少人工修改。
- 当前套餐的配额、价格与地区可用性是否满足长期使用。
- 隐私条款、登录方式与团队协作是否符合你的工作要求。
更多有公开证据的模型对比
官方来源与核验时间
下列链接是本页产品身份与套餐信息的官方来源,最后核验于 2026-09-28。价格、可用模型、配额与地区限制可能变化,请在购买或部署前以官网为准。
- DeepSeek API models and pricing - 2026-09-28
- Google Gemini plans - 2026-09-28
常见问题
本页是否给出绝对排名?
不会。本站只在公开测试条件、原始来源与审校方法可核验时,才呈现限定条件下的结论;不会发布脱离场景的“全面最优”名单。
价格和套餐信息是否最终有效?
页面会链接官方来源并标注核验日期。购买或部署前,请以提供方官网及你所在地区显示的价格与条款为准。
ModelAny 会保存提示词吗?
ModelAny 采用本地优先设计:草稿、设置与历史保留在浏览器本地;提示词仅发送到你选择的 AI 服务,不会上传到 ModelAny 自有服务器。
用同一提示词比较多个模型
ModelAny 是免费的浏览器扩展,源码公开可审阅,已在 Chrome 网上应用店 与 Microsoft Edge 加载项 上架。草稿、设置与历史保留在浏览器本地。
安装扩展