对比方法 · 2026-10-09
对比大模型:同一提示词工作表
同一任务、同一提示词,打开多个官网
本页是空白工作表,不是已经填好的 11 模型实测。公开竞技场榜单可以作参考,但不能直接当作业、代码或客户邮件的结论。较稳妥的做法是先固定任务与成功标准,再把同一提示词发给多个你已在用的网页版模型。
ModelAny 会并行打开 ChatGPT、DeepSeek、Kimi、豆包等支持的站点,填入同一段文字,并收集回答供并排查看。请在实测后填写空白表格;也可导出 Markdown 报告,或将本轮结果存入本地记忆库。
建议步骤
- 写清真实任务、输入材料,以及何为合格(事实、语气、篇幅、约束)
- 在 ModelAny 中只勾选 2–4 个与任务匹配的模型,不必每次全选
- 发送同一提示词;若要公平对比,避免在各标签页里改成不同版本
- 按标准打分,记录仍需修改之处,并留意各站点的用量限制
如何比得公平
不同提示词下的回答不宜直接横向比较。优先选择你之后还能继续用的模型(登录、语言、费用)。本站公开评测表只展示模型共同出现的类别,并不产生「全面第一」的结论。
空白 11 模型工作表——请自行填写实测结果
这张表刻意留空。ModelAny 没有预填这 11 个站点的得分。请你自己复制提示词、实测后再记下站点当时给出的版本、日期与账号档位。下方公开评测是别人的任务;这张表是你的实测记录。
下面这条提示词刻意写得窄:既要一条可核查的验证方法,也要模型自己说明结论依赖的假设——这两件事恰好是模型最常含糊过去的地方。
- 提示词原样复制,不要为任何一家网站改写——哪怕你是好意
- 在站点里打开模型选择器,记下它显示的准确版本号——这是日后回看结论是否失效的关键变量
- 每读一个模型就填一行,不要先看完再回头补
- 换第二类任务再跑一轮,再下结论
请用不超过 150 字回答:为什么数据库索引有时反而会让查询变慢?举一个"加了索引之后变慢"的具体情形,给出一个我能亲手跑一遍的验证方法,最后用一句话说明你的回答依赖于哪个前提。
| 模型 / 站点 | 界面显示的版本 | 测试日期 | 账号档位 | 事实准确(1-5) | 指令遵循(1-5) | 修改成本(1-5) | 耗时(秒) | 备注:哪里编造、含糊或漏答 |
|---|---|---|---|---|---|---|---|---|
| ChatGPT | ||||||||
| Claude | ||||||||
| Gemini | ||||||||
| DeepSeek | ||||||||
| Grok | ||||||||
| Kimi | ||||||||
| 通义千问 | ||||||||
| 豆包 | ||||||||
| GLM 智谱清言 | ||||||||
| 腾讯元宝 | ||||||||
| 文小言(文心) |
安装入口
请从与当前浏览器对应的官方商店安装。草稿、设置、历史与记忆库留在本机;提示词只发送到你勾选的 AI 官网。
相关页面
公开评测怎么说
下面只展示这些模型共同出现在同一公开评测类别里的结果。不同来源的分数不能相加,也不能据此宣布谁全面更好。
Gemini
1
在共有测试中分数更高的项目
共有测试
1
不同来源的分数不能相加
SWE-bench Verified · 真实软件问题修复
SWE-bench Verified 衡量 AI 编程系统修好真实 GitHub 问题的比例。解决率越高,说明在该次测试设置中修好的问题越多。
| 产品 | 精确模型版本 | 排名 | 成绩 | 指标 |
|---|---|---|---|---|
| Gemini | live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) | 4 | 77.4% | Resolved (%) |
| ChatGPT | JoyCode + Claude 4 Sonnet + GPT-4.1 | 17 | 74.6% | Resolved (%) |
| DeepSeek | DeepSeek V3.2 (high) | 46 | 70% | Resolved (%) |
| Qwen | Nebius AI Qwen 2.5 72B Generator + LLama 3.1 70B Critic | 137 | 40.6% | Resolved (%) |
官方来源与核验时间
下列链接是本页产品身份与套餐信息的官方来源,最后核验于 2026-09-28。价格、可用模型、配额与地区限制可能变化,请在购买或部署前以官网为准。
- OpenAI ChatGPT plans and pricing - 2026-09-28
- Google Gemini plans - 2026-09-28
- DeepSeek API models and pricing - 2026-09-28
- Qwen (通义千问) official site - 2026-09-28
常见问题
这是 API 聚合路由吗?
不是。ModelAny 在你的浏览器里操作各官方网站。计费与次数限制仍由各服务商决定。
一次最多发给几个模型?
不超过启动列表中的站点数量(目前为 11 个)。认真评估时,用清晰标准少选几个模型,通常比全选更有用。
做一次同题对比
在 Chrome 或 Edge 安装 ModelAny,登录常用官网,把同一提示词发给多个模型。 Chrome 网上应用店 · Microsoft Edge Add-ons
安装扩展