返回 AI

AI / 工具比较

ChatGPT、Gemini、Claude、Perplexity 有什么区别?同一 Prompt 实测比较

四个 AI 助手,一个 Prompt。不讲空泛冠军榜,逐项看清楚每个工具实际适合做什么。

01 / AI

不要让 logo 替你选答案

ChatGPT、Gemini、Claude 和 Perplexity 有重叠,但每个产品的重心不同。真正有用的问题不是哪个“最聪明”,而是哪个能以最少阻力处理你的工作、来源、文件、语言和 workflow。

四个 chat 窗口,四个品牌,一个有点累的人问:“我应该用哪个?”网上通常马上颁奖,拿 benchmark screenshot 出来,或者宣布某个模型“赢了”——好像学生做 presentation 和 developer 修 code,是参加同一场拳赛。

它们不是同一种产品,即使四个都能写 email、解释 SEO,或者把混乱文字改得像样。ChatGPT 比较像多用途 assistant 加工作台;Gemini 和 Google 生态以及研究工具连接得更深;Claude 偏向细腻写作、长文件、coding 和可重复使用的 artifact;Perplexity 则是 search-first,重点是找来源、列 citation 和追查资料。这些是重心,不是铁律。

“最好用的 AI,通常是让你清楚下一步做什么的那个。” — 一个不花哨但比较稳妥的选择规则
香港大学课堂内,学生跟随数字商业案例的真实照片
The Standard 发布的真实课堂照片。代表学生使用数字工具学习,不是四个产品的照片,也不代表任何产品效果。
快速答案

想要一个全能起点,先试 ChatGPT;工作大量使用 Google Search、Gmail、Drive 或 NotebookLM,就试 Gemini;要修改长文、阅读大文件、写 code 或制作 artifact,就试 Claude;要找最新资料、尽早看到 citation,就先试 Perplexity。之后用同一个 prompt 自己跑一次,因为你的语言、plan 和工作会改变结果。

先说一句:app 名不等于 model 名。Plan、地区、用量、web access、可选 model 和 feature rollout 都会变化。六个月前写得很认真的 review,今天也可能已经过时。AI 比较有时比办公室 pantry 的切开水果更快变质。

02 / AI

四个工具其实想做什么?

四个产品正在互相靠近,但核心重心仍然不同:多用途工作台、Google 生态 assistant、长文件合作伙伴,以及研究优先的答案引擎。
工具核心重心通常哪类工作顺手需要慢下来检查什么
ChatGPT多用途 assistant 和工作台混合工作:起稿、分析、coding、文件、图像、声音、project 和研究流程。功能和 model 按 plan 有差异;写得流畅不等于一定正确。
Gemini连接 Google 的多模态 assistantGoogle Search 研究、Workspace、Canvas、NotebookLM、视觉和结构化解释。来源、账户权限和 feature availability;连接 Google 不代表自动核实。
Claude写作、推理、code 和 artifact 合作伙伴长文件、改稿、code review、整理复杂想法、分享独立作品。语气太漂亮会把不确定性缩小;web search 要看当前账户是否开启。
PerplexitySearch-first 研究界面快速找来源、直接 link、follow-up、不同搜索模式和 visible citations。Citation 只代表存在来源,不保证 synthesis 一定正确;最后品牌文案可能仍需修改。

目前产品功能以官方文档为基础:OpenAI 的 ChatGPT overviewcapabilities 说明;Google 的 Gemini Deep ResearchCanvasGems;Anthropic 的 web searchArtifacts;以及 Perplexity 的 Pro Search 说明。

香港专业工作坊,参加者学习 AI screen-sharing workflow 的真实照片
UOW College Hong Kong 发布的真实工作坊照片。只代表人学习 AI workflow,不是产品比较测试,也不代表任何 vendor。

把它们想成四位同事:ChatGPT 是转场很快的 generalist;Gemini 是已经坐在 Google 大楼里的同事;Claude 拿着红笔和大文件夹,喜欢干净结构;Perplexity 一进门就拿着一叠 receipts。重要资料不要交给任何一位单独决定,尤其是没人 check 的时候。

03 / AI

同一个 Prompt 实测:怎么避免作弊?

公平测试要固定 prompt、任务、语言、日期、来源要求和输出格式,同时记录 web search、deep research、文件和 model 有没有开启。

本文采用的 editorial benchmark prompt 如下,四个工具都应该贴同一段:

四个工具共用同一个 Prompt

You are advising a Hong Kong student or working professional who wants to learn practical AI tools for research and marketing. Compare ChatGPT, Gemini, Claude, and Perplexity for this exact job: explain the difference between SEO and SEM for a Hong Kong business; recommend a realistic 30-day learning plan; cite current official sources; identify what may be outdated or uncertain; and finish with one clear recommendation for a beginner. Use plain English, a compact comparison table, and separate facts from your own judgement. Do not invent prices, rankings, or product features.

这条 prompt 故意不复杂,但很贴近日常:学生或在职人士要 AI 找资料、解释、做学习计划、列最新 citation,再讲清楚不确定性。也有一个小陷阱:SEO 和 SEM 很容易解释得似懂非懂,而 current product facts 如果没有 browsing,也很容易自行编造。

控制项目四个测试都保持一样为什么重要
日期时间同一周运行,记录 model、plan 和 timestamp。产品功能和 web 结果会变;没有日期的结果只完成了一半。
Prompt连标点都照贴,不要看完一个答案才帮另一个改 prompt。一改 prompt,就从比较变成偏好测试。
来源规则全部要求 current official sources,重要 claim 自己打开 link。有 citation 不代表 link 相关、没有过时或真的支持旁边句子。
Context相同语言、不加额外文件、同一 follow-up policy、尽量一样的 browsing。一个工具 upload 了 file,任务已经改变。
评分准确性、来源质量、可用度、不确定性、香港相关性和 edit time。“我喜欢这个 tone”有用,但不是完整测试。

不要 Perplexity 开着 citation,另一个工具关闭 browsing,然后说某个 model 输了。这不是公平比赛,而是让图书馆员和一个被蒙住眼的人比赛找资料。功能不能完全拉平,就把差异本身记进产品体验。

本文能下什么结论?

这是实用产品比较,不是科学 benchmark。Model routing、plan limit、地区 rollout、system instruction 和实时 web 结果都会改变答案。测试方法可以重复,但不应该当作永久排名。

04 / AI

同一条 prompt,四个答案通常是什么味道?

同一条混合 prompt 下,ChatGPT 往往最平均,Gemini 容易把研究和 Google context 放在一起,Claude 常有更完整的修订感,Perplexity 通常最早展示来源线索。
测试项目ChatGPTGeminiClaudePerplexity
解释 SEO 和 SEM可按初学者或 technical level 快速调整,整体比较平均。结构和 current-search framing 通常清楚,尤其开启 Search 时。语气平稳、有条理,通常加入 caveat 但不会变成法律文件。更 concise、source-forward,常先说明资料来源。
30 日学习计划容易变成 steps、checklist、portfolio task。如果涉及 Google tools、Workspace 或研究来源,会比较顺。排序和教学感较好,适合整理成可以慢慢跟的文件。找课程和工具资料方便,但计划仍要自己改得贴身。
最新官方来源开启 web/research 后可以做,重要 link 仍需自己核对。Deep Research 默认使用 Google Search,视账户可加入 Drive、Gmail 等。有 web search 时可以 grounding,但不要假设永远自动开启。Citation 和找来源是产品主场,Pro Search 尤其明显。
最后文字质量风格弹性最大,适合 casual、professional、双语或格式化。视觉、结构和 Google workflow 输出常有优势。细腻改稿和长文连贯感通常舒服。研究骨架好用,最后品牌 tone 可能要再改。
主要风险有信心的 synthesis 可能混合已知、推论和生成内容。连接资料会让人误以为答案已经自动验证。文字很顺,错误假设反而更难及时发现。一长串 citation 会像证明,但 source-to-claim 未必贴合。
香港学生市场营销讲座,投影幕展示 agency 和 in-house 比较的真实照片
PolyU HKCC 发布的真实市场营销讲座照片。只提供香港学生学习 context,不是任何 AI model 的 screenshot 或测试结果。

这些是倾向,不是成绩表。Prompt 写得好,安静的工具也可以突然唱歌;prompt 写得差,再强的工具也可以煮出一锅汤。日常工作最明显的差别,很多时候不是 raw intelligence,而是产品帮助你找证据、保留 context、修改输出和走下一步有多顺。

做 SEO 更是这样。让 AI 列十个 keywords,你可能得到十个看起来都真的 phrase;让它区分搜索意图、为 claim 找来源、标记 assumptions,再提出可以在 Search Console 验证的 test,才真正测到判断力,而不是 autocomplete。

05 / AI

真正的取舍:来源、长 context、文件和 workflow

按 workflow 选择,不要按单一 benchmark 选择。研究优先、Google 连接、长文件协作和多用途工作台,是在不同位置帮你节省时间。
01

要 receipts
Perplexity 从一开始展示来源,适合想尽早看到 links 的研究。

02

要干净改稿
Claude 通常适合做长文、复杂 draft 的第二双眼。

03

要混合工具箱
一个工作从文件跳到分析、写作、声音或 code,ChatGPT 是好起点。

04

要 Google context
工作已经放在 Search、Drive、Gmail 或 NotebookLM,就值得先试 Gemini。

05

要持续使用
真正最好的是你理解它的限制和 context 规则,而且每周都会打开。

Workflow 问题选择前要检查
可以 browsing 吗?Web access 是自动、可选、按 plan 限制,还是你的账户还没有?
可以 citation 吗?Citation 是否直接、相关,重要 claim 背后的 source 能不能打开?
可以处理我的文件吗?看 file size、格式、隐私、context limit,以及回答是否真的用到了 file。
结果可以重复使用吗?看 Projects、Canvas、Artifacts、custom instructions、Gems、export、sharing 和 version。
团队使用安全吗?看账户类型、data control、connector、retention、permission 和客户资料规则。
香港语言自然吗?测试繁中、粤语味、英文 source terms,看会不会直译到市场没人这样搜索。

Google 当前 Gemini 文档说明 Deep Research 默认使用 Google Search,按功能和账户可以加入 Gmail、Drive、上传文件或 NotebookLM。Perplexity 说明 selected premium sources 和 direct citations;Anthropic 则说明 web search 要按当前界面或 workspace 设置开启。注意每段中的“可以”——account、plan 和 rollout 确实会影响。

隐私不是 footnote

不要为了比较 tone,就把客户机密 traffic report、客户名单、未发布产品或个人资料贴进四个 consumer account。省下二十分钟,但之后解释不了资料去了哪里,不叫划算。

香港还有一个小麻烦:语言切换。工具可以写出很标准的书面中文,却抓不到粤语 query 背后的搜索意图;或者把英文 SEO term 直译成市场根本不会搜索的词。保留原 query、翻译版本和母语读者 check,三样都要有。

06 / AI

学生或在职人士,应该用哪个?

先按你每周重复的工作选择,再看哪个减少最多 friction。学生通常需要解释、查来源和做作品;在职人士更在意 context、文件、隐私和输出稳定性。
你的情况第一个测试组合原因
学生做 reportPerplexity 找来源,再用 ChatGPT 或 Claude 重整和解释。把找证据和写成论点分开。
学生学 marketing/SEOChatGPT 或 Gemini 做 guided practice,再用 Google 官方文档做事实基础。AI 可以教你,但 fundamentals 应该由官方文档 anchor。
在职人士写报告用 Claude 和 ChatGPT 同时修改同一份 anonymised draft。比较 instruction-following、修改质量和最后要改多少。
在职人士重度使用 Google Workspace先试 Gemini,尤其是 connected research 和文件流程。生态连接节省的时间,可能比一两句 prose 差异更值钱。
Marketer 做 current researchPerplexity 加开启 web research 的 Gemini/ChatGPT。比较来源透明度、新鲜程度和核查时间。
Developer 或 technical learnerChatGPT 和 Claude 使用同一个 bug、spec 或 repository excerpt;工作靠 Google 就加试 Gemini。Code、context 和 trade-off 解释,比 generic chatbot 排名重要。
数字营销课堂内,学习者讨论和分享实作的真实照片
iNGO Academy 发布的真实数字营销课堂照片。代表合作式学习,不是产品 endorsement,也不是 AI 生成图。

我的建议是养成两工具习惯,而不是四个 tab 宗教。用一个找或 challenge evidence,再用另一个整理 final work。分开两个角色,更容易发现一段漂亮句子其实没有稳固地板。

如果你只想选一个免费起点,就选你明天真的会打开的那个。理论上最强,但 workflow 麻烦到你不想用的工具,在你的生活里就不是最好。这不是哲学,是 calendar management 戴了一顶 AI 小帽。

07 / AI

一份可以重复的同 Prompt 评分表

评估你可以核实的输出,而不是第一眼最讨好的答案。用 30 分的简单评分,已经足够看出实质差异。
项目0 分1–3 分5 分
准确性有重大错误或虚构产品功能。大致正确,但 claim 没有支持或说得含糊。claim 准确、有边界,而且容易核实。
来源质量没有来源或 link 不相关。有少量相关 link,但 source-to-claim 需要重做。主要使用当前 primary source,并贴着 claim。
工作可用度泛泛而谈,谁都能套用。有 outline,但要大幅重整。有现实 plan、具体下一步和限制。
不确定性把所有事情说得确定。提到限制但没有说明位置。分开 fact、inference、unknown 和下一步核查。
香港相关性忽略语言、香港市场和实际 context。提到香港但仍然很 generic。自然处理香港语言、例子、搜索习惯和限制。
Edit time几乎全部要重写。需要中等 cleanup 和 fact check。经过合理人工 review 后可以再用。

保存 raw answer、prompt、model name、plan、browsing status、timestamp、citation 和分数。没有这份记录,“Claude 好一点”或“Gemini 聪明一点”只是 office folklore,离下一份 PPT 只差一步。

  1. 第一读:有没有答中工作?写得漂亮但答非所问,仍然是 fail。逐项标记要求是否出现。
  2. 第二读:重要 claim 能不能核实?打开 source、看日期,拒绝只是碰巧有相同字眼的 link。
  3. 第三读:它假设了什么?留意受众、预算、地区、语言、产品等隐藏假设。
  4. 第四读:明天有什么用?保留真正减少工作量的 checklist、brief、table、experiment 或 decision。
  5. 最后读:哪里需要人签名?事实、隐私、客户 claim、金钱、法律和公开建议,都需要人负责。
不要把流畅当成真相

顺口是 style result,不是 source、计算或保证。Receipts 要自己看。

08 / AI

FAQ:大家其实想要的直接答案

没有永久冠军。你需要全能 productivity、Google-connected work、长文协作,还是 citation-first research,答案会不同。

ChatGPT、Gemini、Claude、Perplexity 哪个最准确?

没有 universal winner,“准确”也取决于任务。开启 current search 的工具可能更适合今天的产品资料;context 强的工具可能更适合大文件;citation 清楚的工具更容易 audit。准确性要测试和核实,不是某个 app 永久拥有的 badge。

做 SEO 应该用哪个?

可以分工。Perplexity 或 Gemini 找 current sources 和 terminology;ChatGPT 或 Claude 把 verified brief 变成 outline、audit explanation 或客户 draft。但任何一个都不能替代 Search Console、Analytics、technical inspection、母语判断和你对公开 claim 的责任。

学生最适合哪个?

从帮助你理解而不是只帮助你交作业的那个开始。ChatGPT、Gemini 可以做 tutor 和 structure;Perplexity 让找来源更透明;Claude 可以帮你修改长文。让它解释、反驳和列 source,再自己写回一部分。老师通常看得出来。

在职人士应该怎么试?

用一个真实但 anonymised 的 workflow:meeting notes 变 action list、报告变 executive summary、研究变 recommendation,或者 brief 变 first draft。衡量 fact check 后节省多少时间,不要只衡量未核查前有多快。连接文件或粘贴客户资料前,先看公司规则。

有 citation 就可以相信吗?

不可以。Citation 改善 auditability,不会自动制造真相。自己打开 link,看它是否支持 exact claim、日期是否新,以及答案有没有把窄 source 扩大成一个大结论。

需要四个都付费吗?

大概不需要。先试免费或你已有的 access,选一个 primary tool;只有当另一个真正补到 specific gap——找来源、Google context、长文件、coding——再加第二个。四份 subscription,有时只是一个很贵的逃避选择 workflow 的方法。

最后建议

用同一个 prompt,保存 raw output,评估 evidence 和 edit time,选择那个让你做决定更好、而不是网上争论声音最大的那个。

ChatGPT、Gemini、Claude 和 Perplexity 不是四道完全相同、通往同一个房间的门。它们是四条走廊,各有捷径,也有几道看起来可疑的门。走最贴近你实际工作的那一条,自己的 judgement 记得开着。

研究+图片来源

来源、产品备注与图片 credits

  1. OpenAI ChatGPT overview
  2. OpenAI ChatGPT capabilities
  3. OpenAI ChatGPT Pro 说明
  4. Google Gemini 3.1 Pro
  5. Google Gemini Deep Research
  6. Google Gemini Canvas
  7. Google Gemini Gems
  8. Anthropic Claude Opus 5
  9. Anthropic Claude Sonnet 4.6
  10. Anthropic web search 说明
  11. Anthropic Artifacts 说明
  12. Perplexity Pro Search
  13. Perplexity premium data sources
  14. Perplexity

图片来源

Research current through 2026-09-16 UTC. AI model names, plans, limits, web access, source connectors and product features can change; the comparison records public product documentation and a repeatable same-prompt method, not a permanent ranking. Image reuse rights remain with the original publishers or photographers. 产品功能、model routing、plan 和 availability 会变化;作出购买或工作决定前,请核对最新产品页面。

想为未来 90 天做一套实用 AI workflow?

从你重复做的工作开始,用同一个 Prompt 测试,再由人保留最后决定权。

WhatsApp 联系 Locke Lee