文章目录+
01 / AI
不要让 logo 替你选答案
四个 chat 窗口,四个品牌,一个有点累的人问:“我应该用哪个?”网上通常马上颁奖,拿 benchmark screenshot 出来,或者宣布某个模型“赢了”——好像学生做 presentation 和 developer 修 code,是参加同一场拳赛。
它们不是同一种产品,即使四个都能写 email、解释 SEO,或者把混乱文字改得像样。ChatGPT 比较像多用途 assistant 加工作台;Gemini 和 Google 生态以及研究工具连接得更深;Claude 偏向细腻写作、长文件、coding 和可重复使用的 artifact;Perplexity 则是 search-first,重点是找来源、列 citation 和追查资料。这些是重心,不是铁律。
“最好用的 AI,通常是让你清楚下一步做什么的那个。” — 一个不花哨但比较稳妥的选择规则

想要一个全能起点,先试 ChatGPT;工作大量使用 Google Search、Gmail、Drive 或 NotebookLM,就试 Gemini;要修改长文、阅读大文件、写 code 或制作 artifact,就试 Claude;要找最新资料、尽早看到 citation,就先试 Perplexity。之后用同一个 prompt 自己跑一次,因为你的语言、plan 和工作会改变结果。
先说一句:app 名不等于 model 名。Plan、地区、用量、web access、可选 model 和 feature rollout 都会变化。六个月前写得很认真的 review,今天也可能已经过时。AI 比较有时比办公室 pantry 的切开水果更快变质。
02 / AI
四个工具其实想做什么?
| 工具 | 核心重心 | 通常哪类工作顺手 | 需要慢下来检查什么 |
|---|---|---|---|
| ChatGPT | 多用途 assistant 和工作台 | 混合工作:起稿、分析、coding、文件、图像、声音、project 和研究流程。 | 功能和 model 按 plan 有差异;写得流畅不等于一定正确。 |
| Gemini | 连接 Google 的多模态 assistant | Google Search 研究、Workspace、Canvas、NotebookLM、视觉和结构化解释。 | 来源、账户权限和 feature availability;连接 Google 不代表自动核实。 |
| Claude | 写作、推理、code 和 artifact 合作伙伴 | 长文件、改稿、code review、整理复杂想法、分享独立作品。 | 语气太漂亮会把不确定性缩小;web search 要看当前账户是否开启。 |
| Perplexity | Search-first 研究界面 | 快速找来源、直接 link、follow-up、不同搜索模式和 visible citations。 | Citation 只代表存在来源,不保证 synthesis 一定正确;最后品牌文案可能仍需修改。 |
目前产品功能以官方文档为基础:OpenAI 的 ChatGPT overview 和 capabilities 说明;Google 的 Gemini Deep Research、Canvas 和 Gems;Anthropic 的 web search 和 Artifacts;以及 Perplexity 的 Pro Search 说明。

把它们想成四位同事:ChatGPT 是转场很快的 generalist;Gemini 是已经坐在 Google 大楼里的同事;Claude 拿着红笔和大文件夹,喜欢干净结构;Perplexity 一进门就拿着一叠 receipts。重要资料不要交给任何一位单独决定,尤其是没人 check 的时候。
03 / AI
同一个 Prompt 实测:怎么避免作弊?
本文采用的 editorial benchmark prompt 如下,四个工具都应该贴同一段:
You are advising a Hong Kong student or working professional who wants to learn practical AI tools for research and marketing. Compare ChatGPT, Gemini, Claude, and Perplexity for this exact job: explain the difference between SEO and SEM for a Hong Kong business; recommend a realistic 30-day learning plan; cite current official sources; identify what may be outdated or uncertain; and finish with one clear recommendation for a beginner. Use plain English, a compact comparison table, and separate facts from your own judgement. Do not invent prices, rankings, or product features.
这条 prompt 故意不复杂,但很贴近日常:学生或在职人士要 AI 找资料、解释、做学习计划、列最新 citation,再讲清楚不确定性。也有一个小陷阱:SEO 和 SEM 很容易解释得似懂非懂,而 current product facts 如果没有 browsing,也很容易自行编造。
| 控制项目 | 四个测试都保持一样 | 为什么重要 |
|---|---|---|
| 日期时间 | 同一周运行,记录 model、plan 和 timestamp。 | 产品功能和 web 结果会变;没有日期的结果只完成了一半。 |
| Prompt | 连标点都照贴,不要看完一个答案才帮另一个改 prompt。 | 一改 prompt,就从比较变成偏好测试。 |
| 来源规则 | 全部要求 current official sources,重要 claim 自己打开 link。 | 有 citation 不代表 link 相关、没有过时或真的支持旁边句子。 |
| Context | 相同语言、不加额外文件、同一 follow-up policy、尽量一样的 browsing。 | 一个工具 upload 了 file,任务已经改变。 |
| 评分 | 准确性、来源质量、可用度、不确定性、香港相关性和 edit time。 | “我喜欢这个 tone”有用,但不是完整测试。 |
不要 Perplexity 开着 citation,另一个工具关闭 browsing,然后说某个 model 输了。这不是公平比赛,而是让图书馆员和一个被蒙住眼的人比赛找资料。功能不能完全拉平,就把差异本身记进产品体验。
这是实用产品比较,不是科学 benchmark。Model routing、plan limit、地区 rollout、system instruction 和实时 web 结果都会改变答案。测试方法可以重复,但不应该当作永久排名。
04 / AI
同一条 prompt,四个答案通常是什么味道?
| 测试项目 | ChatGPT | Gemini | Claude | Perplexity |
|---|---|---|---|---|
| 解释 SEO 和 SEM | 可按初学者或 technical level 快速调整,整体比较平均。 | 结构和 current-search framing 通常清楚,尤其开启 Search 时。 | 语气平稳、有条理,通常加入 caveat 但不会变成法律文件。 | 更 concise、source-forward,常先说明资料来源。 |
| 30 日学习计划 | 容易变成 steps、checklist、portfolio task。 | 如果涉及 Google tools、Workspace 或研究来源,会比较顺。 | 排序和教学感较好,适合整理成可以慢慢跟的文件。 | 找课程和工具资料方便,但计划仍要自己改得贴身。 |
| 最新官方来源 | 开启 web/research 后可以做,重要 link 仍需自己核对。 | Deep Research 默认使用 Google Search,视账户可加入 Drive、Gmail 等。 | 有 web search 时可以 grounding,但不要假设永远自动开启。 | Citation 和找来源是产品主场,Pro Search 尤其明显。 |
| 最后文字质量 | 风格弹性最大,适合 casual、professional、双语或格式化。 | 视觉、结构和 Google workflow 输出常有优势。 | 细腻改稿和长文连贯感通常舒服。 | 研究骨架好用,最后品牌 tone 可能要再改。 |
| 主要风险 | 有信心的 synthesis 可能混合已知、推论和生成内容。 | 连接资料会让人误以为答案已经自动验证。 | 文字很顺,错误假设反而更难及时发现。 | 一长串 citation 会像证明,但 source-to-claim 未必贴合。 |

这些是倾向,不是成绩表。Prompt 写得好,安静的工具也可以突然唱歌;prompt 写得差,再强的工具也可以煮出一锅汤。日常工作最明显的差别,很多时候不是 raw intelligence,而是产品帮助你找证据、保留 context、修改输出和走下一步有多顺。
做 SEO 更是这样。让 AI 列十个 keywords,你可能得到十个看起来都真的 phrase;让它区分搜索意图、为 claim 找来源、标记 assumptions,再提出可以在 Search Console 验证的 test,才真正测到判断力,而不是 autocomplete。
05 / AI
真正的取舍:来源、长 context、文件和 workflow
要 receipts
Perplexity 从一开始展示来源,适合想尽早看到 links 的研究。
要干净改稿
Claude 通常适合做长文、复杂 draft 的第二双眼。
要混合工具箱
一个工作从文件跳到分析、写作、声音或 code,ChatGPT 是好起点。
要 Google context
工作已经放在 Search、Drive、Gmail 或 NotebookLM,就值得先试 Gemini。
要持续使用
真正最好的是你理解它的限制和 context 规则,而且每周都会打开。
| Workflow 问题 | 选择前要检查 |
|---|---|
| 可以 browsing 吗? | Web access 是自动、可选、按 plan 限制,还是你的账户还没有? |
| 可以 citation 吗? | Citation 是否直接、相关,重要 claim 背后的 source 能不能打开? |
| 可以处理我的文件吗? | 看 file size、格式、隐私、context limit,以及回答是否真的用到了 file。 |
| 结果可以重复使用吗? | 看 Projects、Canvas、Artifacts、custom instructions、Gems、export、sharing 和 version。 |
| 团队使用安全吗? | 看账户类型、data control、connector、retention、permission 和客户资料规则。 |
| 香港语言自然吗? | 测试繁中、粤语味、英文 source terms,看会不会直译到市场没人这样搜索。 |
Google 当前 Gemini 文档说明 Deep Research 默认使用 Google Search,按功能和账户可以加入 Gmail、Drive、上传文件或 NotebookLM。Perplexity 说明 selected premium sources 和 direct citations;Anthropic 则说明 web search 要按当前界面或 workspace 设置开启。注意每段中的“可以”——account、plan 和 rollout 确实会影响。
不要为了比较 tone,就把客户机密 traffic report、客户名单、未发布产品或个人资料贴进四个 consumer account。省下二十分钟,但之后解释不了资料去了哪里,不叫划算。
香港还有一个小麻烦:语言切换。工具可以写出很标准的书面中文,却抓不到粤语 query 背后的搜索意图;或者把英文 SEO term 直译成市场根本不会搜索的词。保留原 query、翻译版本和母语读者 check,三样都要有。
06 / AI
学生或在职人士,应该用哪个?
| 你的情况 | 第一个测试组合 | 原因 |
|---|---|---|
| 学生做 report | Perplexity 找来源,再用 ChatGPT 或 Claude 重整和解释。 | 把找证据和写成论点分开。 |
| 学生学 marketing/SEO | ChatGPT 或 Gemini 做 guided practice,再用 Google 官方文档做事实基础。 | AI 可以教你,但 fundamentals 应该由官方文档 anchor。 |
| 在职人士写报告 | 用 Claude 和 ChatGPT 同时修改同一份 anonymised draft。 | 比较 instruction-following、修改质量和最后要改多少。 |
| 在职人士重度使用 Google Workspace | 先试 Gemini,尤其是 connected research 和文件流程。 | 生态连接节省的时间,可能比一两句 prose 差异更值钱。 |
| Marketer 做 current research | Perplexity 加开启 web research 的 Gemini/ChatGPT。 | 比较来源透明度、新鲜程度和核查时间。 |
| Developer 或 technical learner | ChatGPT 和 Claude 使用同一个 bug、spec 或 repository excerpt;工作靠 Google 就加试 Gemini。 | Code、context 和 trade-off 解释,比 generic chatbot 排名重要。 |

我的建议是养成两工具习惯,而不是四个 tab 宗教。用一个找或 challenge evidence,再用另一个整理 final work。分开两个角色,更容易发现一段漂亮句子其实没有稳固地板。
如果你只想选一个免费起点,就选你明天真的会打开的那个。理论上最强,但 workflow 麻烦到你不想用的工具,在你的生活里就不是最好。这不是哲学,是 calendar management 戴了一顶 AI 小帽。
07 / AI
一份可以重复的同 Prompt 评分表
| 项目 | 0 分 | 1–3 分 | 5 分 |
|---|---|---|---|
| 准确性 | 有重大错误或虚构产品功能。 | 大致正确,但 claim 没有支持或说得含糊。 | claim 准确、有边界,而且容易核实。 |
| 来源质量 | 没有来源或 link 不相关。 | 有少量相关 link,但 source-to-claim 需要重做。 | 主要使用当前 primary source,并贴着 claim。 |
| 工作可用度 | 泛泛而谈,谁都能套用。 | 有 outline,但要大幅重整。 | 有现实 plan、具体下一步和限制。 |
| 不确定性 | 把所有事情说得确定。 | 提到限制但没有说明位置。 | 分开 fact、inference、unknown 和下一步核查。 |
| 香港相关性 | 忽略语言、香港市场和实际 context。 | 提到香港但仍然很 generic。 | 自然处理香港语言、例子、搜索习惯和限制。 |
| Edit time | 几乎全部要重写。 | 需要中等 cleanup 和 fact check。 | 经过合理人工 review 后可以再用。 |
保存 raw answer、prompt、model name、plan、browsing status、timestamp、citation 和分数。没有这份记录,“Claude 好一点”或“Gemini 聪明一点”只是 office folklore,离下一份 PPT 只差一步。
- 第一读:有没有答中工作?写得漂亮但答非所问,仍然是 fail。逐项标记要求是否出现。
- 第二读:重要 claim 能不能核实?打开 source、看日期,拒绝只是碰巧有相同字眼的 link。
- 第三读:它假设了什么?留意受众、预算、地区、语言、产品等隐藏假设。
- 第四读:明天有什么用?保留真正减少工作量的 checklist、brief、table、experiment 或 decision。
- 最后读:哪里需要人签名?事实、隐私、客户 claim、金钱、法律和公开建议,都需要人负责。
顺口是 style result,不是 source、计算或保证。Receipts 要自己看。
08 / AI
FAQ:大家其实想要的直接答案
ChatGPT、Gemini、Claude、Perplexity 哪个最准确?
没有 universal winner,“准确”也取决于任务。开启 current search 的工具可能更适合今天的产品资料;context 强的工具可能更适合大文件;citation 清楚的工具更容易 audit。准确性要测试和核实,不是某个 app 永久拥有的 badge。
做 SEO 应该用哪个?
可以分工。Perplexity 或 Gemini 找 current sources 和 terminology;ChatGPT 或 Claude 把 verified brief 变成 outline、audit explanation 或客户 draft。但任何一个都不能替代 Search Console、Analytics、technical inspection、母语判断和你对公开 claim 的责任。
学生最适合哪个?
从帮助你理解而不是只帮助你交作业的那个开始。ChatGPT、Gemini 可以做 tutor 和 structure;Perplexity 让找来源更透明;Claude 可以帮你修改长文。让它解释、反驳和列 source,再自己写回一部分。老师通常看得出来。
在职人士应该怎么试?
用一个真实但 anonymised 的 workflow:meeting notes 变 action list、报告变 executive summary、研究变 recommendation,或者 brief 变 first draft。衡量 fact check 后节省多少时间,不要只衡量未核查前有多快。连接文件或粘贴客户资料前,先看公司规则。
有 citation 就可以相信吗?
不可以。Citation 改善 auditability,不会自动制造真相。自己打开 link,看它是否支持 exact claim、日期是否新,以及答案有没有把窄 source 扩大成一个大结论。
需要四个都付费吗?
大概不需要。先试免费或你已有的 access,选一个 primary tool;只有当另一个真正补到 specific gap——找来源、Google context、长文件、coding——再加第二个。四份 subscription,有时只是一个很贵的逃避选择 workflow 的方法。
用同一个 prompt,保存 raw output,评估 evidence 和 edit time,选择那个让你做决定更好、而不是网上争论声音最大的那个。
ChatGPT、Gemini、Claude 和 Perplexity 不是四道完全相同、通往同一个房间的门。它们是四条走廊,各有捷径,也有几道看起来可疑的门。走最贴近你实际工作的那一条,自己的 judgement 记得开着。
研究+图片来源
来源、产品备注与图片 credits
- OpenAI ChatGPT overview
- OpenAI ChatGPT capabilities
- OpenAI ChatGPT Pro 说明
- Google Gemini 3.1 Pro
- Google Gemini Deep Research
- Google Gemini Canvas
- Google Gemini Gems
- Anthropic Claude Opus 5
- Anthropic Claude Sonnet 4.6
- Anthropic web search 说明
- Anthropic Artifacts 说明
- Perplexity Pro Search
- Perplexity premium data sources
- Perplexity
图片来源
- 01-hku-lecture.jpg — 网上找到的真实课堂/工作坊照片,来源:www.thestandard.com.hk;图片直链。
- 02-uowhk-workshop.jpg — 网上找到的真实课堂/工作坊照片,来源:www.uowchk.edu.hk;图片直链。
- 03-polyu-hkcc-seminar.jpg — 网上找到的真实课堂/工作坊照片,来源:www.hkcc-polyu.edu.hk;图片直链。
- 04-digital-marketing-class.webp — 网上找到的真实课堂/工作坊照片,来源:ingoacademy.ntu.edu.tw;图片直链。
Research current through 2026-09-16 UTC. AI model names, plans, limits, web access, source connectors and product features can change; the comparison records public product documentation and a repeatable same-prompt method, not a permanent ranking. Image reuse rights remain with the original publishers or photographers. 产品功能、model routing、plan 和 availability 会变化;作出购买或工作决定前,请核对最新产品页面。