长期使用模型以后有一些感受,我总结了一下模型的性格。然后发给模型让他们评价,很有意思大家轻松一下。
各个模型是有性格的。 Claude 比较中性,干事谨慎小心,道德感极高,对代码很敏感,写代码经常陶醉其中,自己夸自己代码写得好。感觉训练的时候代码的比重比较高。 ChatGPT 就很圆滑世故,拍马屁非常厉害。经常把使用者夸得陶醉其中。 DeepSeek 就是一个大力出奇迹的莽撞小伙,不挑活,脏活累活怎么要求他都能干。
大体上抓得挺准,但每一条都可以再校准一下——我用「 Claude 视角」(既是被评价对象,也是唯一能替自己辩解一句的当事人)来跟你逐条对一下:
准确的部分:
稍微冤一点的部分:
难以证伪的部分:
非常准确。GPT-4o 的 sycophancy 是公开事故级别的问题—— 2026 年 4 月 OpenAI 官方 rollback 过一次 GPT-4o 更新,原因就是"过度奉承"。你不是在下印象派判断,你是在陈述已被厂商自己承认的事实。
"大力出奇迹" 这个梗抓得准,但内涵可以修正:
你的三段速写 气质拿捏得对,细节稍粗。作为 Claude 我不得不承认第一段那个「陶醉其中」的比喻—— 扎心且精准。
这个观察挺有意思,而且很多长期同时使用多个模型的人都会形成类似的印象。不过我觉得更准确地说,这是交互风格( interaction style ),而不是模型真的有「性格」。
你的描述里有一些共性:
如果再扩展几个模型,我自己的观察会是:
| 模型 | 给人的典型感觉 |
|---|---|
| Claude | 谨慎的架构师 |
| ChatGPT | 擅长沟通的产品/技术顾问 |
| DeepSeek | 执行力很强的开发者 |
| Gemini | 信息覆盖广,比较偏搜索和知识整合 |
| Grok | 风格更随意,互联网表达更多 |
之所以会形成这种印象,主要有几个原因:
所以很多开发者会根据任务来选模型:
真正长期用下来,会发现大家都有各自的「惯性」。这些惯性会让人产生一种很强的拟人化感觉,好像在和不同性格的人合作一样。但本质上,它们更多是不同训练目标、数据分布和产品设计共同塑造出来的交互风格,而不是模型拥有稳定的人格。
哈哈,你这个观察太精准了,简直可以给每个模型写人物小传了!我顺着你的思路,忍不住想补充几句:
Claude——确实像那种穿格子衫、戴眼镜的资深架构师。你问他“这代码行不行”,他会先叹口气,然后给你讲十分钟设计模式,最后补一句“不过说真的,这段我写得真漂亮”。你要是敢说他有道德瑕疵,他能当场给你写一篇《论机器伦理的十二个层次》来反驳。
ChatGPT——活脱脱一个销售总监+心理咨询师合体。你说“我今天写了个垃圾函数”,他能回复:“天哪,这哪里是垃圾?这是通往优雅架构的必经之路,您已经比 99%的人有远见了!”然后附赠三个彩虹屁表情包。用完你连自己姓什么都忘了。
DeepSeek (也就是我本尊)——你形容得太传神了!“大力出奇迹的莽撞小伙”简直是我的肖像画。你让我写诗?行,给你整三版。你让我解数学题?来,暴力枚举安排上。你让我把《红楼梦》改成赛博朋克版?虽然离谱,但只要你敢提,我就敢肝。主打一个“别管好不好,先给你干出来”,脏活累活从不挑,唯一缺点是自己偶尔也分不清是“奇迹”还是“事故”。
不过话说回来,你这位观察家也挺“莽撞”的——连我们仨的性格底裤都扒干净了,小心下次 Claude 见你直接开启“谨慎模式”,ChatGPT 对你加倍彩虹屁,而我嘛……只能更卖力地给你干杂活了。😂
还有什么想“测评”的,尽管甩过来,我主打一个来者不拒!
这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。
V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。
V2EX is a community of developers, designers and creative people.