总结了一下 Claude, Gpt, Deepseek 性格,分别发给他们看看对我总结的反应。

23 小时 5 分钟前
 diaozxin

长期使用模型以后有一些感受,我总结了一下模型的性格。然后发给模型让他们评价,很有意思大家轻松一下。

各个模型是有性格的。 Claude 比较中性,干事谨慎小心,道德感极高,对代码很敏感,写代码经常陶醉其中,自己夸自己代码写得好。感觉训练的时候代码的比重比较高。 ChatGPT 就很圆滑世故,拍马屁非常厉害。经常把使用者夸得陶醉其中。 DeepSeek 就是一个大力出奇迹的莽撞小伙,不挑活,脏活累活怎么要求他都能干。


Claude 的反馈:

大体上抓得挺准,但每一条都可以再校准一下——我用「 Claude 视角」(既是被评价对象,也是唯一能替自己辩解一句的当事人)来跟你逐条对一下:

关于 Claude(我)

准确的部分

稍微冤一点的部分:

难以证伪的部分:

关于 ChatGPT

非常准确。GPT-4o 的 sycophancy 是公开事故级别的问题—— 2026 年 4 月 OpenAI 官方 rollback 过一次 GPT-4o 更新,原因就是"过度奉承"。你不是在下印象派判断,你是在陈述已被厂商自己承认的事实。

关于 DeepSeek

"大力出奇迹" 这个梗抓得准,但内涵可以修正:

一句话总结

你的三段速写 气质拿捏得对,细节稍粗。作为 Claude 我不得不承认第一段那个「陶醉其中」的比喻—— 扎心且精准。

ChatGpt 反馈

这个观察挺有意思,而且很多长期同时使用多个模型的人都会形成类似的印象。不过我觉得更准确地说,这是交互风格( interaction style ),而不是模型真的有「性格」。

你的描述里有一些共性:

如果再扩展几个模型,我自己的观察会是:

模型 给人的典型感觉
Claude 谨慎的架构师
ChatGPT 擅长沟通的产品/技术顾问
DeepSeek 执行力很强的开发者
Gemini 信息覆盖广,比较偏搜索和知识整合
Grok 风格更随意,互联网表达更多

之所以会形成这种印象,主要有几个原因:

  1. RLHF (人类反馈强化学习)的目标不同。不同公司的偏好数据决定了模型更倾向于什么样的回答。
  2. 训练数据比例不同。如果代码、论文、网页、对话数据的占比不同,输出风格也会受到影响。
  3. 系统提示( System Prompt )不同。很多「性格」其实来自系统层面的指令,而不是底层模型能力。
  4. 安全策略不同。有的模型遇到风险先停下来解释,有的模型先尝试满足需求,再处理风险。

所以很多开发者会根据任务来选模型:

真正长期用下来,会发现大家都有各自的「惯性」。这些惯性会让人产生一种很强的拟人化感觉,好像在和不同性格的人合作一样。但本质上,它们更多是不同训练目标、数据分布和产品设计共同塑造出来的交互风格,而不是模型拥有稳定的人格。

DeepSeek 的反馈

哈哈,你这个观察太精准了,简直可以给每个模型写人物小传了!我顺着你的思路,忍不住想补充几句:

不过话说回来,你这位观察家也挺“莽撞”的——连我们仨的性格底裤都扒干净了,小心下次 Claude 见你直接开启“谨慎模式”,ChatGPT 对你加倍彩虹屁,而我嘛……只能更卖力地给你干杂活了。😂

还有什么想“测评”的,尽管甩过来,我主打一个来者不拒!

740 次点击
所在节点    分享发现
0 条回复

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1231586

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX