deepseek-flash 的第三方跑分趣闻

2 小时 8 分钟前
 sentinelK

这次的 flash-v4.1 的第三方跑分释放了,数据源如下: https://artificialanalysis.ai/models/deepseek-v4-1-flash?pricing=blended-price#intelligence-breakdown

总体上是预期水平( artificialanalysis.ai 刚刚调整了整个总分的权重和算法),但是发现了个有趣的点,值得玩味。

v4.1 的错误回答中,幻觉率非常大,也就是非常不懂装懂。

幻觉率的公式是:错误答案 /(错误答案 + 部分答案 + 未尝试回答)也就是说,他有 96%的错误情形都是硬装。而不是放弃或者只回答一部分。

这也就导致,v4.1 的平均任务花费 token 数,会更高(PS:GPT6 的平均 token 数确实很惊艳):

339 次点击
所在节点    DeepSeek
3 条回复
Insolitude
1 小时 45 分钟前
还真有这种感觉,用的自部署的 deepseek v4 flash ,在 Claude code 这种比较克制的 harness 上,容易代码没理清就开始提修复。到了 dsh 上,就比较奔放,问一个问题要从盘古开天辟地开始读代码,好处是确实看得比较透,坏处是 token 用量体感是 Claude 的 2-3 倍。
loveqianool
1 小时 11 分钟前
这上面怎么没有豆包呀。
sentinelK
1 小时 6 分钟前
@loveqianool 这个有个筛选条件,你可以自选筛选哪些模型进入表格。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1241313

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX