这次的 flash-v4.1 的第三方跑分释放了,数据源如下: https://artificialanalysis.ai/models/deepseek-v4-1-flash?pricing=blended-price#intelligence-breakdown
总体上是预期水平( artificialanalysis.ai 刚刚调整了整个总分的权重和算法),但是发现了个有趣的点,值得玩味。
v4.1 的错误回答中,幻觉率非常大,也就是非常不懂装懂。
幻觉率的公式是:错误答案 /(错误答案 + 部分答案 + 未尝试回答)也就是说,他有 96%的错误情形都是硬装。而不是放弃或者只回答一部分。
这也就导致,v4.1 的平均任务花费 token 数,会更高(PS:GPT6 的平均 token 数确实很惊艳):
这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。
V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。
V2EX is a community of developers, designers and creative people.