大模型排行榜到底哪个权威?

13 小时 12 分钟前
 fankcoder

Qwen3.8-max 出了,今天看排行榜 3 个榜 3 个名次,该信哪个呢?

  1. 排行第 4 https://arena.ai/leaderboard/code/webdev
  2. 排行第 7 https://llm-stats.com/
  3. 第十名之后去了 https://artificialanalysis.ai/leaderboards/models
5302 次点击
所在节点    程序员
41 条回复
wakarimasen
9 小时 53 分钟前
权威这两个字令人困惑。

如果你要权威数据应该看厂商发布的第一方数据
Wcowin
9 小时 50 分钟前
具体场景具体分析吧,适合自己就是最强的。
jonsmith
8 小时 30 分钟前
编程方面不看好 Qwen ,跟 Gemini 一样,跑分高、编程能力不行。
cabudad
8 小时 15 分钟前
什么排行榜都没有自己亲身使用权威,好不好用了才知道
SeleiXi
8 小时 10 分钟前
让 gpt 找一些比较新+作者比较权威的 benchmark 调研一下,一般比较老或者比较有影响力的早就过拟合过了
ybybwdwd
6 小时 48 分钟前
@cowcomic arena 是可以刷的,可以用提示词试出是哪个模型
levn
6 小时 37 分钟前
普通人类评价早就已经没用了在大多数时候
jark006
6 小时 35 分钟前
我比较信 DeepSWE
Bootis
6 小时 30 分钟前
escapefear
5 小时 27 分钟前
我奉行对标谁就用谁的原则
LK996
5 小时 21 分钟前
和手机评测一样,都是给够前就上的婊子,没有干净的
Znemo
5 小时 9 分钟前
哪个 Gemini 排名最低相信哪个。
William337
5 小时 8 分钟前
没有,需要自行判断,仅供参考
Haku
5 小时 3 分钟前
arean 是竞技场天梯,分数有保障,但是仅限前端(编程是只有前端)
aes114514gcm
4 小时 15 分钟前
@OumaeKumiko 8 楼的 https://llm2014.github.io/llm_benchmark 就是 toyama nao 的网站。个人感觉比较准确。
JerryZhi
4 小时 2 分钟前
目前普遍思路是采集十几个排行榜求平均(或者加权)
cellsyx
3 小时 46 分钟前
比较符合个人体验的是 DeepSWE (不包括前端设计能力)
FlashEcho
3 小时 20 分钟前
根据使用场景来的,如果你的需求只是和模型聊聊天,当成高级版豆包,那 Arena AI 其实最准
Glauben
2 小时 35 分钟前
我有一个疑问,5.6SOL codex 明明是 258K272K ,为什么这些排行榜上都是 1.1M
Mandelo
1 小时 52 分钟前
没一个权威的,或者说测试的东西和你工作用用到的完全不是一个东西。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1231896

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX