Qwen3.8-max 出了,今天看排行榜 3 个榜 3 个名次,该信哪个呢?
Qwen3.8-max 出了,今天看排行榜 3 个榜 3 个名次,该信哪个呢?
1
vzextreme 10h 19m ago
看厂商对哪家测评机构特调🐶
|
3
cowcomic 10h 11m ago
arena 是匿名对比得分,这类稍微更偏向普通人的感官,我个人比较倾向这种竞技场排行的
其他数据集评测的主要还是看测试数据分布和泄露情况了 中文也有榜单 https://www.superclueai.com/homepage |
4
tcper 10h 10m ago 看评分标准,
arena 就是通过匿名选择喜好,体现用户体验 llm-stats 是多个评分集的聚合 AA 自建评测集,这些集体现大模型对未知问题的推理能力 不过客观来说,llm-stats 的聚合更能体现全面成绩,因为就算刷烂的题目成绩很好也不错了,起码能覆盖日常遇到的问题,并不是大模型都要去解决未知问题。 |
5
lel020 10h 9m ago
牛马 agent 使用还是得看社区评价,什么跑分都靠不住,
|
6
Bootis 9h 55m ago
arena 都是 one shot 提示词任务,大型工程的复杂任务能力看这个榜单参考价值不大
|
8
opeth 9h 53m ago
我基本上就看 artificial analysis 和最强野榜 https://llm2014.github.io/llm_benchmark
|
9
wang93wei 9h 51m ago
我个人觉得 DeepSWE 这个更权威一些。https://deepswe.datacurve.ai/
|
10
klion 9h 48m ago https://artificialanalysis.ai/leaderboards/models 里面重点关注这几个指标就知道,这些才是真正的模型智能
Terminal-Bench Hard AA-Omniscience Accuracy Humanity’s Last Exam GPQA Diamond |
11
xiaoxixi 9h 29m ago
好多排行站,之前都没关注过
|
12
soulflysimple123 9h 11m ago
看 https://artificialanalysis.ai/
我看 Qwen3.8-max 里面还没有 |
13
sillydaddy 8h 51m ago
我目前只看 arena ,它是基于两两比赛得到的,裁判是广大用户。
|
14
rich1e 8h 1m ago
排行榜上的权威与真实体验,一些情况下并不相符合
就像,在国产模型上使用 CC ,编程体验也还不错,但是遇到一些特定场景(视频分析 / 复杂逻辑推理),可能就不能工作 - 视频分析时,可能会用到 claude vision - 复杂逻辑推理,会触发多个模型之间并行工作( Opus / Haiku / Sonnet ) 以上这些,如果模型没有适配,CC 就无法工作 所以,大模型排行榜看看就好,权威也改变不了真实体验 推荐这个,https://x.com/karpathy/status/2083749667410727319 |
15
nakun233 7h 53m ago
当然是 DeepSWE 1.1
|
16
kuhung 7h 34m ago
我个人还关心价格,即性价比。到了当前阶段,模型提升带来的体验上升已经很难如年初 opus4.6 那样了。我自己写了一个 https://www.traktoken.com/ 用来比价。此外,开发过程中还发现国外金融机构在观测 token 支出指数,用来指导投资,所以复现了一个 https://www.traktoken.com/spend-index 。从落地页来看,后者目前占一半的流量。
|
17
sxbaixing 7h 28m ago
千问向来是跑分高,体验差
|
18
mmdsun 7h 21m ago via iPhone
论知名度还是 arena 靠谱
|
19
OumaeKumiko 7h 15m ago
竟然还没有人发东山奈央的😂 俺也不知道是否权威
[toyama nao - 知乎]( https://www.zhihu.com/people/toyama) |
20
uncleroot 7h 11m ago
不知道有没有各种语言的“人味”排行。机器味太重了
|
21
wakarimasen 7h 6m ago via Android
权威这两个字令人困惑。
如果你要权威数据应该看厂商发布的第一方数据 |
22
Wcowin 7h 3m ago
具体场景具体分析吧,适合自己就是最强的。
|
23
jonsmith 5h 43m ago
编程方面不看好 Qwen ,跟 Gemini 一样,跑分高、编程能力不行。
|
24
cabudad 5h 27m ago
什么排行榜都没有自己亲身使用权威,好不好用了才知道
|
25
SeleiXi 5h 23m ago
让 gpt 找一些比较新+作者比较权威的 benchmark 调研一下,一般比较老或者比较有影响力的早就过拟合过了
|
27
levn 3h 50m ago
普通人类评价早就已经没用了在大多数时候
|
28
jark006 3h 47m ago
我比较信 DeepSWE
|
29
Bootis 3h 43m ago
|
30
escapefear 2h 40m ago
我奉行对标谁就用谁的原则
|
31
LK996 2h 34m ago
和手机评测一样,都是给够前就上的婊子,没有干净的
|
32
Znemo 2h 21m ago
哪个 Gemini 排名最低相信哪个。
|
33
William337 2h 21m ago
没有,需要自行判断,仅供参考
|
34
Haku 2h 16m ago via Android
arean 是竞技场天梯,分数有保障,但是仅限前端(编程是只有前端)
|
35
aes114514gcm 1h 28m ago
@OumaeKumiko 8 楼的 https://llm2014.github.io/llm_benchmark 就是 toyama nao 的网站。个人感觉比较准确。
|
36
JerryZhi 1h 15m ago
目前普遍思路是采集十几个排行榜求平均(或者加权)
|
37
cellsyx 58 mins ago
比较符合个人体验的是 DeepSWE (不包括前端设计能力)
|
38
FlashEcho 33 mins ago
根据使用场景来的,如果你的需求只是和模型聊聊天,当成高级版豆包,那 Arena AI 其实最准
|