这可能是下一个周经帖:国产大模型哪个编程能力最顶?

2025 年 12 月 15 日
 kaesi0

如题,在不考虑价格的情况,目前国产大模型哪个编程能力最顶呢,以及各自的擅长领域,参赛的选手有:

GLM-4.6:说是 Claude Sonnet 4.5 和 GPT-5 ,但价格仅需要 Sonnet 1/7

Qwen3-Code:SWE-bench Live 测试中得分 54.7 ,超越 GPT-4.1 ( 48.6 ),中文 API 文档理解准确率达 92%

DeepSeek-V3.2-Exp:说是被 GLM4.6 超过,但在 Vercel 、Windsurf 等编程平台接入

MiniMax M2:每 token 成本仅为 Claude Sonnet 的 8%、在 Terminal-Bench 测试中得分 37.5 ,专为 Agent 工作流设计

11961 次点击
所在节点    程序员
69 条回复
Wh1t3zZ
2025 年 12 月 15 日
Qwen3-Coder 我用来写一些独立的模块挺不错的,让他写完我再集成进自己的工程里,他写 Rust 感觉比我写得要好
NizumaEiji
2025 年 12 月 15 日
其他的没用过,glm 不怎么样。
最近试着拿他和 claude code 分析日志数据生成一份测试报告,80%的统计结果都是错误的,错误到了随便找一个指标自己写脚本统计一下发现偏差能超过 10 倍的那种。
这是我在花了 1.5 人日搞出来的东西,而且 ai 编程非常爱一次性搞出一大堆没用的废话让你读,每次看这些东西都跟玩大家来找茬一样,需要在一堆垃圾中找出来到底哪里有问题,然后给它提出来等着它接下来再生成一堆垃圾。
bbao
2025 年 12 月 15 日
在做的各位都是垃圾
defaw
2025 年 12 月 15 日
glm 没问题,我目前写的六轴机器人的正逆解,属于非常偏门的网上找不到参考答案的程序,我描述清楚的情况下,glm 不开思考模式都能写的又快又好,这说明逻辑面上模型能力没有问题。
你写个 crud 写个 UI 恨不得指望 1 句话让模型给你生成一个接口,多思考自己是否真的给到了模型需要的信息,然后再来评价模型
maxwel1
2025 年 12 月 15 日
“不不不,请不要误会,我不是针对你,我是说在做的各位。。。“
LUCIFERorCHRIS
2025 年 12 月 15 日
@cleveryun 我理解就是服务商不一样,说直白点就是阉割版,比在各类大模型官方开通付费 api 再自己调用慢一些、准确率低一些吧
craftsmanship
2025 年 12 月 15 日
@sunny352787 确实 大模型这玩意只想用最强的 用最少的次数搞定需求 用垃圾的反复折腾 改 prompt 重建 context 麻烦死了
derek80
2025 年 12 月 15 日
组合起来用,我用 glm4.6 写写文档,修修语法和测试问题。
veni2023
2025 年 12 月 15 日
ds 起码生产的 code 小修改下能跑起来
yxc246800
2025 年 12 月 15 日
我用 ds 写 matlab ,嘎嘎好使
randm
2025 年 12 月 15 日
Qoder 代码提示不行,但执行还可以的。
8355
2025 年 12 月 15 日
@sunny352787 太对了,当你在跟一个蠢的模型斗智斗勇半天的时候,再切换到一个聪明的模型一切都是顺理成章,得出结论就是这蠢东西根本没法用,我都用上 ai 了我还要写一堆东西来防止他出问题,整个就是本末倒置,白送都不用。
maix27
2025 年 12 月 15 日
It's a weekly question...
bs10081
2025 年 12 月 15 日
@Saunak 用 Claude Code 的話,他自己會切換,plan mode 的時候用 Opus ,其他時候執行用 Sonnet
icyalala
2025 年 12 月 15 日
直接御三家 GPT/Gemini/Claude 最近的一两代模型
本来 AI 就是拿来提效的,不要让 AI 反过来浪费你自己的时间
herun
2025 年 12 月 15 日
试过 kimi-k2 写前端,80%的情况下写的代码可用,不过有时候会不按要求来写代码,这时候切换到 Claude Sonnet ,一次提示就搞定了
momo31
2025 年 12 月 15 日
only chatgpt claude
vevlins
2025 年 12 月 15 日
日常工作主力开发 glm 4.6 超过两个月,没觉得 claude 有什么显著优势,我用 glm 做不好的任务交给 claude 也就那样。
mmdsun
2025 年 12 月 15 日
国产模型现在没那么差,GLM 还可以其他没有用过。
fcten
2025 年 12 月 15 日
用了一段时间 Qwen Code ,我的结论是完全可用。我自己把控架构,细节交给它。提效还是很明显的。

如果你想把 AI 当 CTO 来用那 Qwen Code 确实还不行。就算它能行我也不敢发布上线啊,毕竟出了问题是我背锅不是 AI 背锅。

另外 Qwen Code 免费。让我花钱上班那是不可能的。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1178906

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX