这可能是下一个周经帖:国产大模型哪个编程能力最顶?

2025 年 12 月 15 日
 kaesi0

如题,在不考虑价格的情况,目前国产大模型哪个编程能力最顶呢,以及各自的擅长领域,参赛的选手有:

GLM-4.6:说是 Claude Sonnet 4.5 和 GPT-5 ,但价格仅需要 Sonnet 1/7

Qwen3-Code:SWE-bench Live 测试中得分 54.7 ,超越 GPT-4.1 ( 48.6 ),中文 API 文档理解准确率达 92%

DeepSeek-V3.2-Exp:说是被 GLM4.6 超过,但在 Vercel 、Windsurf 等编程平台接入

MiniMax M2:每 token 成本仅为 Claude Sonnet 的 8%、在 Terminal-Bench 测试中得分 37.5 ,专为 Agent 工作流设计

11961 次点击
所在节点    程序员
69 条回复
dreamkuo
2025 年 12 月 15 日
我全测过一遍,结论是全是垃圾,不要在这上面浪费时间了,所谓的价格七分之一,但是你耗费的时间不只七倍,能力极差性价比极低,老老实实用 opus4.5 或者 gemini pro3 ,别的都是浪费生命 ------------- 我认可这个观点
kphiia
2025 年 12 月 15 日
别折磨自己了,用来编程一个都不行,就算免费它也得能干活才行
evilgod528
2025 年 12 月 15 日
@Saunak 日常主力就是 codex gpt5 ,sonnet 我感觉用下来没有 gpt5 质量好,gemini2.5pro 删过我项目心有余悸
streamrx
2025 年 12 月 15 日
都是垃圾。别浪费自己的时间
brookegas
2025 年 12 月 15 日
我现在的模式是,Claude Opus 4.5 给方案
Deepseek v3.2 执行

Minimax M2:刚开始我是它的粉丝,尤其是看到 openrouter 上它在 Cline 选用的模型里排前三,往往仅次于 Claude 家(现在又来了 Gemini 3pro ),这是老外每天真金白银投出来的,不过上次被它无声无息把我的文件删掉重写,所有的样式都按它的想法重改了以后,就不太敢用了。希望它的新版本改进些吧,我还会试用的!

Deepseek v3.2:12 月 1 日更新的这个版本运行得很好,速度飞快,而且实在太便宜了,便宜得我用得都不好意思了。跟 Claude 这种血盆大口贪婪吞噬我钱钱的怪兽相比,Deepseek 简直是慈眉善目的大善人!它真正的缺点很少有人提到,就是上下文窗口从 1 月发布到 12 月都没有增长过,一直只有 128K !导致我必须把任务拆细了喂给它,不能给整坨的,不过这样也好,保持了自己对整个代码的掌控感。

每次我想指责 Deepseek 的时候,看了它清一色的清北浙科南组成的开发团队名单,就讪讪地把话吞了回去,哈哈!
gegeligegeligo
2025 年 12 月 15 日
@sunny352787 opus 还是太贵了,没必要,就用普通的 4.5 就行了
kaesi0
2025 年 12 月 15 日
@abc0123xyz 目前在用
kaesi0
2025 年 12 月 15 日
@sunny352787 这么绝对的么
securityCoding
2025 年 12 月 15 日
我在用企业版 cusor ,唯一真神是 opus 其次是 sonnet ,gpt5.2 跟 gemini3pro 都差点意思
kaesi0
2025 年 12 月 15 日
@cleveryun tare 和 iflow 给钱了啊
kaesi0
2025 年 12 月 15 日
kaesi0
2025 年 12 月 15 日
@Wh1t3zZ 貌似运维的活也也干得好
kaesi0
2025 年 12 月 15 日
简单总结下本周 PK 结果:

一边倒的推荐 GPT/Gemini/Claude 最近的一两代模型。目前来看国内大模型编程能力和御三家还有很大差距,如果是奔着出活儿去的,就选择这三家模型,首推 Claude Opus ,缺点就是价格太高。

当然国产大模型也不是全军覆没

GLM-4.6 口碑不错,用来做调度还是小任务可以胜任,但是最近降智明显 @midsolo @defaw @vevlins @derek80

Qwen3-Coder 完成一些独立模块可用,写 Rust 感觉也写得不错 @Wh1t3zZ

DeepSeek-V3.2 做小修改,matlab 可以胜任 @veni2023 @yxc246800

kimi-for-coding

建议的工作方式:用 GPT Claude Gemini 给你出方案,让国产 llm 干活 @usVexMownCzar @brookegas

感谢各位大佬的反馈~
uuundefined
2025 年 12 月 15 日
御三家降智了是垃圾, 国内的满智都是垃圾。。。一点点差异就会让误差越来越大, 啥时候真的能无视 token 的多 agent 互相协作监督才行
linch97
2025 年 12 月 16 日
@seven777 豆包排前面你认真的?国产模型编码能力前几位再怎么也排不到豆包啊
wanghoi
2025 年 12 月 16 日
你看 SWE-Bench Verified 排名就是了:
排第一的大模型不是国外的,是国产:TRAE + Doubao-Seed-Code
skuuhui
2025 年 12 月 16 日
没有不行的模型,只有不行的人。1.不要相信任何网站上的实验室数据。2.针对模型调整合适的 ai coding 范式。3. transformer 架构的大模型一定是预测而不是真正“理解”。
unco020511
2025 年 12 月 16 日
Qwen 吧,不过没用过国产模型来编程,没啥发言权
edisonwong
2025 年 12 月 16 日
gemini 是真神。让写了几个 ppt ,gemini 毫不夸张的说,我可以直接交上去,不用改。图片,文字都是上乘。qwen ,豆包啥玩意,生成的图片完全无法再 ppt 上使用,而且图片里带文字的错误的概率比 gemini 高多了
neptuno
2025 年 12 月 16 日
不考虑价格的情况下,应该直接用国外大模型,套餐开到顶配

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1178906

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX