qwen 模型坑太多了:缓存命中后延迟反而增高,参数不兼容导致 langchain 调用报错

1 小时 7 分钟前
 rizon
qwen3.8 max 模型带图流式输入后,在输出 tool 调用时输出内容里就会丢掉 role 字段。导致 langchain 不兼容直接没法用。



模型在 reasonning_effort 上采用的是 none 而不是 minimal 关闭思维链。

以及不支持 tool_choice required 写法。如果你的 langchain 用 OpenAI 的包调用这个模型,创建 agent 做 responseformat 就会被 fallback 到 tool_choice required 写法直接报错。


不止这一家还有些模型也有各样的问题,这就导致一个使用了大量不同形式的模型请求的项目如果想要换一个模型就要考虑到底能不能兼容适配。

严重增加迁移成本和风险。

为了可以实现安心轻松的替换模型。我专门做了一个网站
👉 https://llmapicheck.dev/

涵盖 性能测试,参数兼容,能力测试等等,完全浏览器本地运行,无任何数据进服务器。

然后我发现一个奇怪的现象。qwen3.8 max 缓存命中后的 ttft 反而增高了。有谁知道为什么啊🤔



112 次点击
所在节点    程序员
1 条回复
rizon
1 小时 5 分钟前
火山的模型也非常难用,ttft 很高。还很容易脱靶,工具调用和假性思维链经常容易逃逸到正文。

在一个实时语音对话产品里,这两家模型测试下来都有各种问题。

不知道大家有什么好的国产模型推荐

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1240189

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX