使用 deepseek,外接视觉模型有什么好的便宜的方案推荐

8 月 7 日
 foryou2023

deepseek 不是多模态,在实际的使用中写 UI 确实差点意思,感觉好麻烦,特别是调 UI 的时候,感觉不好沟通。

目前实践制作 UI 的流程是让 deepseek 绘制 ascii UI 布局,确定布局之后,就整理提示词使用 gemini 的

stitch 制作原型图,原型图确定了再回到 deepseek 里面制作界面。

实际的过程中就会遇到一些小问题,比如网站 一下 UI 细节或者按钮的大小不一致,deepseek 无法看到,文字

描述的话,deepseek 没有办法一次性搞定。

所以想求一个比较好的使用方案能解决 deepseek 做 UI 视觉上面碰到的问题。

1526 次点击
所在节点    问与答
6 条回复
smy14520
8 月 7 日
claude code 中使用 智谱的视觉 mcp 多模模型可以自己选一个也可以用 智谱自己的 4.6v
foryou2023
8 月 7 日
@smy14520 感谢,我去试试
yinyu
8 月 7 日
我自己做了个 OCR 的脚本其实就是调用视觉模型,我可以分享下经验,我试过百炼的 qwen3.6-flash 但是不够 flash ,中大的一张图就得花十秒左右。我让 codex 写脚本测试了 groq/cerabras/google 提供的视觉模型,最终发现同样的图,最快并且准确的最高(因为我是识别理财平台的持仓之类的一些信息,准确度很重要)的是
~/.hammerspoon master* ❯ cat remote_ocr.lua|grep gemini
M.model = "gemini-3.5-flash-lite"
~/.hammerspoon master* ❯


如果你对数字不敏感,其实 groq 和 cerebras 的视觉模型能够更快,描述一个布局什么的,小意思。

但是其实。你也可以让 Agent 通过 MCP 直接链接浏览器,这样就可以更具体的知道真实效果。
l84
8 月 7 日
sensenova
CykaBlyat
8 月 7 日
我是调用了火山的豆包识图
foryou2023
8 月 7 日
@yinyu
@l84
@CykaBlyat 感谢回复

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1232764

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX