foryou2023
V2EX  ›  问与答

使用 deepseek,外接视觉模型有什么好的便宜的方案推荐

  •  
  •   foryou2023 · 1h 44m ago · 252 views

    deepseek 不是多模态,在实际的使用中写 UI 确实差点意思,感觉好麻烦,特别是调 UI 的时候,感觉不好沟通。

    目前实践制作 UI 的流程是让 deepseek 绘制 ascii UI 布局,确定布局之后,就整理提示词使用 gemini 的

    stitch 制作原型图,原型图确定了再回到 deepseek 里面制作界面。

    实际的过程中就会遇到一些小问题,比如网站 一下 UI 细节或者按钮的大小不一致,deepseek 无法看到,文字

    描述的话,deepseek 没有办法一次性搞定。

    所以想求一个比较好的使用方案能解决 deepseek 做 UI 视觉上面碰到的问题。

    6 replies    2026-08-07 17:06:20 +08:00
    smy14520
        1
    smy14520  
       1h 39m ago   ❤️ 1
    claude code 中使用 智谱的视觉 mcp 多模模型可以自己选一个也可以用 智谱自己的 4.6v
    foryou2023
        2
    foryou2023  
    OP
       1h 36m ago
    @smy14520 感谢,我去试试
    yinyu
        3
    yinyu  
       1h 35m ago
    我自己做了个 OCR 的脚本其实就是调用视觉模型,我可以分享下经验,我试过百炼的 qwen3.6-flash 但是不够 flash ,中大的一张图就得花十秒左右。我让 codex 写脚本测试了 groq/cerabras/google 提供的视觉模型,最终发现同样的图,最快并且准确的最高(因为我是识别理财平台的持仓之类的一些信息,准确度很重要)的是
    ~/.hammerspoon master* ❯ cat remote_ocr.lua|grep gemini
    M.model = "gemini-3.5-flash-lite"
    ~/.hammerspoon master* ❯


    如果你对数字不敏感,其实 groq 和 cerebras 的视觉模型能够更快,描述一个布局什么的,小意思。

    但是其实。你也可以让 Agent 通过 MCP 直接链接浏览器,这样就可以更具体的知道真实效果。
    l84
        4
    l84  
       1h 22m ago
    sensenova
    CykaBlyat
        5
    CykaBlyat  
       1h 19m ago
    我是调用了火山的豆包识图
    foryou2023
        6
    foryou2023  
    OP
       59 mins ago
    @yinyu
    @l84
    @CykaBlyat 感谢回复
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   4264 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 28ms · UTC 10:05 · PVG 18:05 · LAX 03:05 · JFK 06:05
    ♥ Do have faith in what you're doing.