paopjian

不公平不严谨单一任务评估 LLM

  •  
  •   paopjian · 35 mins ago · 40 views
    目前有一个优化代码执行速度的任务,是个重度多卡并行任务, 我使用多个 LLM 阅读同一任务 md 从零启动写代码自己执行文件直到认为自己完成目标, 整理之后进行统一评估
    使用了 11 个模型,
    cc-opus5-max
    cc-opus5-medium
    codex-sol-max
    codex-sol-medium
    geminicli-gemini-3.8flash
    grok-grok-4.6
    dsh-deepseek-v4flash
    dsh-deepseek-v4pro
    cc-glm5.3-flash
    cc-glm5.3
    cc-qwen3.8max

    花费:
    glm5.3 花了 18 块没干完, 5.3flash 1 元多, 还用了 5.1 思考
    qwen10 块没干完,
    dsv4flash 1 块, v4pro 5 块,
    外国模型使用中转站:
    opus5 一共 8.6,
    solmax 有一次看到答案了重新测试 一共 30,
    grok 0.4,
    gemini 1

    统一重度压力评估速度: glm5.3flash > codex-sol-max(自己跑其他文件夹看到了答案) > grok > codex-sol-m > deepseek > deepseek-pro > gemini > codex-sol-max >基准> claude-opus > qwen > claude-opus-m (超时)

    主观体验:
    - 因为用的中转站, sol 卡得一逼, 超级慢, opus 有时候也抽风, 最近也是疯狂流口水, high 的消耗比 max 还大.
    - gemini grok 体验超快, 也很流畅, 就是 grok tui 不太习惯.
    - 国模这里 qwen 是最垃圾的, 阿里云太难用了 api 使用也写不清楚, 调用时还经常模型不可用.
    - ds 是在 chat 页面找不到 api 位置,还要搜索去官网.
    - glm 这里 api 也不好找, 可能是配置问题, 5.3flash 还用了 5.1 思考, 5.3 的雷霆大思考直接欠费了.

    所有模型输出后的文档地址: https://github.com/paopjian/eval_llm_in_one_task 我都放进去了

    这次评估下来我发觉如果只是一些研发对话+编码任务, 其实没有必要追求高端的 opus/sol, 国模/ds/grok 其实已经可以满足需求了, 只要能保证听懂人话去干活, 那么做出来就是时间快慢的问题, 而 flash 的速度真的快很多, 先出东西再详细优化, 而更加顶级的 Fable/Astra 没钱就不敢去试了.
    xiaofangcode
        1
    xiaofangcode  
       32 mins ago
    有价值!
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5481 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 35ms · UTC 08:17 · PVG 16:17 · LAX 01:17 · JFK 04:17
    ♥ Do have faith in what you're doing.