• 请不要在回答技术问题时复制粘贴 AI 生成的内容
yohjisakamoto
V2EX  ›  程序员

实测 GPT-5.6 Sol 的 High/Max:修 bug 未必值得上 Max,重写/迁移可能值得

  •  
  •   yohjisakamoto · 19h 15m ago · 1747 views
    先声明:我是 [Tura]( https://github.com/Tura-AI/tura) 的维护者。这不是独立评测;完整方法、图表和公开产物在文末链接。想请大家重点挑一挑下面这个“按任务形态路由”的结论有没有遗漏。

    我把 DeepSWE v1.1 的记录和一次 eza ( Rust → Python 、52 项检查)的行为兼容重写放在一起看。结论不是“Max 总是更强”,而是 Max 多买到了搜索、回滚、再试和 agent 回合;这些回合有没有价值,取决于任务剩下多少不确定性。

    | 任务形态 | High | Max | 通过率变化 | 成本 |
    | --- | ---: | ---: | ---: | ---: |
    | 范围明确的修复( DeepSWE ,7 个) | 64.3% | 57.1% | **-7.1 个百分点** | 2.53x |
    | 功能实现( DeepSWE ,95 个) | 70.2% | 74.6% | **+4.4 个百分点** | 2.43x |
    | 仓库重写( eza ,3 个 harness ) | 78.8–89.4% | 92.3–94.2% | **+4.8–13.5 个百分点** | 2.27–3.27x |

    113 个 DeepSWE 任务的总体平均是:High 69.4%、每任务 $3.47 ; Max 72.7%、每任务 $8.39 。也就是 **+3.3 个百分点,成本 2.42 倍**,输出 token 2.11 倍、输入 2.91 倍、时间 1.90 倍、步骤 1.66 倍。

    所以我现在倾向的操作规则是:

    1. 已经有 failing test 、定位范围较小的 bug ,先用 High ; High 失败且定位仍不确定再升级。
    2. 常规功能实现也是 High 起步,除非一次失败的代价足以覆盖约 2.4 倍成本。
    3. 大范围重写或迁移,Max 往往更有意义,因为兼容性、构建、测试和架构路径都还要探索。
    4. Greenfield 目前只有“可能更适合 Max”的判断,没有配对的 High/Max 数据,别把它写成已证实结论。

    需要强调两个边界:DeepSWE 的 7 个修复任务不足以证明“Max 会让修 bug 变差”; eza 的 High 是每个 harness 两次的均值,而 Max 是一次选定运行。数字适合做路由假设,不适合做万能默认值。

    完整分析( 19 张表和原始图表): https://turaai.net/blog.html#is-gpt-5-6-sol-max-worth-it
    复现数据: https://github.com/Tura-AI/benchmark/tree/main/blog_data/eza-replication-gpt56-max-20260717

    如果大家有更合适的任务分桶、成本/通过率指标,或者认为这里的 DeepSWE 划分不够机械化,欢迎直接指出。更希望讨论“什么时候应该升级 effort”,而不是只比较某个模式的单点分数。
    9 replies    2026-07-20 09:07:39 +08:00
    shilianmlxg
        1
    shilianmlxg  
       17h 41m ago
    大佬,有个问题,比如有个超长的任务,必须是从 a 到 b 到 c 到 d 的递进关系,但这样线性完成太慢了,如何同时并行呢,但比如 c 的前提是需要 b 的数据,这种如何并行处理呢
    weiliw528
        2
    weiliw528  
       17h 36m ago
    围观
    duuu
        3
    duuu  
       16h 59m ago
    @shilianmlxg 先写文档,mock 数据,mock 接口。如果有改动,也是从文档出发来改,再辐射到上下游。这就是团队里前后端开发做的事
    yohjisakamoto
        4
    yohjisakamoto  
    OP
       15h 18m ago
    @shilianmlxg 不可并发流程是没法优化的,最优解肯定是并发所有可以并发的步骤然后串行大步骤组。其实最简单的就是同时并发多个线程。单个任务按照阿姆达尔定律是没法优化的
    maolon
        5
    maolon  
       10h 15m ago
    我刚好在搞一个 greenfield ,然后最大的感受就是用 max ( ultra 模式)根本推不动任务,任务规划了总共 10 个阶段,花了 3 天时间(实际运行时间)才推到第四个阶段还没搞完。而且还全靠 tibo 前几天疯狂 reset ,因为 20x 连一天都撑不住。
    最后选择 high + xhigh + medium 组合才推进快一些。
    hanbaoji
        6
    hanbaoji  
       10h 6m ago
    @maolon 同感,写出来的代码靠谱且没问题,但是就是太慢了,而且 token 消耗太夸张,5.5 几个小时的工作要干一天。我也换 high+medium 了,xhigh 也觉得慢
    不是很关键、很核心的部分,没必要这样。
    shilianmlxg
        7
    shilianmlxg  
       9h 55m ago
    @maolon 请问下 high xhigh medium 是如何组合的,可以出个教程吗大佬
    Bluecoda
        8
    Bluecoda  
       9h 31m ago
    不够用,小任务我都只用 sol medium 的,复杂一点的才敢用 high ,加速模式不敢开。活多的时候,不重置的话,是不够用的。
    techmale
        9
    techmale  
       8h 56m ago
    项目必须有类似 SOP(让 agents 少走弯路) + properly written AGENTS.md, codegraph 等工具
    上述做好的话
    - Terra High or Sol Low 绝对完全足够!
    - 对于那些不需要改代码的需求的话,Luna High 也足够

    项目复杂度如下

    ➜ cloc .
    55648 text files.
    16997 unique files.
    47967 files ignored.

    github.com/AlDanial/cloc v 2.08 T=29.57 s (574.9 files/s, 200275.2 lines/s)
    -------------------------------------------------------------------------------
    Language files blank comment code
    -------------------------------------------------------------------------------
    JavaScript 8372 485349 573315 2925748
    Python 3360 112004 126720 641257
    TypeScript 2832 26262 311187 312686
    JSON 614 12 0 195141
    Markdown 782 24441 2156 85817
    CSS 272 1701 263 21586
    Text 74 1089 0 20993
    C 90 1997 2121 15565
    C/C++ Header 38 1050 781 8408
    Lean 206 2299 2801 5270
    Swift 18 228 14 1826
    HTML 50 15 2 1102
    YAML 11 8 24 1093
    XML 30 5 44 900
    Cython 18 362 0 869
    JSX 18 48 0 653
    Fish Shell 9 180 306 630
    DOS Batch 11 95 0 605
    Nushell 9 99 234 585
    PowerShell 9 117 207 414
    zsh 3 60 0 367
    C Shell 9 126 243 315
    TOML 24 42 8 308
    Bourne Shell 7 15 0 201
    XSLT 2 10 3 168
    SVG 40 0 0 163
    D 73 0 0 140
    make 1 14 0 124
    Objective-C 2 12 0 102
    Dart 4 14 0 99
    Gradle 3 13 6 75
    XSD 1 0 3 47
    Java 1 3 5 11
    Properties 3 0 0 9
    Kotlin 1 2 0 3
    -------------------------------------------------------------------------------
    SUM: 16997 657672 1020443 4243280
    -------------------------------------------------------------------------------
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   4730 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 57ms · UTC 10:04 · PVG 18:04 · LAX 03:04 · JFK 06:04
    ♥ Do have faith in what you're doing.