netox

在线体验 16K token/s 的新大模型部署架构

  •  
  •   netox · 1h 44m ago · 425 views
    在 HN 上看到 AMD 收购那家把模型权重烧到芯片里的 taalas 的消息, 考虑到 gpt 5.6 相比 gpt 5.5 实际体验并没有多在的改进, 感觉或许把权重烧到芯片里, 没准是条路子

    帖子里有他们的模型架构体验接口, 自己试了下, 16k token/s, 不敢想象要是有 gpt5.5 这样的模型这么快, 体验得多么好了


    https://chatjimmy.ai/
    7 replies    2026-08-07 11:25:30 +08:00
    cowcomic
        1
    cowcomic  
       1h 27m ago
    我印象他们家好像都是做小模型的,之前都是 10B 以内的
    最近好像放话要做 qwen3.6-27b 的,不知道进展如何
    netox
        2
    netox  
    OP
       1h 3m ago
    @cowcomic HN 上原贴说下一代芯片正在做, 估计模型可能也会他们自己训练或者跟 AMD 一起搞, 利用 AMD 自己的技术(我记得 2022 年 AMD 还收购了 PENSANDO 这家做 DPU 的公司), 这样的话估计搞集群肯定就不只 27B 了
    SmiteChow
        3
    SmiteChow  
       1h 0m ago
    不可能的,一天一个模型可以,一天一个芯片?
    dreamdragon
        4
    dreamdragon  
       56 mins ago
    有正常逻辑想不到的使用场景吗,这个确实很反常
    netox
        5
    netox  
    OP
       50 mins ago
    @SmiteChow 为什么会一天一个模型? 如果有个高速 gpt 5.5 级别的模型, 感觉还行? 而且它技术上可以把权重换掉, 只不过相对麻烦
    ddoki
        6
    ddoki  
       39 mins ago via Android
    @dreamdragon 智能客服场景,小模型加高速输出。那可以承担的并发就很客观,降本肯定能做到
    litian98
        7
    litian98  
       5 mins ago
    这个模型确实快,但是智能太差了,基本感觉用不了的样子,最简单的那些常识性问题能回答得差不多,但是稍微复杂一点点的问题就不行了
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   5713 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 32ms · UTC 03:30 · PVG 11:30 · LAX 20:30 · JFK 23:30
    ♥ Do have faith in what you're doing.