做一个思想实验,如果 dsh 没有打着 deepseek 的旗号

8 月 15 日
 leihaibo1992

而是一个名不见经传的个人开发者推出的,你怎么评价它

3136 次点击
所在节点    程序员
32 条回复
ATKLLL
8 月 15 日
实在找不到角度了吗?你不可能做到基于对事物的绝对了解,进而去评价它。
还有什么叫“打着 DeepSeek 的旗号”? 这不是 DeepSeek 团队开发的吗?
leihaibo1992
8 月 15 日
@ATKLLL 看下眼科
ATKLLL
8 月 15 日
@leihaibo1992 你需要看下脑科
leihaibo1992
8 月 15 日
@ATKLLL 顺便脑科也挂个号,免得跑两趟
germain
8 月 15 日
做一个思想实验,如果 WeChat 是你开发的,你会有多少亿用户?
leihaibo1992
8 月 15 日
@germain 哥,咱能分享下实际体验和真实看法吗,我挺想知道的,顺便混点铜币
tt83
8 月 15 日
其实大部分的事情都是这样的,你相信它是好的它就是好的,从古至今从从宗教到产品都是这样;做过独立开发会对这件事深有体会,大量好的产品是无人问津的。
DefoliationM
8 月 15 日
又一个 agent 而且,现在 agent 都发展的挺成熟了,大家都大差不差,vibe 时代更是随便就能给开发一个给自己用的 agent 。
leihaibo1992
8 月 15 日
@germain 另外,我是觉得社交软件的粘性和工具软件的粘性天壤之别,没啥可比性
foryou2023
8 月 15 日
会无人理,社区的代表 pi 已经发展的很好了,一些优秀的地方可能会成为 pi 的养分。
PopRain
8 月 15 日
做个抬杠实验....
sentinelK
8 月 15 日
同意#7 的思路。
其实社会对于某个“作品、品牌、产品”的看法,只存在两个维度,即正向循环和死亡螺旋。不存在中间态。

只要多数人认为“好”,只要作者不做出太出格的举动,这个市场惯性是非常大的。
反之亦如此,某个品牌、产品舆论上不看好,你想扭转多数人的看法,你就需要一个、甚至多个决定性领先的产品。

这也就是锚定效应。

大众集团做了那么多年的垃圾,依然屹立不倒。甚至整个德国汽车行业都自成了一套价格歧视体系。
不也是在国产多年的跨级别价格、性能碾压时,才口碑崩塌的么。
反过来也是,当初国产车为什么搞价格配置碾压?不就是因为口碑不如德日,逼不得已么。

所以这种假设其实是不成立的。换句话说,如何及时且适当的利用好自己的口碑舆论优势,来推行最适宜的产品,才是最好的方式。
推出产品时,不能只看产品是不是全行业领先。要判断这个产品是不是最契合企业需要的当下的风格、调性、舆论、定位。
leihaibo1992
8 月 15 日
@sentinelK 确实,一个产品的号召力足够大时,生态能够快速繁荣起来。不过话说回来,openclaw 刚出来时也是如日中天,现在不也一地鸡毛。现在趁热度,捧臭脚的太多了,过一段时间再看看。
ndxxx
8 月 15 日
社区消融实验揭秘:DeepSeek V4 Pro 严重依赖首轮工具锚定,两阶段插件成功复现高分能力

DeepSeek V4 Pro 正式版发布后,因实际表现不及灰度测试预期而引发社区争议。近日,开源社区通过消融实验探针对其进行了深入分析,揭示了其性能波动的底层机制并给出了解决方案:

V4 Pro 对首轮请求中可见的 API 工具目录( Schema Surface )极度敏感。在暴露完整 25 个工具的 Standard 模式下,模型易陷入低效的 “Let me...” 思维链( CoT )轨迹,Project2 评分仅为 9192 分;而在仅提供 Shell 和 Read 的 Minimal 模式下,模型能被激活为灰测时的 “We need...” 推理轨迹,基准分回升至 9699 分。

针对 Minimal 模式缺失高级工具的问题,社区开源了 dsh-anchored-standard 插件。该方案采用“首轮锚定 + 动态晋升”策略——首次请求仅暴露 2 项核心工具以锚定优质推理轨迹,一旦模型发起首次 Tool Call ,立即在后续轮次解锁全部 25 项标准工具。

在 Windows 原生 Project2 测试中,该方案连续跑出 98 、99 的高分,成功进入 Fable 等前沿模型分数带。该实验表明,V4 Pro 的核心能力并未丢失,但可能在强化学习( RL )后训练阶段对特定的 Harness 脚手架与工具暴露环境存在显著过拟合。

参考:microblock_pub 、DeepSeek V4 Pro / Flash 轨迹触发机制实验 、dsh-anchored-standard


DSH 其实就是 deepseek 新模型重要的一个训练工具。另外也相当于官方告诉你这个东西就是他家的官方 harness 骨架。个人开发者拿什么背书这些东西呢😅
leihaibo1992
8 月 15 日
@ndxxx 看这段描述,我只能得出他们的模型拉了这个结论
iTYC
8 月 15 日
首先 deepseek 我从来没有看好过,但假如抛开这种铺天盖地的 zzzq 宣传,那估计没什么人会用,大众评价也只会更差
nevin47
8 月 15 日
有空可以去看一下 DSH 伴随发布的 88 页的那篇<A Programming Paradigm for Spatiotemporal Composability>

这是我看过的第一篇这么完备的用形式化证明的方式把想要构建的 Agent 的方法论讲清楚了的论文

如果社区里面出现一个新的 Agent ,也通过严格的形式化方式对设计理论和核心理念进行了剖析和证明,我觉得一样可以很快出圈
nguoidiqua
8 月 15 日
个人做的不会评价,DeepSeek 做的同样不会评价。没什么好评价,因为作为没有影响力的个体,评价也没什么影响力。

作为个体我只考虑想不想用,目前完全没兴趣,无论它是谁做的都没兴趣。没有看到有什么独特的功能,也没有看到有什么特别优势。开发语言是 TypeScript 估计体积和占用不会小,如果是 C Rust 之类写的,只有十几 M,说不定会有点兴趣。甚至界面也没啥特别,不像 TUI 之类起码看上去比较炫。哪天经过大量应用证实它有不可替代的优势,才会有兴趣。

话说回来,人对事物的看法是流动的。如果是无名开发者开发,但配上孤军奋战式煽情宣传,它可能会增大吸引力。而打着 DeepSeek 旗号,也未必是好的,这取决于旗号本身的受欢迎程度。如果大家对 DeepSeek 本身颇有微词,那自不必说。现在由于 DeepSeek 风头正盛,让它一时吸睛、名声大振,但热度能持续多久也是个问题。有时候来得快,去得也快,如果没有特别的优势,那大部分人只是跟风 Star,并不等于真的关注、使用乃至添砖加瓦,甚至以后就算真有了什么优势,可能那些人也会因为初期不及预期而懒得再试了。
jujusharp
8 月 15 日
纯个人观点,如果你单纯的就事论事,不要写暗示性的标题,你直接单纯的讨论从技术和架构的角度,dsh 的架构到底怎么样我觉得都不会有让人反感。但你偏偏用打着旗号这种标题,我不知道该怎么客观评价了
leihaibo1992
8 月 15 日
@nevin47 论文比代码还长

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1234524

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX