没有人讨论吗, DeepSeek V4 flash 正式版上线了

7 小时 32 分钟前
 4shen
DeepSeek-V4-Flash 正式版 API 上线公测,API 调用方式不变,模型名设置为 deepseek-v4-flash 即可使用最新版本。

Agent 能力大幅增强,基准测试远超 V4-Pro-Preview:
Terminal Bench 2.1: 82.7
NL2Repo: 54.2
Cybergym: 76.7
DeepSWE: 54.4
Toolathlon verified: 70.3
Agent Last Exam: 25.2
Automation Bench (Public): 25.1
DSBench-FullStack: 68.7
DSBench-Hard: 59.6

https://api-docs.deepseek.com/zh-cn/updates/
1441 次点击
所在节点    程序员
14 条回复
lel020
6 小时 53 分钟前
`远超 V4-Pro-Preview`
我只觉得都这样了为什么还要用同一个名字,这模型到底和之前的版本相同在哪里,
nebulabox
6 小时 46 分钟前
@lel020 DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-Preview 保持一致,仅重新进行了后训练
phizumi
6 小时 43 分钟前
这么说可以期待一下 Pro 的后训练成果了
zxjxzj9
6 小时 34 分钟前
简单测试 确实是比之前好用多了,至少工具识别 mcp 调用这种不会瞎编了.但是理解语义的能力还是比较差(当然可能和 harness 框架也有关系, deepseek 自己家出的效果一般). 总体能力差不多能够到 composer2.5 的感觉了. 不过思维链还是长的离谱,是集体感不如 composer grok 那一系列的(速度和性价比来说). 但是如果和 OA 的大号模型比,执行步骤多但是每个步骤都比较简单的长任务那可太舒服了
poxiaohy
6 小时 31 分钟前
@zxjxzj9 DeepSeek 自家的 harness 还没出吧?
wonderfulcxm
6 小时 27 分钟前
“模型名设置为 deepseek-v4-flash”,预览版也是这个名称啊
utodea
6 小时 26 分钟前
体验下来增强了不少,可以用我的 agent 试试: https://github.com/usewhale/whale
xiaomushen
6 小时 24 分钟前
V 站里都是非 Fable5 不用的苹果用户,不大可能去碰 V4 Flash 这种安卓模型
GushAPI
6 小时 18 分钟前
<blockquote class="imgur-embed-pub" lang="en" data-id="a/0EFts3K" data-context="false" ><a href="//imgur.com/a/0EFts3K"></a></blockquote><script async src="//s.imgur.com/min/embed.js" charset="utf-8"></script>
foufoufm
6 小时 13 分钟前
没理解,falsh 正式版 和 和现有的 pro 哪个强一点?
menfrexu
6 小时 9 分钟前
已经将 flash 作为主力模型了,可以试试使用 https://github.com/Menfre01/waveloom 搭配 deepseek-v4-flash 来使用
hanbaoji
6 小时 9 分钟前
为什么这么强?到底强在哪儿?
qfdk
1 小时 37 分钟前
@menfrexu 哪里都有你推广....
menfrexu
50 分钟前
@qfdk 哈哈,抱歉抱歉,稍微蹭了下 flash 热度

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1231251

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX