coefu

coefu

V2EX member #616381, joined on 2023-02-28 17:15:35 +08:00
Per coefu's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
coefu's recent replies
@oldlamp 我虽然言语狂了点,但是态度是建立在每天都在学习提升的基础上;沉浸在整个机器学习领域的第八个年头了,从统计机器学习,到深度学习,强化学习,每个领域都摸了一个遍。基础数学公式的推导,以及前沿工程领域论文,都过了一遍的。

起码从自我反思的角度来说,学而不思则罔,思而不学则怠 的境界,虽然也陷入过,但是能自我清醒意识到并脱离。

这哥们儿自己基础薄弱,上来想当然就算了,态度还这么阴阳,我没理由惯着他。

老哥谬赞了,黄石公我肯定没那么高境界。同龄人里这个领域来说,我服 陈天奇,王树森,李沐 他们,但是这个论坛里没有能让我服的人。我也在做事,只是还没有出成果罢了。但是我做的,必然不是当前这些水准的事情。
@EliteOtaku 跳梁小丑,能回复你一句,算给你长脸了。
LLM 参数的量,最根本的矛盾在于 信息论里对于信息的压缩。

LLM 模型本身 静态参数架构的量 对于要体现的 智能 ,关系其实不大,与之影响最大的是 context kv cache 。为什么:
1 ,LLM 本身静态参数其实只需要存储 最精炼的逻辑能力即可,世界客观知识 完全可以压缩到 context kv cache ,只要 context kv cache 无限长度能够存在,就能压缩一切,那么整个模型的初始化参数量就是 O(n),常数级别。

2 ,以目前的硬件能力,context kv cache 显然做不到 无限长度,那么压缩 context kv cache 的算法就是关键,所以,你会看到 一皮条 这部分的工程创新和优化。

3 ,但是信息论里就决定了,有限的结构无法无损压缩还原无限的信息。只要压缩了,必定就有损失。信息熵增地不可逆决定的。
LLM 和人脑之间的进化差距,如同马车之于未来的宇宙飞船。


马车在工程结构上迭代 N 版,不从底层结构上搞出范式创新,依然只是 高级的马车。
@EliteOtaku 那么现在的 MOE 架构是什么呢?

思而不学则怠。
要做孩子的朋友成为自己人,而不是家长成为对立面。
Jul 29
Replied to a topic by sc0303 创业组队 诚寻创业(搞钱)合伙人(base 上海)
事你干,钱他赚,牢你坐。
Jul 28
Replied to a topic by ColinLi 职场话题 公司只有我一个开发,该离职吗
你离职之后遇到的困难,会让你觉得你当下这点儿问题,算什么问题啊。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2897 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 12ms · UTC 04:06 · PVG 12:06 · LAX 21:06 · JFK 00:06
♥ Do have faith in what you're doing.