群发资讯网

上周腾讯发布了Hy4 preview,我翻官方介绍的时候,看到一个眼熟的词——iHC。 iHC?好像在哪见过。 顺着参考链接点进去,发现跟我前两天在知乎刷到的文章如出一辙。 我立刻点开知乎的「最近浏览」,找到了那篇原帖。 帖子题目叫《你的DeepSeek mHC可能不需要"m"》。 大概讲的是,DeepSeek训练AI时 ​

上周腾讯发布了Hy4 preview,我翻官方介绍的时候,看到一个眼熟的词——iHC。

iHC?好像在哪见过。

顺着参考链接点进去,发现跟我前两天在知乎刷到的文章如出一辙。

我立刻点开知乎的「最近浏览」,找到了那篇原帖。

帖子题目叫《你的DeepSeek mHC可能不需要"m"》。

大概讲的是,DeepSeek训练AI时用的mHC“双随机矩阵”,思路很精妙,但实现起来有点复杂,需要反复迭代Sinkhorn-Knopp算法才能算出来。

作者“涮月亮的谪仙人”就有了一个想法:直接换成最简单的单位矩阵(Identity),会不会更好?

于是他在Qwen3的1.7B和8B模型上各跑了150B tokens的训练,果然得到了更好的效果,并给他起名为iHC。

他把这个发现写成了知乎文章,一篇个人技术笔记,成了大厂旗舰模型的技术来源,放到之前确实难以想象。

1、这种故事在知乎上不是孤例,知乎正在成为AI创新“孵化器”。

去年稀疏注意力(NSA)火起来的时候,清华大学刘知远团队在知乎发了一篇关于InfLLM长文本理解方案的分析。

讨论如何让模型只关注关键文本片段,降低长文本推理的算力开销。

帖子发出来后,评论区涌入大量从业者,补充细节、贴实验数据、提出质疑,讨论越挖越深。

后来帖子里的核心思路被DeepSeek收录进了ACL 2025的最佳论文。

知乎答主李明殊对NSA机制的通俗化解读,更让这个方向在圈子里快速传开。

微软亚研院、月之暗面等几家机构,后续都推出了自己的NSA方案。

还有个例子,一NLP工程师发的《Transformer调参避坑指南》,把大模型训练中Loss频繁波动的原因指向了学习率调度策略。

文章迅速传开,多家初创公司直接把里面的调参流程纳入了内部规范。

对应的GitHub项目通过知乎引流,拿到了340多颗星标。

2、我觉得这离不开知乎的一个优势:直接互动。

知乎上活跃着一大批AI领域的顶尖人物。

李沐很早就在知乎输出深度学习的思考,他的回答和专栏影响了很多入行的年轻人。

吴恩达亲自在知乎回答过“如何系统学习机器学习”这类问题,和普通用户直接交流。

李开复不仅是知乎的长期用户,也是知乎的投资人,经常在平台上分享对AI趋势的判断。

他们的点赞、评论或引用,本身就是一种行业级的认可。

这些大牛不是“挂个名”就完了,是真的在看、在点赞、在评论、在引用。

一个普通开发者写的东西,能被自己领域的顶尖人物看到并且认可——这种反馈闭环,在其他地方很难找到。

最后说两句。

这两年有一个很明确的信号:创新的门槛在降低,验证的周期在缩短。

一篇好的技术内容,不需要期刊、不需要会议、不需要漫长的审稿——它只需要被对的人看到。

而知乎,恰好是那个“对的人”最多的地方。