上周腾讯发布了Hy4 preview,我翻官方介绍的时候,看到一个眼熟的词——iHC。
iHC?好像在哪见过。
顺着参考链接点进去,发现跟我前两天在知乎刷到的文章如出一辙。
我立刻点开知乎的「最近浏览」,找到了那篇原帖。
帖子题目叫《你的DeepSeek mHC可能不需要"m"》。
大概讲的是,DeepSeek训练AI时用的mHC“双随机矩阵”,思路很精妙,但实现起来有点复杂,需要反复迭代Sinkhorn-Knopp算法才能算出来。
作者“涮月亮的谪仙人”就有了一个想法:直接换成最简单的单位矩阵(Identity),会不会更好?
于是他在Qwen3的1.7B和8B模型上各跑了150B tokens的训练,果然得到了更好的效果,并给他起名为iHC。
他把这个发现写成了知乎文章,一篇个人技术笔记,成了大厂旗舰模型的技术来源,放到之前确实难以想象。
1、这种故事在知乎上不是孤例,知乎正在成为AI创新“孵化器”。
去年稀疏注意力(NSA)火起来的时候,清华大学刘知远团队在知乎发了一篇关于InfLLM长文本理解方案的分析。
讨论如何让模型只关注关键文本片段,降低长文本推理的算力开销。
帖子发出来后,评论区涌入大量从业者,补充细节、贴实验数据、提出质疑,讨论越挖越深。
后来帖子里的核心思路被DeepSeek收录进了ACL 2025的最佳论文。
知乎答主李明殊对NSA机制的通俗化解读,更让这个方向在圈子里快速传开。
微软亚研院、月之暗面等几家机构,后续都推出了自己的NSA方案。
还有个例子,一NLP工程师发的《Transformer调参避坑指南》,把大模型训练中Loss频繁波动的原因指向了学习率调度策略。
文章迅速传开,多家初创公司直接把里面的调参流程纳入了内部规范。
对应的GitHub项目通过知乎引流,拿到了340多颗星标。
2、我觉得这离不开知乎的一个优势:直接互动。
知乎上活跃着一大批AI领域的顶尖人物。
李沐很早就在知乎输出深度学习的思考,他的回答和专栏影响了很多入行的年轻人。
吴恩达亲自在知乎回答过“如何系统学习机器学习”这类问题,和普通用户直接交流。
李开复不仅是知乎的长期用户,也是知乎的投资人,经常在平台上分享对AI趋势的判断。
他们的点赞、评论或引用,本身就是一种行业级的认可。
这些大牛不是“挂个名”就完了,是真的在看、在点赞、在评论、在引用。
一个普通开发者写的东西,能被自己领域的顶尖人物看到并且认可——这种反馈闭环,在其他地方很难找到。
最后说两句。
这两年有一个很明确的信号:创新的门槛在降低,验证的周期在缩短。
一篇好的技术内容,不需要期刊、不需要会议、不需要漫长的审稿——它只需要被对的人看到。
而知乎,恰好是那个“对的人”最多的地方。
