群发资讯网

标签: 机器学习

1.端侧AI怎么系统学?这份路线图我劝你收你有没有发现,网上学AI有个尴

1.端侧AI怎么系统学?这份路线图我劝你收你有没有发现,网上学AI有个尴

AI编程学习指南:从写第一行Prompt到跑通一个Agent工作流学AI编程不

AI编程学习指南:从写第一行Prompt到跑通一个Agent工作流学AI编程不

当AI开始自己做实验:JeffDean正在押注“发现”的工业化信源:JeffDean,2026Fro

当AI开始自己做实验:JeffDean正在押注“发现”的工业化信源:JeffDean,2026Frontier&PioneerSymposium现场对谈,2026年。过去十几年,人工智能产业几乎围绕同一个问题展开:怎样训练出一个更大的模型。更多数据、更多参数、更多GPU,最终换来更低的loss、更好的benchmark和更​当AI开始自己做实验:JeffDean正在押注“发现”的工业化信源:JeffDean,2026Frontier&PioneerSymposium现场对谈,2026年。过去十几年,人工智能产业几乎围绕同一个问题展开:怎样训练出一个更大的模型。更多数据、更多参数、更多GPU,最终换来更低的loss、更好的benchmark和更强的推理能力。这套逻辑塑造了今天的AI产业,也催生了一个规模以万亿美元计算的基础设施周期。但JeffDean离开Google创办DiscoveryLoop之后,提出的其实是另一个问题:如果模型已经足够聪明,我们能不能开始规模化“发现”本身?这可能是理解下一阶段AI最重要的视角之一。JeffDean的职业轨迹几乎就是现代计算基础设施演进史。从MapReduce、Bigtable,到TensorFlow、TPU、MixtureofExperts,再到Gemini,他长期解决的其实是同一种问题:当某种能力开始变得重要,怎样把它从一个实验室里的想法,变成一个可以大规模运行的系统。MoE是一个很典型的例子。早期深度学习的直觉是模型越大越好,但模型越大意味着每次计算也越昂贵。MoE改变了这个关系:系统可以拥有巨大的总容量,但面对一个具体token时,只调用真正需要的那部分专家。JeffDean在访谈中回忆,他们当时已经看到了接近10倍的训练计算效率改善。对他来说,这种数量级变化往往意味着一项技术不再只是“有趣”,而可能成为新的基础架构。这种思维贯穿了他后来的很多工作:真正重要的创新,不只是让系统快10%,而是改变能力增长和资源消耗之间的关系。Gemini又把这个逻辑推进了一步。JeffDean介绍,Gemini最初并不是把语言、图像、视频和音频能力分别训练好,再把它们拼起来,而是从项目开始就坚持multimodal-native:模型一开始就应该理解文本、代码、图片、视频、音频,甚至为LiDAR等数据留下空间。这背后其实是一个更大的判断。语言并不是世界本身,它只是人类描述世界的一种压缩格式。如果AI最终要理解现实、进入机器人、控制设备、参与实验,那么text-only模型天然存在信息瓶颈。于是多模态最终很可能不是一个产品功能,而是通向worldmodel、agent和PhysicalAI的基础条件。但这场访谈中更值得注意的,是JeffDean对coding的评价。他坦率地承认,Gemini早期对coding的投入一度不够,后来团队发现,当coding能力提高以后,模型在很多非编程任务上的reasoning能力也随之改善。因为写程序本身就在训练一整套复杂能力:问题分解、规划、执行、检查、纠错和迭代。代码还有一个其他领域很难复制的优势:它天然拥有verifier。一段代码写出来以后可以直接运行。对就是对,错就是错。于是AI可以非常便宜地完成“生成—执行—观察—修改—再次执行”的循环。从这个角度看,今天看似火热的codingagent,可能不只是一个软件工具市场。软件工程正在成为AI学习长期任务执行和自我修正能力的最佳训练场之一。而这正好把问题带到了JeffDean新公司的核心——Loop。⸻很多人谈RecursiveSelf-Improvement,也就是递归式自我改进时,脑海里浮现的是一种极富戏剧性的场景:一个AI突然学会修改自己,然后更聪明的AI再创造更聪明的AI,最终形成所谓intelligenceexplosion。JeffDean给出的版本完全不同。它没有那么科幻,却可能现实得多。他认为,“用机器学习改进机器学习”本身已经存在很多年。NeuralArchitectureSearch就是一个例子:一个模型产生新的模型架构,训练之后得到结果,再根据结果学习什么设计更有效,随后生成下一轮架构。后来Google的EvolvedTransformer甚至通过类似方法找到过比普通Transformer更高效的结构。JeffDean真正想做的,是把这个闭环从“搜索模型架构”扩展到整个研发流程。什么数据应该加入训练?应该设计什么evaluation?下一轮应该尝试什么architecture?哪个实验最值得做?实验结果意味着什么?所有这些过去依赖研究团队人工完成的环节,都可以逐渐进入自动化loop。于是RSI的现实版本,很可能并不是“AI突然觉醒”,而是R&Dcyclecompression——研发周期被持续压缩。一年做一百次实验,和一年做一万次实验,是完全不同的研究组织。而如果下一轮实验本身又由上一轮结果自动决定,那么AI就开始拥有真正意义上的复利。⸻DiscoveryLoop把这种思想进一步扩大到了科学和工程。JeffDean对科学研究的抽象非常简单:先把一个大问题拆解成若干小问题,针对其中一个问题提出可能的解决方案,把方案实现出来,进行实验,然后评估结果,再把反馈交给下一轮实验。这就是科学方法。也是绝大多数工程研发的基本结构。过去真正昂贵的地方,不一定是“提出一个想法”,而是整个循环速度太慢。一个科学家一天能思考多少假设?一个实验室一周能运行多少实验?一组工程师一个月能验证多少设计?人的时间、组织协调和实验执行能力,决定了研发吞吐量。而JeffDean想做的,是把这套流程系统化。模型负责理解不同科学领域;agent负责分解问题;不同专业agent分别处理子任务;工具负责实施实验;evaluationsystem判断结果;实验数据重新进入系统,然后决定下一轮实验。DiscoveryLoop希望最终让一个模型同时具备多个领域的PhD级知识,从而组织跨学科的multi-agentresearchprocess。这里真正发生改变的,是AI的评价指标。过去我们最关心accuracy。后来开始关心reasoning。Agent时代开始关心taskcompletion。而AIforScience最终可能开始关心另一个指标:DiscoveryThroughput——单位时间内能够产生多少高质量发现。JeffDean对这个问题的描述非常直接:把一次原本需要一天甚至一周的实验迭代,缩短到一分钟或者一小时;同时并行运行成千上万个实验,再根据结果判断哪些实验值得继续。从系统角度看,DiscoveryRate大致可以理解为两个变量的乘积:实验速度×实验质量。这可能是下一轮AIScalingLaw真正出现的地方。过去十几年,我们不断扩大Compute、Data和ModelSize。下一阶段扩大的,可能是Experiment。⸻这也会带来一个容易被低估的产业变化。如果AI生成hypothesis的速度提高100倍,但真实实验仍然需要几天甚至几个月,那么瓶颈不会消失,只会向下游移动。软件最容易率先完成闭环,因为写代码、运行、测试、评价都可以发生在数字世界里,反馈成本接近于零。但生物、材料、机器人和制造业不同。AI可以一分钟设计出一百个蛋白质,实验室却不可能一分钟完成一百次细胞实验;AI可以生成一万个材料配方,真实设备仍然需要逐个完成合成、测试和测量。于是,当模型越来越强以后,真正稀缺的可能反而变成实验能力。自动化实验室、roboticlab、高通量screening、科学仪器、仿真环境、数据采集、实验管理系统,以及把真实世界反馈重新输入模型的基础设施,都可能越来越重要。这也是为什么“AIforScience”最终很可能不是一个单纯的大模型故事。它更像一个完整系统:Model→Agent→Tool→Experiment→Evaluation→Feedback→Learning。真正产生复利的不是其中任何一个节点,而是最后那个能够重新回到起点的闭环。⸻JeffDean为什么选择现在离开Google,也可以从这个角度理解。有人在现场提出了一个非常好的问题:AI需要海量算力、数据和分布式系统,按照第一性原理,大公司似乎应该天然占优,那么为什么大量frontierresearch反而不断流向创业公司?JeffDean的回答是云计算。过去如果想做世界级计算系统,首先必须拥有基础设施。现在一个十几人的创业团队可以直接租用大型云平台提供的MLcompute,不必自己重建整个distributedsystem。这实际上改变了创新的组织经济学。Hyperscaler没有因此失去价值。相反,它们正在把曾经只属于自己的基础设施能力变成整个AI创业生态的公共生产资料。创业公司因此可以把全部精力投入一个问题。JeffDean甚至承认,DiscoveryLoop做的事情“可能也可以在Google内部完成”,但一个十人左右、所有人只围绕scienceandengineeringautomation工作的小团队,可以减少大型组织中大量与核心使命无关的摩擦。某种意义上,这也是JeffDean四十年技术生涯中一个非常自然的下一步。MapReduce规模化计算。Bigtable规模化数据。TensorFlow规模化机器学习。TPU规模化AIcompute。MoE规模化模型容量。Gemini规模化多模态智能。而DiscoveryLoop想规模化的,是更上面那一层:Discovery。工业革命把生产变成可以规模化复制的过程,互联网把信息分发变成可以规模化复制的过程,云计算把算力变成可以按需调用的基础设施。AI模型正在把一部分智能变成可调用资源。JeffDean现在押注的是下一步:当智能变得足够便宜以后,“发现”本身也可能被工业化。如果这件事最终成立,那么AI历史真正重要的分界线,或许并不是某一天某个模型在benchmark上超过了另一个模型。而是某一天开始,人类第一次拥有了一套可以昼夜不停地提出假设、执行实验、读取结果,然后自己决定下一步该做什么的系统。到那时,AI不再只是帮助科学家找到答案。它开始参与制造新的知识。
AI竞争的焦点,变了。一个词开始在前沿讨论里高频出现:RecursiveSel

AI竞争的焦点,变了。一个词开始在前沿讨论里高频出现:RecursiveSel

AI竞争的焦点,变了。一个词开始在前沿讨论里高频出现:RecursiveSelf-Improvement。它指的是AI自主优化,让AI来研发更强大的AI——AI开始自己提出问题、设计实验、评估结果,再根据反馈不断改进自己。这被认为是继AI推理、Agent之后的下一个重大前沿,也是通往AGI(通用人工智能)的关键路径。就拿OpenAI来说,GPT-5.6的RSI相关能力,已经帮其把端到端服务成本降低了20%,Token生成效率提升了15%以上。还有Anthropic,披露其代码库中超过80%的代码由Claude自主生成。JeffDean从谷歌离职创办DiscoveryLoop,投身的也是RSI这条赛道,根据最新市场消息,其估值已经冲击100亿美元。优化这件事,正在由AI深度完成。硅谷在为这个方向沸腾,但中国也并没有落后。清昴智能,国内第一家专注AI自进化Infra的创业公司,布局比这轮RSI热潮要更早。并且,团队已经在回答一个更底层的追问:模型可以自己进化,承载它的算力底座,怎么跟上?如何让AI进化的软件基础设施本身可以被算法化和自动化?模型已进入L4高速自主迭代,国产算力还在L1人工手搓清昴的答案,要从一场节奏错位说起。过去几年,大模型能力的提升几乎沿着一条清晰的路线前进。从聊天、生成,到调用工具、长程推理,再到越来越多能持续运行数小时甚至更久的Agent,模型正在从一问一答走向更加自主的任务执行。如果把这种智能化进程类比成自动驾驶,可以说上层的模型已经开始向L4式的高度自主执行迈进。这种「L4自动驾驶」带来的直接变化是,单次任务要处理更多Token、更长的推理链路、更复杂的工具调用,这自然就对底层算力提出了更高的要求。与此同时,中国AI产业又面临另一重现实。在外部先进芯片供给受限的大背景下,中国AI产业越来越依赖国产芯片。可问题是,国产芯片并不是“有卡就能跑”。一款模型想要在一张芯片上跑起来,要经过算子适配、编译优化、内存调度、框架适配、推理优化等一系列环节。而国产算力的软件生态相对碎片化,换芯片要重新适配,换模型又要重新调优。长期以来,这类工作高度依赖少数资深工程师。手写算子、调试参数、规划内存与并行策略……一个复杂算子的开发与调优往往耗时数周,却可能很快被模型和芯片的高速迭代淘汰。而且,从行业实际利用情况来看,国产算力仍存在较大的效率释放空间。于是一个新的矛盾出现了:上层模型正在变得越来越自主,底层算力却仍然高度依赖人工——模型已经向L4迈进,算力底座却还需要L1式的人工接管。如果AI真的要进入持续自我进化的时代,Infra也不能永远依赖手工调优。这正是清昴智能创业伊始即瞄准的方向:构建一套真正具备自我迭代能力的算力基础设施。不再依赖于专家的手工调优,也不局限于单点的算子生成或编译适配,而是让整个底层系统也进入一个由AI驱动的反馈循环。最终,为Agent时代数万亿级Token的高效产出提供算力底座。清华团队数年学术蓄力,率先打造自进化算力底座团队如今的这套自主优化体系,并不是看到AIInfra风口之后临时拼凑出来的解决方案。从创立第一天起,团队的核心目标就是探索如何实现「AI自己优化AI」。整套技术脉络,可以一路回溯到清华朱文武教授实验室的长期研究。传统机器学习优化范式,本质上始终是人类定义规则、机器负责执行。2015年前后,AutoML与MetaLearning开始把模型结构、超参数等部分决策交给机器,但优化什么、用什么数据、往哪个方向优化,依然由人类决定。再进一步,如果连这些决策都交给机器决定,会发生什么?清华大学计算机科学与技术系朱文武教授团队长期深耕机器学习自动化领域,并在2022年正式提出自我驱动机器学习这一概念,把机器获得的自主权扩展到任务、数据、模型、优化策略乃至评价标准。这也是清昴技术路线的重要源头之一。清昴智能是第一个将这条路线真正推向产业实践的创业公司,带头人关超宇正是朱文武教授的学生、清华特奖获得者。他长期深耕AutoML、元学习与自主机器学习赛道,带领团队征战NeurIPS、AAAI等国际顶级学术赛事,在AutoML、MetaDL等全球挑战赛中击败哈佛、MIT、斯坦福等世界强队斩获冠军。到了产业环境,这条技术路线进一步转向AIInfra:让机器自己找到一套更高效的算力运行方式。随着模型、算子、运行时、分布式架构和国产芯片快速迭代,优化空间越来越复杂,单靠人工经验已经难以覆盖。于是,AI优化AI,转变为AIInfra领域亟待落地解决的现实命题。在此基础之上,团队进一步发展出自主机器学习完整框架。落到工程实现上,清昴将整套体系拆解为两大核心能力——自主优化与自主演化。自主优化解决的是「这一次怎么优化」。系统可以根据真实运行状态,自动定位瓶颈、尝试不同方案,并通过实际反馈找到更优解。自主演化解决的就是「下一次怎么更快优化」。系统会把每次优化过程中积累的经验沉淀下来,在面对新的模型、芯片和运行环境时复用已有经验,减少重复试错。于是,原本一次性的调优,就变成了一个不断循环的过程:优化→积累经验→再优化→再积累,闭环转起来,系统就越优化越会优化。这套技术范式已经在国产算力真实生产环境中完成验证。过去,一名资深专家完成一款复杂算子的开发与调优,往往需要耗费两周时间;依托清昴的自主优化系统,这一周期被压缩至约1小时,整体效率提升约336倍。模型方面,国产芯片全链路打通原本需要一个月左右,现在压缩到1天至1周,综合提速约30倍。部分代表性算子的性能,相较基线版本最高实现30倍加速,达到了行业顶尖水平。截至目前,清昴已完成数十款国产芯片的适配与性能优化,覆盖国内超半数主流国产算力芯片,是国内适配国产芯片和性能优化最多的AIInfra厂商之一。但这些数字值得关注的地方并不只是比工程师快了多少。更大的变化在于,过去只有少数顶尖专家掌握的优化经验,开始变成一种可以由机器执行、持续积累,并进一步复制到不同模型、不同芯片上的系统能力。基于国产算力打造日均万亿级Token工厂把算力优化好,只是清昴的第一步。在Agent时代,算力面对的已经不是某一个模型能不能跑,而是能不能稳定、持续、低成本地生产海量Token。尤其到了2026年,Agent的爆发持续拉动Token消耗。部分复杂Agent单次任务Token开销较传统对话模型提升数百倍,不少业务场景的日均调用量已经向万亿级别靠拢。清昴认为,随着未来视频模型、多模态、AIforScience、具身智能和物理模型的全面爆发,Token调用量还将跃升至全新的量级。当调用规模进一步扩大,决定业务能否跑通的是每一个Token背后对应的算力成本、延迟和资源利用率。行业当下稀缺的正是这种高性能、低成本、可稳定大规模交付Token输出的工程能力。沿着这条思路,基于国产芯片的万亿Token工厂也成为了清昴底层自进化能力产品化和服务化的体现。对于国产算力中心来说,清昴对自己的技术能力非常有信心:因为极致的Infra优化能将原本闲置或低效的算力转化为高价值的Token产能。基于这种点石成金的底气,清昴不仅采用租赁的方式获得大规模国产算力,还提供了深度赋能的私有化或代运营模式,与其共同打造从算力生产、适配、调度再到分发及场景的国产算力生态。可以说,清昴是市场上率先以自进化技术打通「从算力自主适配优化到Token生产」端到端闭环的服务商。对于模型厂商、API平台以及行业客户而言,他们并不关心Token底层究竟跑在什么芯片上,他们只关心最终的产出效率与成本。基于此,清昴的商业交付模式非常清晰:既直接提供高性价比的Token产出(卖Token),也对外输出整套自进化的Token生产平台(卖产线)。这意味着,无论客户选择哪种模式,他们购买的都不再是一次性的芯片适配外包,而是一套能够持续优化的Token生产能力。其中最重要的变化,是「适配」本身开始变成持续运行的过程。新模型来了,系统自动学习;新芯片来了,系统自动调优;新的业务场景出现了,也不必完全从零开始。这样,「适配」就形成了复利。这就是清昴自进化Infra的目标:不是替客户做一次优化,而是把优化本身变成一项能够持续运行的基础设施能力,加快从L1进化到L4。现阶段,清昴优化的是模型、算子和国产芯片,支撑万亿级的Agent市场。面向未来,经过优化的模型与Agent将进一步反哺算力底座,抬升算力优化基础设施的智能化、自动化的上限。AIoptimizingInfra,andInfraempoweringAI.(AI优化基础设施,基础设施赋能AI)在国内AIInfra的版图中,清昴既是最早把「AI优化AI」当作创业第一性问题的团队,也是最坚决地把全部筹码押在国产算力上的那一家。当多数玩家仍在通用算力赛道内卷,把精力耗费在货源甄别与价格比拼上,清昴则选择了一条难度更高、着眼长远的道路:让国产算力的软件底座自己学会进化。这不是权宜之计的替代,而是算力自主时代的序章。
模型训练-正则化:别让模型死记硬背上一篇讲了损失函数与优化器但是训练参数

模型训练-正则化:别让模型死记硬背上一篇讲了损失函数与优化器但是训练参数

模型训练-正则化:别让模型死记硬背上一篇讲了损失函数与优化器但是训练参数不能只看预测对错,还要约束参数不要过大。总式:Loss_total=Loss_task+λ·Ω(w)。惩罚项像山谷,最低点在w=0,坡度就是往0拉的力。(1)L1惩罚|w|,V字山谷,拉力恒定。不重要特征易被一路拉到w=0→稀疏,可做特征选择;深度学习很少单独用。(2)L2惩罚w²,抛物线山谷,拉力∝|w|。大权重猛拉,靠近0几乎松手→权重趋近0,一般不为0;处处可导,神经网络常用。(3)WeightDecay目标与L2相同(压大权重),但不改损失,每步更新前先把权重缩一圈。SGD下二者近似等价;Adam下不等价:不要往损失里硬加L2,用Adam又要衰减时应选AdamW。两篇总结:损失函数:输出端衡量对错,给出误差信号。优化器:按梯度更新权重,决定怎么下山。正则:约束权重别太大,防过拟合。下一篇:激活函数:决定网络能不能学复杂规律AI不焦虑howto多元化思维模型智能体人工智能深度学习大模型机器学习