【大模型/评测】近期大模型发布与评测要点如下:
对腾讯 Hy4 preview 的真实评价。 腾讯的模型节奏也是越来越快了。 从 Hy3 preview、Hy3 正式版,到周五发布的 Hy4 preview,基本就是两个来月一个大版本。 这其实也能看出来,现在整个 LLM 领域的竞争有多激烈。不管是大公司还是创业公司,三个月不发新版本,原来的模型大概率就会开始慢慢掉队。 不知道大家有没有看 Hy4 preview 官方的 release blog。我还是老观点,模型发布以后,大家一定要去看官方的一手信息。 官方的 release blog 一般都很短,但仔细看的话,还是能读出来很多值得注意的信息。听话听音。 和之前外界预测的一样,这次 Hy4 preview 的总参数从 Hy3 的 295B,一口气提升到了 770B,上下文长度也到了 1M。 作为对比,我们知道,国模一哥(或者二哥) GLM 5.3 的总参数是 743B。所以单看参数规模,Hy4 preview 已经和 GLM 5.3 基本处在同一个量级了。 腾讯过去在模型能力的表达上一直比较克制。但大家看这次,release blog 中直接说,在内部的盲测中,Hy4 preview 的表现略优于 GLM 5.3 和 Kimi K3。 盲测很好理解,就是让几个模型同时完成相同的任务,最后再由评测人员选出效果最好的结果。当然整个评选过程中,模型都是匿名的。 盲测当然不能代表模型的全部能力,但至少可以在部分维度上反映它目前大概处在什么水平。 也就是说,这次 Hy4 preview 已经在部分任务上追平了 GLM 5.3 和 Kimi K3。而这俩也是目前公认最强的国产模型。
用 AI 搭辅助决策系统的方法当一件事复杂到让你纠结、内耗,往往不是问题无解,而是我们把客观事实、主观判断、情绪、隐含假设和价值冲突揉在了一起,大脑已经无法同时处理。 用 AI 辅助重大决策的四个步骤第一步,定义真问题把背景、现状、主观感受和没想清楚的部分全部告诉 AI,让它拆解:哪些是事实,哪些是判断;有哪些前置假设和隐含条件;现在纠结的逻辑是否必要;有没有被情绪和预判裹挟。剥离之后,真正需要回答的问题才会浮现。如果有本地知识库,还可以让 AI 调取产品、用户、历史决策和踩坑记录,补齐全局视角。 第二步,明确目标很多决策做不出来,不是方案不够多,而是不知道自己真正想要什么、判断标准是什么。资源有限时,决策本质上是价值排序;迟迟无法选择,常常意味着底层价值主张正在冲突。 第三步,引入专家框架让 AI 寻找相关学科、成熟方法论和认知模型,用不同框架推演各个方案的收益、隐性成本、潜在风险和执行困难。 第四步,执行并反馈把选择投入现实,把结果反馈给 AI,再将“假设—推演—决策—执行—反馈”完整沉淀进本地知识库。 当你持续用这套方式处理重大决策,积累下来的不只是答案,而是你自己的决策标准、思考框架和迭代记录。一套真正属于你的 AI 辅助决策系统,就会在一次次真实决策中长出来。 下次再遇到复杂决策,先别急着找答案,先让 AI 帮你消除模糊。 (来自孟老师的分享)
大模型时代,传统机器学习可能不是退场,反而会更普及。 原因不是算法忽然变简单,而是机器学习给 Agent 一条难得清晰的反馈回路: 1. 构造候选特征 2. 训练多个方案 3. 用 AUC、KS、预测误差等既定指标比较 4. 找到薄弱点,继续下一轮实验 5. 保留最好版本和完整过程 LLM 擅长提出假设、解释结果和编排实验;确定性数据引擎负责执行、计算与复核。两者结合,很多“一次性 Notebook”工作可以变成可重复的实验循环。 但边界也要讲清:指标更高不等于业务一定更好。训练与验证隔离、数据泄漏、解释性、稳定性和人工验收,一个都不能省。 InfiniSynapse 正在把这类多步数据任务装进同一个 Agentic Data Engine。 InfiniSynapse DataAgent 机器学习
grok bot希望看到更多好的用法我目前两个用法: 1 定时自动参会并录制,会后给摘要这样不抢我电脑 2 视频号链接到图文并茂的PDF 其中图片是视频关键帧截图 3 life coach 但这个模型一般,我感觉效果不好我在思考grok bot用法的时候不是当做又一个Agent 而是思考它的特点背后如何产生好用法 1 grok bot云资源我的mac mini开始不够Agent和我用了急需挪一些任务到云端比如录制会议这个也会抢我电脑 2 grok bot可读本地文件打开客户端后可以和本地连接比如life coach可以读本地知识库实时同步目前频道还没找到好的用法期待更多分享