【大模型/评测】近期大模型发布与评测要点如下:
上午接待一个基金的咨询单,聊了聊具身智能的发展情况,有几个重点也分享给大家,说到哪算哪: 1、全球具身市场主要集中在中美,美国大脑类的公司走得快,中国本体公司走得快 2、中国有一个非常重要物理数据的优势,就是制造业数据场景,这个是美国不具备的,也就是中国拥有触达全球最高质量世界模型数据的优势,数据体量和质量会好于美国 3、行业对于具身智能走完全非结构化场景是不看好的,反而比较看好的是半结构化场景(比如仓促物流、便利店、药店等),完全结构化场景(主要是工业场景)已经太卷了 4、具身领域也有一个物理世界的数据飞轮,目前走通这个路径国内玩家:智元、银河通用、星河图,国外的典型玩家:tesla optimus、waymo等。这些玩家的基本上都有一定的真机装机量,且在场景里在跑,每天能够手机不少物理真机数据。 5、目前各家基本上将wam+vla模型融合在一起用已经是标配了,这个在26年1月份就预测过了 6、国内具身大脑上值得关注的公司有蚂蚁的lingbot系列,国外值得关注有skild等,这些都是做大脑的一脑多机路线的。蚂蚁的大脑有一个优势就是医疗、消费这些场景,是其他公司不具备的,所以不要贸然纯做大脑,还是要有一定的场景基础 7、目前评测这些机器人好不好用,有两个维度:一个是看的是固定几个动作在足够长的时间里人介入次数的多少;二是看多个动作最终的准确率,假如有10个动作每个动作95%的准确率,最终准确率就下滑到不到60%的准确率 8、数据链上,大多数预训练公司的数据主要有70%数据用的是互联网的视频数据(缺乏action)和第一视角的数据(ego、umi等),剩下的一小部分用真机和仿真数据(涵action),所以像智元、星河图这种已经在场景侧搞了很多真机在一线的,基本上已经形成物理世界模型的数据飞轮了,别人后期再追就很难了 9、最后说说宇树,宇树目前只有出货量,没有形成物理世界模型飞轮,或者说它不做大脑,加上它的数据场景主要在表演和实验室,这些无法拿到优质的场景物理数据,所以相比于其他家还是有些弱,不过未来如果他跟大脑公司(比如蚂蚁灵波)合作的话是另外一番景象。
昨天下午跟一个做金融科技的朋友在办公室聊了会,他们10年前曾经是互联网金融时代的明星企业,现在因为行业整治、银行科技部各种打压、回款周期能达到5年等,使得他们日子变得非常困难,寻求金融+AI的转型,聊了一些东西分享给大家,避免大家做金融+AI的时候踩坑(还是说到哪算哪): 1、首先非常同情金融科技的国内从业者,以往都是靠高级人头外包赚钱,现在有了ai这个事情逐渐被银行科技部+ai接管了,业务越来越少了 2、银行结合AI要进场景,最大的拦路虎是金融机构的本地化要求,同时还没有特别多的预算,完全卡在那里,用一个上不了台面的30b或100b的模型在讲究,压根解决不了问题。这个方向上,唯一能做的就是金融FDE业务,靠大品牌接单然后交给FDE干活,相当于给高级人头外包换了个“时髦的title” 3、证券+AI是结合点最多的地方,但是基本上国内的同花顺、东方财富等都有自己的AI助手,基本上轮不到普通公司做,各大券商的工作人员需要的AI又极度个性化,所以大都是自己分析师、交易员、研究员等自己手搓,轮不到外界三方ai公司来搞,导致落地有极大的难度。 4、保险+AI也有很多落地,但基本上这个市场被瓜分差不多了,现在进入基本上有点晚了,除非有特殊资源。 5、其中我认为比较有价值的是股市kol+AI,反而是最有机会突破的一个方向,金融方向推理高价值且有量的地方可能也就这个方向了,其他的基本上没啥机会。 6、有人可能会说,弄一个个人财务助手AI、税务AI等,这些在国内是非刚需,国外还行。 7、还有一个方向是垂直金融maas,这个方向还没有人做,有很大的机会可以搞。 记得,7月份与国内的上市公司聊合作的时候,也是日子不好过,老板年龄又大无法理解新事物,内部以前的元老都是老人了,整体金融科技基本上没办法再做了(本质是金融高级人头外包),也是寻求金融+AI转型,目前整体看下来了就三个:股市kol+AI、金融fde、金融maas。
Box 的 CEO Aaron Levie 发了一条推文,引用了 Benchmark 合伙人 Jack Altman 的一个说法:在这一轮 AI 浪潮里,没有人真正知道自己在说什么,哪怕是非常聪明、消息非常灵通的人,也在不断地推翻自己的判断,然后过三个月再把推翻的东西翻回来。 Levie 接着补充了一个更具体的观察:现在 AI 行业里那些被人们坚定持有的信念,平均半衰期最多六个月。他列了一串行业曾经深信不疑、但到现在都没有定论的观点: 开源永远追不上闭源。实验室不可能大规模盈利。所有软