我个人使用体验,Fable 5.1,已经达到我心目中的AGI状态了。至少在我们自己的benchmark上测试,已经达到State of the Art了。目前最长运行48小时左右,纯自动化,不间断的任务,除了贵,没有一丁点问题("贵"是最容易解决的问题之一)。长任务里最难的,一群AI做了500个实验之后,还能不能交叉出各种实验结果之间的联系?这方面,我可以说,目前已经达到生产级标准了。
GPT-6今天对企业也发布了,还没试,但看性能基本也和5.1相当,长任务表现可能会更好一些。风云激荡啊。时代,前进!