【大模型/评测】近期大模型发布与评测要点如下:
【京东开源JoyAI-VL:让AI从“有问必答”进化为“见机行事”】京东近日开源了JoyAI-VL-Interaction,这是一个8B规模的实时视觉语言交互系统(repo:jd-opensource/JoyAI-VL-Interaction)。不同于传统的你问我答模式,它更像是一个有眼力见的观察者:通过摄像头实时监测环境,自主判断何时该保持安静,何时该主动开口提醒。项目不仅开放了模型权重,连同训练配方、400万条时间对齐的交互数据以及包含语音识别与合成的完整部署架构也一并打包。在实时监控告警、动态计数和时间感知等58个真实场景测试中,这个8B小模型在特定交互表现上甚至优于豆包和Gemini等大参数产品。这件事的价值在于打破了交互的被动性。现在的AI大多像个待命的接线员,你不拨号它就不响;而JoyAI尝试解决的是“临场感”问题,比如锅里的水开了、孩子走向火炉、球赛到了精彩瞬间,这些瞬间转瞬即逝,等你组织好语言提问,时机早就过了。虽然8B规模在通用知识储备上无法与巨头抗衡,但在视觉触发的主动性上,它证明了通过高质量交互数据训练,小模型也能在特定垂直领域实现更自然的陪伴。对于开发者来说,这套全栈开源方案极大地降低了构建实时视觉助手的门槛,让AI从屏幕里的对话框,变成了一个真正能感知物理世界流动的参与者。
【Gemini 3.5 Transcribe:是更聪明的速记员,还是自作聪明的编辑?】谷歌推出的 Gemini 3.5 Transcribe 标志着语音转文字从“听写”向“理解”的跨越。这款模型不仅将延迟降低了70%,更核心的卖点在于“智能清理”:它能自动过滤掉口癖、冗余的“嗯啊”,甚至能处理“周二,哦不,周三见面”这种自我修正。目前该模型已通过 API 开放,并集成在安卓 Gboard 和 macOS 客户端中,支持超过85种语言的自动检测与混合识别。这件事的争议点在于“智能”与“失真”的边界。虽然 2.6% 的字错率(WER)在数据上很漂亮,但其默认的智能模式可能会为了文本整洁而删掉说话人的情绪垫片,比如“我本想犹豫一下”被直接精简为“我确认”,导致语境中的犹豫感丧失。对于需要精准记录的法律或医疗场景,这种“过度编辑”可能是灾难。此外,虽然谷歌在多语言混合识别上进步明显,但圈内人更看重它在复杂背景噪音和专业术语下的表现。相比于 Whisper 等老牌模型,Gemini 的优势在于与生态系统的深度整合,比如在 macOS 上通过语音直接触发其他模型的函数调用。但对于开发者来说,如何在低延迟和高准确度之间平衡,以及是否愿意将敏感的语音数据交给云端巨头,依然是比技术参数更现实的考量。
清华下场做了教育版的Codex,还是开源的。 和一个还在做 AI 教育培训的老板闲扯,我说兄弟,ChatGPT、豆包这些 AI 产品都已经这么强了,随便问什么问题,它都能通俗易懂地给出,你那卖课的生意怎么还能有市场? 反正我很久都没打开得到 App 了。 这哥们告诉我说,市场在收缩,但仍然还是有市场。 因为很多用户早已经习惯了通过课程学习。就像 B 站,教程仍然非常受欢迎。 ChatGPT 能回答问题,但大部分人要的不只是答案,而是一整套视频课程,这样有人能带着他逐步往前走。 而在这样的学习场景里,ChatGPT 更像助教,跟课程是互补关系。这么说也有道理。 不过,我随即又想起之前自己用过的一款清华大学做的 AI 驱动的课程产品 OpenMAIC,应该挺多人不知道。我把链接发给了他。 结果这货晚上回去给我发消息说,他突然觉得很多课已经没有存在的意义。 并且,OpenMAIC 是基于 MIT 协议开源的,任何人都可以部署。 最近,这个产品又有不少更新,我感觉它现在已经越来越像教育领域的 Codex 了。强烈推荐大家试试。 它可以根据你的偏好和已有的背景知识,直接生成一门课。而且在学习的过程中,哪里搞不懂,随时打断提问。这才是真正意义上的因材施教。
一家名为 Warmwind 的德国公司,历时三年研发了一款“AI 操作系统” warmwind OS,核心思路是给每个人提供真正自主运行的数字劳动力。 现在大多 AI 工具都依赖聊天框,满屏滚动的文字不仅不够直观,还需要用户去折腾各种 API 和复杂的配置。但实际上,我们日常 90% 的工作都发生在视觉空间,需要频繁操作各种软件界面。 warmwind OS 借鉴了德国经典工业设计理念,追求极致的简约。它最吸引人的是 “教学模式”,你不需要写复杂的提示词,只要点击录制并对着电脑说话,像教新人一样演示一遍操作,比如在 Gmail 里看邮件、去 SAP 系统查数据再回信,它就能自动生成工作清单并开始干活。 它不会替代你