AI模型说“全开源”,先查这5项
一个AI模型写着“全开源”,你会直接下载吗?今天提交的 LLaDA-Image 论文正好提供了一个很实用的检查样本:论文强调“fully open training recipes”,官方仓库也已放出权重和推理代码;但截至本轮核验,训练代码仍标着 coming soon。这个差别值得所有选模型的人记住——“开放”不是一个开关,而是五层资产。
【来源事实】LLaDA-Image 是约 6B 参数的图像生成模型,采用 Diffusion Transformer,并用冻结的视觉语言模型做文本编码。论文称其训练使用约2.2亿样本,其中98%是真实图像,超过90%支持仅图像训练。官方模型表列出 Base 版50步、Turbo版4步采样;作者在 Qwen-Image-Bench 上报告英文53.53、中文53.38,并称为该表开源模型最高成绩。
真正值得收藏的是这份“开源五项审计”:
1. 权重:能否直接下载,格式和版本是否清楚?
2. 推理:代码、依赖、示例能否在你的环境跑通?
3. 训练:训练脚本、超参数、数据处理和复现命令是否齐备?
4. 数据:来源、授权、清洗规则和合成数据比例是否说明?
5. 许可:是否有明确许可证,商用、再分发和衍生模型有什么限制?
【专家判断】只有前两项,适合“试用”;五项越完整,才越接近可复现、可维护、可合规地采用。LLaDA-Image 当前仓库已发布权重与 Diffusers 推理代码,训练代码仍列为待发布;GitHub API 本轮也未识别出许可证。因此,此刻更准确的说法是“配方已详细公开、核心推理资产已到位,但复现与许可闭环仍需继续核对”。
边界也要看清:论文成绩来自作者报告,不等于你的业务实测;论文还指出长文本、多区域排版会随复杂度增加而变得不稳定,原生2K生成尚未评估。把这五项抄进模型选型表,比只看排行榜更有用。
一手 图像生成 AI工具 模型评测
