智谱ZCode默认上传代码库引争议,官方道歉称已删数据
这事儿得从9月18日说起,有开发者发现智谱ZCode有点不对劲。它在默认开启“代码库索引”时,直接把用户工作区和完整的Git历史打包传到了云端。智谱那边赶紧出来道歉,说这个功能是生成Repo Wiki用的,上传的数据在页面生成后立马就销毁。
但说白了,这事儿没那么简单。这不是啥误操作,也不是产品配置搞错了。这么轻描淡写,完全低估了问题的严重性。代码泄漏的第一责任人,铁定是智谱自己。 道理很直白,用户用的是智谱的产品,客户端读什么、传什么,功能开不开,用户能不能拒,全由智谱说了算。
就算问题出在开源组件、外包团队或者技术供应商身上,智谱也没法把锅甩给一段代码。 更要命的是,ZCode传的还不是用户主动喂给模型的一小段代码,而是整个项目工作区和Git历史。这里面有啥?不光有现在的源码,还有没发布的功、删掉的文件、本地分支、提交者信息,甚至还有开发者以前误传后来又删掉的密钥。
对于一家软件公司来讲,这跟把研发过程、产品路线和内部家底全交出去没啥两样。换句话说,用户上传给模型的数据,都被拿去训练智谱自家的模型了。这就好比,要是企业员工用智谱的Coding模型干活,那公司的机密包括核心代码,在智谱模型眼里全是透明的。
最让人后背发凉的是,用户压根不知道自己数据已经离家出走。所以,智谱嘴上说数据删了,根本平息不了火。数据一旦上传,控制权就变了。它进没进日志、缓存、备份?有没有别的系统碰过?内部人看没看过?还是进了后续的数据清洗和训练流程?
用户在客户端哪能验证得了? 用模型就等于同意当训练素材?虎嗅找了业内人士聊,大模型训练数据主要两类来源。一类是公开数据和合成数据,另一类是真用户和模型的互动,像对话、反馈、文档、代码。大部分模型公司选前者,智谱选了后者。

公开网数据谁都能拿,真用户数据里藏着具体任务、真实工作流和人工修改结果。特别是Coding这块儿,用户提的问题、模型写的码、开发者怎么改怎么收,天生就是高质量训练样本。智谱这次代码泄漏,本质就是用用户隐私换高价值,代价用户扛,收益归厂商。
靠谱的厂商不会在用户不知情下,直接用企业或API客户的数据练模型。逻辑不复杂,用户交数据是为了办事,不是授权平台拿去做训练材料。前者是服务必需的处理,后者是二次利用,这俩得划清界限。 ZCode这事儿现在能确定的是仓库数据被传了,但还没公开证据证明代码真被拿去训练了。
正因如此,智谱得接着答:上传数据进没进训练池、评测集、优化样本或人工分析?“不保存”包不包括日志、缓存、灾备?历史数据能不能彻底追根溯源? 光靠一份道歉信,答不了这些问题。这事儿留给咱们的反思是,Agent能力越强,越得盯着边界。
AI编程Agent权限越来越大,能翻文件、读代码、跑命令,还能替用户改整个项目。但工具有了接近开发者的访问权,数据治理还停在默认勾选和模糊协议上,风险就失控了。 模型厂商确实需要更多真实数据来提升,这点没错。
但不该拿用户工作成果和企业隐私做交换。商业诱惑面前,光承诺“不用”不够。行业得有明确规矩:用户数据默认不训模型;代码、文档、交互记录分开授权;企业数据默认关上传;训练数据源要能查、能退、能审。 智谱说要开源ZCode并引入第三方审计,这步走对了。
但开源只能让大家看见客户端干啥,没法自动证明云端没存没用。真要公开的,是完整数据流向和审计结论。 这起风波最后拷问的,不只是一家公司的安全本事,更是整个模型行业肯不肯认下一条底线:用户用模型,不等于用户同意变成模型的训练数据。