懂你所需,做你所想
二十多年互联网行业经验
AI 项目的事故,十有八九出在数据上,不是出在模型上。有三类数据碰之前必须三思——未脱敏的个人信息、核心商业机密、受监管行业数据。碰了就是事故,不是优化,轻则赔钱重则追责。
姓名、电话、身份证直接喂模型,违反个人信息保护法,这是硬线,碰了就是违规。
必须先脱敏:替换、哈希、泛化后再用,能训练能分析,但对不上真人,合规又可用。
连内部培训材料里也别出现真实客户信息,演示用假数据,别图方便留隐患。
这条线最容易被'就试一下'的心态越过,必须立规矩、写进流程,不能靠自觉。
一次违规的代价,远超你省下的那点方便。
脱敏 前置动作 | 个保法 合规依据 |
配方、报价策略、客户名单一旦进了第三方模型,出去就收不回来,这是不可逆的泄露。
能用本地部署的,别走公有云;必须上云的,签合同写明不用于训练、不留存、可删除。
演示环境用脱敏样本,别图方便拿真数据跑给人家看,屏幕一截图就出去了。
机密数据的原则是'能不见人就不见人',本地闭环永远比信任第三方更稳。
数据分级不是形式主义,是给项目买的一份出事时的免责保险。
商业秘密一旦进过别人的模型,就不再是秘密。
医疗、金融、政务数据有专门的管理要求和流向限制,不是技术能绕过的。
跨境、跨主体流动要先过合规审查,先问法务再问技术,顺序不能反。
不确定能不能用,宁可先放着,也别先用了再补手续,那时候已经晚了,补救成本极高。
监管红线没有'试一下',要么合规要么不做,中间地带最容易出大事。
遇上拿不准的数据,默认按'不能碰'处理,宁可错过机会,也别用一次省事换一场事故。
我们交付前必做数据分级,红线数据一律隔离、本地处理、签保密条款,三道锁。
合规不是慢,是让你夜里睡得着,也让我们敢在交付物上签字,双方都安心。
AI 的边界由数据划定。三类红线碰不得,守住它们,项目才走得远、睡得安稳,别让一次省事变成一次事故。