AI 修不好的东西:没有干净数据,自动化就有极限
如果训练素材本身就前后不一致,AI 助手给出的答案自然也会前后不一致。要解决的不是换一个更好的模型。
一个常见的需求是:做一个能回答业务问题的 AI 助手——库存、客户历史、订单状态,都从现有记录里抓取。这可以实现,但答案的质量上限是由记录本身决定的,不是模型。如果两个员工用三种不同方式记录同一类交易,助手继承的就是这种不一致,然后把它变成一句听起来很肯定、实际上是错的答案。
这不是在反对 AI,而是在强调顺序:先把重要字段整理干净,先说清楚以后怎么统一录入,再让助手去读它们。跳过这一步并不会省时间,只是把整理的工作推到后面——而且那时候,工具已经先失去了大家的信任。
在启动任何 AI 项目前,有一个有用的测试:挑十条真实记录,看一个称职的新员工只靠这些数据,能不能答对问题。如果人靠这些数据都答不对,AI 模型也做不到——它只会做得更快、说得更有信心而已。