不是数据不够用了,而是数据不太容易获得了
从去年开始,就有很多人说未来所有的大模型的能力都会趋同,因为训练方法类似,数据也一样,因为我们这个世界的数据已经不够用了,现在大模型训练都要用AI生成数据了。
确实我也看到过这方面的消息,好像是从一个老美的AI巨头那边传出来的。数据不够用这一说法我是不认同的,我觉得不是数据不够用了,而是数据不太好采集了。因为AI巨头十分容易获得所有的已经数字化的数据,但是无法获得保存在人的脑子里的数据。这些数据中有一些是十分关键和重要的,那就是各种行业KNOW HOW的数据。最珍贵的数据都在专家甚至每个从业者的脑子里,并没有形成数字化的资产,这些数据是极难采集的。
从本质上来说,并不是AI训练所需要的数据不够用了,而是更高价值,对AGI更为重要的数据不太容易采集了。
而目前这种情况正在改变,ChatGPT、Claude等工具正在让人陷入一种疯狂的状态。Vibe Coding让很多专家上瘾,很多以前他们无法做的事情,在这些AI工具的帮助下都可以快速、低成本完成了。于是大量的专家开始使用这些AI工具。我也是其中的一员,疯狂地把脑子里的想法总结出来,然后变成数字资产。
在这个过程中,人脑子里的宝贵资产都被AI企业所收集,变成新模型的训练数据。大家是否已经注意到,随着AI CODING的热度提升,国外的模型厂商迭代大模型的速度越来越快了?模型训练所需要的算力对他们来说相对充足,而通过Coding平台获取高质量数据的能力也在不断提升。GPT-5.6七月才发布,Codex周活用户从600万快速飙升到1000万+,而8月份GPT-6也将正式上线了。
反观国产模型厂商,不知道是算力不足还是其他原因,并没有推出能够与Claude或者Codex竞争的Coding Plan和AI Coding平台,从而吸引中国的开发者从Codex等平台中转移过来。我也十分担心这种局面持续,是否会影响国产顶 级模型的竞争力。
现在十分火的WorkBuddy等智能体等也是实现这种知识采集的高级武器,我觉得如果这个智能体能继续火下去,腾讯的混元模型早晚也是能跻身于第一梯队的。