聊聊高质量数据集与Token经济
2026年3月,中国日均Token调用量突破140万亿。两年前,这个数字是1000亿。两年,一千倍。
同一个月,国家数据局局长刘烈宏在中国发展高层论坛上正式为Token定名——"词元"。他说,词元不仅是智能时代的价值锚点,更是连接技术供给与商业需求的结算单位。
两个月后,国家数据局印发《关于推进行业高质量数据集建设行动的实施方案》,其中一句话石破天惊:
"探索词元交易等新型数据集交易模式,构建以词元为基础、可量化、可定价的数据集价值体系。"
这是国家层面第一次将Token写入正式政策文件。数据不再按"条"卖、按"GB"称,而是要按"词元"计。
很多人没意识到:这背后藏着一个巨大的范式转换——高质量数据集是AI的燃料,Token是AI的计价器。两者结合,正在重塑数据要素的底层逻辑。
一、先看一个真实案例
2026年5月28日,青岛数据资产登记评价中心为青岛华大基因研究院的"千种海洋生物基因测序数据资源集"完成了一项特殊的数据产权登记。
特殊在哪?这是全国首例以词元为核心计量单位的数据产权登记。
DNA序列中的每个碱基对,被精准映射为可计量的词元,总量达725.4T Token。基于这套计量体系,研究院清晰评估出该数据集的市场价值——7000余万元。
"关键就在于'词元'这一颗粒度极细的核算基础,"青岛华大基因研究院副院长徐梦阳说,"可以准确计算每一个基因特征从测序、组装到功能注释的全流程投入,并结合其在生物医药靶点、合成生物学元件等应用场景中的预期收益贡献进行折现。"
如果用传统方式——按条数、按GB——来给这堆基因数据定价,根本估不出来。因为"条目或存储计量无法反映数据中蕴含的知识密度"。
这就是Token经济的第一个价值:给数据一把真正能衡量知识密度的尺子。
二、Token经济为什么突然爆发?
先理解一个基本事实:Token是AI处理信息的最小计量单位。你向AI提一个问题,AI生成一段回答,这个过程就是在消耗Token。
过去两年,Token消耗量经历了三次爆发:
第三次爆发的关键推手是智能体(Agent)。
传统大模型是"人问AI答",一轮对话消耗1000到3000个词元。但Agent不一样——它能自主执行任务,一个中等任务需要10万个词元,复杂任务可达百万级。业内把OpenClaw框架戏称为"词元粉碎机"。
IDC预测,到2030年全球活跃AI智能体将达22.16亿个,年度Token消耗量从2025年的0.0005 PetaTokens暴增至15.2万 PetaTokens,增长超3亿倍。
这意味着什么?Token正在成为AI时代的基本计价单位,就像电力的"度"、石油的"桶"。
黄仁勋在2026年GTC大会上提出了"Token工厂"的概念:数据中心不再是存储文件的"电子仓库",而是一座日夜运转的智能生产线——输入电力和数据,产出Token。
用一句话说:电力和数据是原料,Token是产品,AI是生产线。
三、传统数据定价为什么失灵?
Token经济爆发的背景,是传统数据定价方式的全面失灵。
目前数据交易市场的主流定价方式有三种:按条计费、按存储量计费、按字段计费。三种方式有一个共同问题——无法反映数据的"语义有效性"和知识密度。
举个例子。一段100字的病历摘要和一段100字的天气描述,字数相同、条数相同、存储量相同,但知识密度天差地别。按条卖、按GB卖,本质上是在"论斤称"——把数据当农产品卖,而不是当知识资产卖。
数据要素有三个特殊性,决定了传统计量必然失灵:
第一,非消耗性。一份数据被用100次,价值不减反增。按"件"卖,每次都是一次性买卖,完全忽略了数据可反复使用的特性。
第二,价值场景依赖。同一份交通流量数据,用于城市规划值10万,用于保险精算值100万,用于自动驾驶模型训练值1000万。按条计费只能反映"数据量",无法反映"在什么场景下值多少钱"。
第三,多源融合分账难题。当A企业的交通数据、B企业的气象数据、C企业的地理数据融合产生价值1000万的数据产品,各方各应分多少?传统计量方式彻底失灵。
青岛数据集团首席数据官赵传启一针见血:"按'条'或'字段'计费,无法准确度量数据量的多少,更无法体现数据的真实价值。"
数据市场缺一把"尺子"。Token就是这把尺子。
四、高质量数据集:Token经济的"弹药库"
Token的产出依赖什么?高质量数据集。
截至2025年底,全国已建成高质量数据集超过10万个,总体量超过890PB——相当于中国国家图书馆数字资源总量的310倍。
2026年6月8日,国家数据局正式印发《关于推进行业高质量数据集建设行动的实施方案》,这是国家层面首次对数据赋能AI发展做出的系统性部署。
方案部署了六大专项行动,形成一条完整的"数据飞轮":
① 强基扩容——拓宽数据供给,建设多模态数据集,为AI提供充足"燃料"
② 标注攻坚——推动标注从"以人为主"向"人机协同、专家参与"转型
③ 提质增效——构建AI-Ready质量标准,降低训练推理成本
④ 应用赋能——打造"场景→数据→模型→应用"飞轮闭环
⑤ 管理服务——全生命周期管理,落实数据权益制度
⑥ 价值释放——探索词元交易、数据资产质押,培育为数据付费的市场共识
注意第六条——"价值释放"行动中,明确提出了"探索以词元(Token)为基础的价值体系"。
这不是巧合。高质量数据集和Token经济是一体两面的关系:
高质量数据集是"原料"——决定了Token产出的质量和密度
Token是"计量器"——决定了数据集价值的可量化、可定价
两者结合,构成AI时代的"数据→价值"闭环
更关键的是,方案推动商业模式从"卖数据包"向"API调用→模型化解决方案→全栈服务"梯次跃升。这意味着,未来数据交易的形态不是给你一个文件包,而是按Token消耗量计费——你用了多少有效知识,就付多少钱。
五、Token定价:从"论斤卖"到"论知卖"
2026年6月,中国工业互联网研究院联合国家信息中心等近百家机构发布《Token驱动智能经济研究报告》,创新性构建了Token价值度量的五维体系:
报告指出,Token定价正从单一成本核算向"成本约束+智能溢价+结构差异+价值弹性+竞争浮动"的复合定价模型演变。
什么意思?同样消耗一个Token,通用对话的Token和医疗诊断的Token,价值完全不同。前者可能值0.001元,后者可能值1元——因为后者注入了行业知识,经过了专业标注,能解决高价值问题。
这也解释了当前市场的一个深层矛盾:通用Token正在"通胀",垂类Token严重"稀缺"。
大模型可以流畅对话,但一旦进入金融风控、医疗诊断、电力调度等垂直场景,通用Token就力不从心。企业真正需要的,是经过行业知识"精炼"的垂类Token。如果把通用大模型比作"发电厂",那垂类Token就是"精炼油"——不生产基础Token,而是把行业原始数据精炼成大模型可以直接高效使用的高价值Token。
各家大模型的Token定价差异也反映了这一趋势。以2026年7月为例,KIMI K3输出Token定价100元/百万tokens,DeepSeek V4-Pro仅6元,智谱GLM-5.2为28元,阿里Qwen3.7-Max为36元。价格差异背后,是模型能力、数据质量、场景适配度的综合体现。
六、TDN:Token的"高速公路"
《Token驱动智能经济研究报告》还提出了一个创新概念——TDN(Token分发网络)。
TDN将Token纳入新型基础设施统筹,形成三层产业协同范式:
底层 · Token工厂——实现高质量Token的规模化量产
(能源+芯片+数据集+大模型 = 标准化Token产出)
中层 · 调度分发层——承担智能路由、交易撮合与合规交付
(类似电力调度中心,匹配供需、定价交易)
顶层 · 消费层——支撑多元主体按需调用
(企业、Agent、个人用户按需消费Token)
三大运营商已经全部上线词元套餐:中国电信个人版最低9.9元/月含1000万词元,企业版299.9元/月含1.5亿词元;中国移动5元体验包起;中国联通15元/月起。
三大运营商从"流量经营"转向"Token经营",不是跟风,而是生存本能——当Token成为AI时代的基本消费单位,谁能搭建从生产到消费的完整链路,谁就能占据价值链的制高点。
七、从"数据不动"到"词元动"
回到青岛的实验,赵传启用一句话概括了整个范式:
"数据不动,词元动。"
这六个字信息量极大。传统数据流通面临一个根本矛盾:数据提供方不愿分享数据(怕泄露、怕失控、怕被白嫖),但数据只有流通才能产生价值。
Token计量提供了一个解法:原始数据不需要离开持有方的环境,但数据中蕴含的知识可以被量化为Token,Token可以流通、交易、定价。
这就形成了一条完整的链路:
词元计量(确定价值)→ 产权登记(确认权属)→ 收益分配(量化分账)→ 资产化变现(ABS/信托)
2026年5月20日,全国首单纯数据资产信托收益权ABS在深交所发行,首期5.32亿元,全网吸引19.8亿元资金认购,超额认购3.72倍。这是数据首次以独立核心资产的身份登陆资本市场——不再依附于土地或厂房抵押。
全国政协委员、中国社科院研究员黄群慧给出了一个判断框架:"词元经济的本质,是让'智能'像电力一样可计量、可定价、可交易。一家工厂的收入,取决于词元生产效率与规模的乘积。"
八、四类参与者的机会窗口
给数据持有方:终于可以给数据产品打上"含金量"标签。过去按条卖10元/万条的数据,如果词元计量后发现知识密度很高,完全有理由定价10倍以上。适合拥有专业领域高质量数据的企业——医疗、金融、工业、基因测序等。
给AI企业:训练数据的投入产出比终于可量化。过去花100万买数据集,效果好不好只能靠模型跑出来再评估。现在可以用词元计量预先评估数据集的"有效知识密度",把钱花在刀刃上。
给数据交易所:终于有了"标准化产品"的抓手。过去挂牌的数据产品定价靠拍脑袋,现在可以按词元计量提供可量化、可对比的定价基准。青岛数据集团已率先试点,各地数据交易所应跟进。
给企业技术决策者:关注三个趋势——预算从CDO向CAIO转移、上下文层成为新基础设施、Token从"人消费"转向"Agent消费"。现在是从数据治理向Token治理转型的窗口期。
九、三个判断
判断一:Token将成为数据要素市场的"度量衡"。从"按条卖"到"按知卖",不是要不要的问题,而是什么时候的问题。青岛已经跑通第一个闭环,政策已经开了口子,剩下的就是速度问题。
判断二:垂类Token将比通用Token贵100倍。通用Token的门槛越来越低,价格持续下降;但注入了行业知识、经过专业标注的垂类Token,因为知识密度高、场景价值大,将享有巨大溢价。迅策科技2025年营收同比增长103%,人均创收290万元,就是市场用真金白银在投票。
判断三:Agent将驱动Token消费从"人"转向"机器"。一个企业部署1000个智能体,每个每天消耗100万Token,一年就是3650亿Token。IDC预测到2030年全球活跃Agent达22亿个。Token需求的下一波暴涨,不来自人类用得更多,而来自机器自己开始消费。
最后的话
从1000亿到140万亿,两年千倍增长的Token调用量,证明AI应用的爆发已经发生。但数据价值的计量方式,还停留在前AI时代。
高质量数据集给了AI充足的"燃料",Token给了数据一把新的"尺子"。两者结合,正在把数据要素市场从"论斤卖"推向"论知卖"。
国务院发展研究中心陈波提醒:"要更好实现'优质优价',还需要加快构建与场景深度耦合、覆盖'能力、底线、价值'三维框架的词元质量评价标准体系。"
词元经济不是万 能药,它解决的是"计量"问题,不是"流通"问题。但至少,数据定价终于有了一个可以争论的基础——从"公说公有理"变成了"用词元算算看"。
对数据持有方、AI企业、数据交易所和算力运营商来说,现在是了解和试点的窗口期。等到词元交易的规则完全成熟再入场,可能又晚了。
数据不动,词元动。
这六个字,可能就是未来十年数据要素市场最底层的运行逻辑。