刘琼
经济史反复证明,当关键投入品获得标准化度量单位,往往催生对应市场的快速扩张。电力有了“千瓦时”,才从实验室奇迹变成可交易的商品,第二次工业革命由此获得了可计价、可调度的基础设施。今天,一个类似量级的变化正在发生:大语言模型将人类的认知劳动转化为一种初步可计量、可定价、可交易的服务单元:词元(Token)。其标准化程度虽尚不及千瓦时之于电力,但已足以支撑一个快速扩张的市场。
一、词元经济正在发生什么?
词元是大语言模型处理信息的基本单位。一个中文汉字对应1.5到2个词元,一个英文单词对应1到1.5个。模型的每一次思考,无论是翻译一段合同、撰写一份报告还是分析一组数据,都以词元为输入、以词元为输出、以词元为计费单位。
词元经济的定义由此引出:以词元为核心计量和交易单位,围绕智能服务的生产、分发与消费所形成的经济活动体系。根据国家数据局监测数据,我国日均词元调用量从2024年初的约1000亿增加到2026年3月的140万亿,26个月增长约1400倍。
词元消耗的天花板正在被打开。一年前,多数用户与AI的交互还停留在聊天问答,词元消耗有限,一份月度订阅绰绰有余。但当AI从对话进阶到执行,做PPT、写报告、调研分析、调度多个工具,单次交互的词元消耗从几百跃升至数万乃至更高。Anthropic在2026年4月不得不切断了部分第三方工具对Claude的调用,原因是用户通过AI智能体24小时持续运行,200美元的包月套餐实际消耗了价值5000美元的词元。获取智能服务正在从一种偶尔的工具使用变为持续的日常消费行为,消耗强度仍在快速爬升。
这一跃升已有学术量化。2026年4月,斯坦福、MIT等机构联合研究首次系统测量了AI智能体的词元消耗:在编程任务中,智能体的词元消耗约为普通代码对话的1000倍,且同一任务不同次运行的消耗差异可达30倍。更值得注意的是,消耗越多不等于效果越好,准确率往往在中等投入时达到峰值,高投入反而下降。这组数据同时印证了两件事:词元消耗的天花板远未封顶;以及单纯以总量衡量词元经济,可能严重失真。
词元经济扩散节奏并非均匀渗透。Anthropic对数百万次交互的持续追踪显示,使用场景正在结构性分层。编程仍占消费端对话的35%,但其形态正在迁移,从人机对话转向API端的自动化工作流(如Claude Code),前十大任务类型在消费端的集中度从24%降至19%。与此同时,使用场景向低门槛方向扩散:个人用途从35%升至42%,体育赛事、产品比较、家居维护等日常查询增长明显。国内的结构与此类似。豆包大模型调用数据显示,非结构化信息处理和分析占比最大,教育、内容创作和搜索推荐紧随其后,互联网行业的调用量远超其他行业。
定额付费的商业模式正在失效。如上所述,当单次交互的成本差异达到数量级,使得定额付费的商业模式无法覆盖成本。为此,从硅谷到国内,主要公司同步做了一次系统性的商业模式迁移。2026年4月28日,GitHub宣布其编程助手Copilot将于6月1日从固定订阅转向按词元消耗量计费。国内月之暗面4月发布Kimi K2.6时,API输入价格较上一代上涨58%。腾讯云、阿里云等企业在4月全面转向按词元用量计费。从按人头收费到按消耗量计价,以及按效果付费,词元经济的定价正在沿着价值链逐层上移。
二、理性看待消耗量激增
词元消耗量在激增,但这个数字需要拆开看。电力是同质商品,词元是异质服务。电力消耗量扩大意味着经济活动等比例扩大。词元消耗量扩大却未必如此。同样回答一个法律问题,一个给出准确的判例分析,另一个只是流畅的废话。Anthropic对使用时长超过六个月的用户和新用户的对比发现,老用户的任务成功率比新用户高出10%,即消耗的词元未必更多,但每个词元撬动的成果更大。同一份数据还显示,模型降价10%只能带来约3%的使用量增长,意味着用户对能力的敏感度远高于对价格的敏感度。词元经济的增长不能简单地用“更多”来衡量,还必须追问“更好”。换言之,这不是一场规模的军备赛和行业间的竞争叙事。
词元消耗量之于智能经济,类似云计算用量之于数字经济,都是技术扩散期最直观的活跃度信号。云计算行业花了十多年才摸透一个道理:采用量和转型深度之间的距离,比想象中宽得多。麦肯锡的追踪显示,绝大多数企业认为自己已从上云中获益,但实际衡量过云带来新收入增长的不到三分之一。原因之一是云支出天然异质,同一笔预算花在基础存储和花在智能分析上,回报完全不同,用总支出一个数字概括,差异就被抹平了。词元同理,一次闲聊和一次关键决策辅助消耗的词元数量可能相当,价值天差地别。总量指标在扩散早期有信号价值,但不能当终局度量衡。发展智能经济的关键不在于生产更多词元,而在于让每个词元创造更高价值。甚至可以预见,当行业找到更贴近任务完成度或决策质量的度量方式时,词元作为核心计量单位的地位可能会让渡给上层指标,正如云计算的计费从“机器跑了多久”演进到“完成了什么服务”。
价值差异具体体现在使用方式上。Anthropic从2025年起持续追踪这一分化:企业通过API接入AI时,词元消耗长期以自动化为主导,包括流程替代、批量处理、无人值守运行;而个人用户在消费端的情况正好相反,自动化占比从最初的47%一路降至41%,增强型使用反超,例如辅助写作、知识问答、方案探索,人始终在回路里。同一种中间投入品,在不同场景下的经济逻辑完全不同:企业端追求效率替代,个人端追求能力延伸。一个经济体的词元消耗结构偏向哪一边,决定了产业升级是“挤水分”还是“长新肉”。光看总量,分辨不出这个区别。
三、词元经济下一步发展建议
词元经济已在编程、数字内容、知识服务等领域跑出早期验证。但从早期验证到规模化运转,还需要在度量、定价和生态三个层面同步推进。
第一层是度量。词元已是计量单位,但计量不等于度量价值。词元经济缺乏一个“能效比”度量衡:每百万词元创造了多少可验证的价值?没有这个指标,行业就无法区分有效增长和虚耗膨胀。度量体系的终极方向也不是更精确地数词元,而是建立任务完成度和决策质量的上层指标。我们今天之所以还在谈论词元,恰恰因为这套上层度量尚未建成。
海外已有雏形可借鉴。TokenMix、Awesome Agents等第三方评测平台开始发布模型“性价比排行榜”,以标准化任务的完成率除以每任务美元成本对模型进行排名,同一编程任务,最高效模型与最低效模型的单位成本差距可达50倍。这类“每美元能力值”指标正从开发者社区的非正式工具,演变为模型选型的第三维度。我国可在此基础上,由行业组织牵头建立面向编程、翻译、研报撰写等可验证场景的标准化能效基准,将其纳入政府采购和公共服务的选型标准,用需求侧力量倒逼供给侧优化。
第二层是定价。目前按量计费正在取代固定订阅,但这只是从一种单一模式走向另一种单一模式。真正健康的市场需要多种定价模式并存,让用户根据场景选择:轻度使用者按次付费,重度使用者包月买断算力额度,高价值决策场景按效果付费。正如出行市场同时存在公交、打车和购车,不同弹性的需求匹配不同的价格结构。海外已出现分化:Sierra按解决结果收费,Anthropic将对话与智能体执行分轨计费,OpenAI为愿意等待的批量任务提供半价折扣。多种模式并存,用户各取所需。
国内定价模式已开始分化:按量付费是主流,厂商之间有梯度定价,金融、电商等领域也出现了按任务计价和效果分成的试点。但整体丰富度仍有限,多数中小企业面对的选择余地较窄。建议从两端推进:需求侧在代码审查、合同审阅、客服工单解决等产出可验证的场景扩大“按交付成果结算”的试点范围;供给侧鼓励厂商探索阶梯计费、按任务包计费、效果分成等多元定价,满足不同场景的用户需求。
第三层是生态。当前词元消耗的主力是智能体工作流。但智能体要大规模走进千行百业,需要多个层面的生态条件同步就绪:企业系统需要从为人设计转向机器可调用(开放API、结构化数据接口);垂直领域需要高质量的专业数据集支撑智能体在行业场景中可靠决策;复杂任务需要成熟的多智能体编排和协作框架;企业需要细粒度的动态授权与执行审计机制来建立信任。
生态培育没有捷径。一方面,鼓励头部厂商将模型能力、智能体编排框架、系统对接协议等底层组件标准化、产品化,把智能体开发从定制工程,逐步降低为标准化搭建。另一方面,吸引更多初创企业进入词元经济的应用层,在垂直场景中构建差异化的AI原生应用,丰富供给侧的长尾生态。前者提供基础设施和能力底座,后者负责把能力带入真实场景。两侧同步推进,词元经济的飞轮才真正转得起来。这些方向其实已经逐渐形成共识。国家正在推动的全国一体化算力网、高质量行业数据集等建设,本质上都是在为这套生态提前铺路。
电力获得“千瓦时”之后,真正的爆发不是来自发电量本身的增长,而是后来涌现出的无数电器与用电场景。词元经济也是一样。真正的爆发,不在词元本身,而在越来越多AI 应用开始持续消耗词元,并进入社会运行的真实场景。
(作者系腾讯研究院资深专家)










预告

回放



