“有人送你500个Token,有人送他500个Token,但你的500个Token可能很值钱,他的500个Token可能不值钱。”9月10日,在2026外滩大会“Token效率:推动Agent智能提升与广泛应用的关键”论坛上,中国工程院院士、清华大学计算机科学与技术系教授郑纬民如此表示。
郑纬民解释,之所以会出现上述差异,是因为Token价值涉及多个指标。当前“Token工厂”建设如火如荼,但只有高效的Token产能才能真正把算力变成有价值的输出。
Token是货币,币值有高低
驱动智能体的Token正在成为新的“石油”,Token需求指数级增长。郑纬民表示,实际上,Token与Token并不相同。
例如,首Token延迟(TTFT)是用户发送请求到接收第一个输出Token的时间间隔,TTFT越小,用户体验越好。每秒生成的Token数(TPS)越高,说明生成速度越快,用户体验也越好。此外,能同时服务多少用户、高峰期会不会卡顿,同样直接影响使用体验。这些指标的表现越好,Token的价格越高。
“Token是智能体经济里的货币。”源码资本投资合伙人、美国国家工程院外籍院士张宏江在外滩大会开幕式上同样表示,既然Token是货币,就会有币值高低之分。“我们希望看到的是最有价值的Token。所以我们说Token是新一代的 ‘茅台’——你要的是 ‘茅台’,而不是一般的烈酒。”
Token价格的本质是服务等级定价,从聊天到智能体,Token输出速度的价值逐级放大,厂家将速度产品化,形成独立的可选服务等级。
郑纬民表示,AI工厂的最终产品是高质量Token,能源与算力只有经过模型和推理系统才会转化成为可供业务消费的智能服务。大模型负责内容质量,模型决定了生成质量上限,推理系统决定了交付质量。只有把模型和推理这两个环节都做好,才能产出高质量的Token。张宏江也表示,智能体能力越强、大模型能力越强、算力越强,Token的价值就越高。
当前“Token工厂”建设虽热火朝天地推进,但并不意味着产出高效的Token。郑纬民提到,国产卡方案由于显存容量和带宽限制,与先进算力相比仍存在一定差距。
Token效率面临需求爆发、算力低效、能源供给受限的结构性失衡问题。蚂蚁集团平台技术事业群总裁骆骥介绍,以GPU为核心的硬件搭建起计算集群、提供推理服务时,GPU的平均利用率目前不足30%,部分企业级数据中心甚至低于10%。这在过去的通用计算时代是难以想象的。
进入AI时代,无论是编程还是智能办公,智能体长程任务消耗的Token不断增长。而Token的背后是数据中心、算力和电力,电力又直接对应碳排放。骆骥介绍,2025年,全球数据中心碳排放超过2.86亿吨,比预期高出57%。这些挑战共同指向结构性失衡的深层次矛盾。
优化Token效率,智能水位不下降
为了构建能生产高质量Token的工厂,目前清华大学正在探索架构创新。
大模型输入处理阶段(Prefill)计算密集,一次性处理所有输入,计算量大,延迟高。缓存阶段(KVCache)保存中间结果,被多次复用。输出生成阶段(Decode)带宽密集,每次生成一个输出,计算量小,但次数多,这要求内存带宽高、延迟小、容量大。郑纬民介绍,清华大学探索以KVCache为中心的分离架构,大幅降低集群推理成本,“将异构协同投入到千卡级的商业生产中,还供不应求。”
骆骥认为,必须在绿色计算的框架下解决Token效率问题。所谓绿色计算,本质上是一条从碳排放到业务转化的链路。过去提出的绿色计算转化链路,在AI时代增加了一个关键环节,即Token。Token效率既追求让每个Token承载更高的智能价值,也追求以更低成本、更快响应、更少能耗与更低碳排放实现更多有效智能产出。
“我们不能只顾着优化Token效率,却牺牲了智能水位。”骆骥表示,任何Token效率的提升,都必须以保持一定智能水平为前提,智能不能出现明显退化。其次,市面上的GPU卡型多样,模型系列也各不相同,要把它们组合起来优化Token效率,挑战极大。
在应用侧,还要解决Token“黑盒”问题和Token消耗治理。在智能体和应用层方面,要管住Token膨胀,让Token花在真正产生业务价值的地方。此外,他认为,Token效率的基准测试和标准体系亟待建立。“没有一把统一的尺子,就很难判断某个应用系统、某个AI创新应用、某个模型或某个推理系统的Token效率到底好不好,最后只能各说各话。”
骆骥表示,Token是AI时代新经济的硬通货,就像干旱地区的水源,需要统筹治理、多方共同优化。因为一个地方种树保水并非越多越好,过度同样可能会影响上下游。
“未来分配Token的权利和有效使用Token的权利非常关键。将来我们可能拥有一个规模庞大的智能体协作网络,但不要忘记,在这样的网络背后,每个智能体能被分配多少Token、能否高效使用被分配的Token,才是这个网络持续发展的关键。”骆骥判断,那些绿色、高效使用Token的智能体,未来反而可能获得更多Token分配。
需要的帮助
非常重视自身产品及用户体验,欢迎广大用户向我们提出相关产品及业务系统的意见和反馈,以帮助我们提升产品性能及用户体验。
- 高性能GPU/模拟接口设计平台

