来源:求是网 清华大学计算机科学与技术系
以词元为引擎推动智能经济高质量发展
唐杰
清华大学计算机科学与技术系教授
一、何为词元
首先,词元具备可计量、可定价、可交易特性,重构了技术供给与商业需求的衔接机制。作为大模型调用规模的统计单位,它精确量化了智能服务的消耗。作为计费单位,它推动软件商业模式从传统的授权订阅向按需调用转变,使得智能服务如同水电般即取即用,为人工智能产业规模化落地提供了清晰的量化基础与交易可能。
其次,词元是动态生成的、高密度的数据要素。与传统数据作为静态记录的生产要素不同,词元代表正在生成的、经过模型活化后的知识。它不仅包含文本语义切片,也涵盖图像、音视频等多模态信息的向量化表达,蕴含了模型在特定任务上的推理、生成和决策过程,是数据要素经由大模型加工后形成的、可直接服务于生产生活的智能形态。
再次,词元具有长期稳定性与技术中立性,具备智能时代价值锚点和计量语言的属性。词元不绑定特定技术路线或单一厂商,具有高度普适性。如同石油时代的“桶”与电力时代的“度”,掌握词元这一计量单位,实质上等同于掌握了智能经济基础设施的定义权与计量权。确立基于词元的数字经济底座,对于我国在全球智能经济竞争中掌握标准制定权与定价主导权具有重要意义。
二、词元作为智能经济发展引擎的三个维度
2026年4月29日至30日,以“加快数智技术创新发展,深入推进数字中国建设”为主题的第九届数字中国建设峰会在福建省福州市举行。2025年全国日均词元调用量从年初的超1万亿增长到年末的100万亿,2026年3月进一步提升至140万亿,这表明数据要素价值在加速释放。图为4月29日,参观者在峰会现场体验区参观国产化算力底座。 中新社记者 王东明/摄
三、在词元驱动下我国智能经济发展呈现新特征
一是模型智能水平提升面临瓶颈,偏重工程优化而原理突破不足,在自主推理、长程规划、多模态融合、安全对齐等方面与国际领先水平存在差距,在基础理论、底层技术、核心算法等方面创新仍有不足。
二是词元调用存在结构性矛盾,聊天、文生图等消费级应用的调用量大而商业收益低,中小企业级应用市场虽然增长迅速但整体渗透率仍有待提高,大量高价值调用沉淀在企业内部封闭系统中,未能转化为开放平台API生态红利。
三是词元产出向实体经济价值的转化率不高,特别是在工业制造、科研创新等高附加值领域渗透率偏低,等等。解决好这些问题,才能进一步发挥好词元的引擎作用,为我国智能经济发展注入更强驱动力。
四、充分发挥词元驱动智能经济高质量发展的引擎作用
作者介绍

姓名:唐杰
职称:教授
邮箱:jietang@tsinghua.edu.cn
主页:https://keg.cs.tsinghua.edu.cn/jietang/
教育背景
工学博士 (计算机科学与技术), 清华大学, 中国, 2006
社会兼职
TKDD: 执行主编;
IEEE TKDE, ACM TIST, IEEE TBD, Science China: 编委
中国计算机学会中文信息技术专业委员会:副主任
中文信息学会社会媒体处理专业委员会:副主任、秘书长
KDD 2018:大会副主席
WWW 2018, CIKM 2016, WSDM 2015, ASONAM 2015: 程序委员会主席
研究领域
人工智能,社交网络,数据挖掘,机器学习,知识图谱
研究概况
研究兴趣包括:社会网络分析、数据挖掘、机器学习和知识图谱。
主要创新性研究包括:
1)社会影响力分析:提出基于话题的社会网络影响力模型,针对大规模社会网络进行用户级别的微观建模,自动计算用户之间基于不同话题层次的影响力强度,为定量化、细粒度的网络影响力分析给出理论基础,部分解决了影响力最大传播模型的输入假设问题。
2)社会网络用户行为建模:将社会网络的基础理论(结构平衡理论、两阶段传播理论、结构洞理论等) 融入概率因子图模型中对社会网络关系和强度进行定量描述,实现了社会网络关系挖掘的统一学习算法。
3)网络行为建模和影响力分析,提出了针对社会网络的微观动态分析方法,并首次提出了社会影响力的量化分析方法,以及社会网络行为和社会影响力关联关系的分析方法。
4)应用上述研究成果,研发了完全自主知识产权的科技情报大数据挖掘与服务平台AMiner。系统2006年上线以来,已收录论文文献2.3亿、学者1.3亿,为全球学者免费提供学者、文献等科技信息资源检索及学者评价/推荐、技术发展趋势分析、产业发展报告等特色服务。吸引了来自全球220个国家/地区的1000多万次独立IP访问。
研究课题
国家杰出青年基金项目:知识发现与知识工程(2019-2023)
国家自然科学基金与英国皇家学会联合基金项目:社交网络群体行为分析(2015-2017)
863课题:基于行为心理动力学模型的群体行为分析与事件态势感知技术(2014-2016)
国家优秀青年基金项目:知识发现与知识工程(2013-2015)
IBM国际合作项目: 社会网络搜索和挖掘 (2007-2011)
国家自然科学基金重点课题: 面向Web的社会网络理论与方法研究 (2010-2013)
863课题: 基于概率图模型的异构XML数据集成与检索 (2009-2010)
国家自然科学基金课题: 统一的语义内容标注模型研究 (2008-2010)
奖励与荣誉
2017年北京市科学技术奖一等奖(排名1)
2016年微软亚洲研究院合作研究奖
2015年牛顿高级学者基金
2013年中国人工智能学会(CAAI)吴文俊人工智能科学技术(进步)一等奖(排名1)
2012年CCF青年科学家奖
2011年北京科技新星
2011年清华大学优秀员工
2010年清华学术新人奖
2006年度清华大学优秀博士论文
学术成果
[1] Jiezhong Qiu, Yuxiao Dong, Hao Ma, Jian Li, Chi Wang, Kuansan Wang, and Jie Tang. NetSMF: Large-Scale Network Embedding as Sparse Matrix Factorization. In Proceedings of the Web Conference 2019 (WWW’19) (accepted). [PDF]
[2] Yi Qi, Qingyun Wu, Hongning Wang, Jie Tang, and Maosong Sun. Bandit Learning with Implicit Feedback. In Proceedings of the Thirty-Second Annual Conference on Neural Information Processing Systems (NIPS’18). [PDF]
[3] Jie Tang, Tiancheng Lou, Jon Kleinberg, and Sen Wu. Transfer Learning to Infer Social Ties across Heterogeneous Networks. ACM Transactions on Information Systems (TOIS), 2016, Volume 34, Issue 2, Article No. 7. (if =1.3) .[PDF] [Data&Code]
[4] Jing Zhang, Zhanpeng Fang, Wei Chen, and Jie Tang. Diffusion of “Following” Links in Microblogging Networks. IEEE Transaction on Knowledge and Data Engineering (TKDE), 2015, Volume 27, Issue 8, Pages 2093-2106. [PDF]
[5] Jie Tang, Sen Wu, and Jimeng Sun. Confluence: Conformity Influence in Large Social Networks. In Proceedings of the Ninteenth ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD’13), pages 347-355. [PDF] [Slides_PPT] [Slides_PDF] [Poster]
[6] Tiancheng Lou and Jie Tang. Mining Structural Hole Spanners Through Information Diffusion in Social Networks. In Proceedings of the Twenty-Second World Wide Web Conference (WWW’13), pages 837-848. [PDF] [Slides_PPT] [Slides_PDF]
[7] Jie Tang, Sen Wu, Jimeng Sun, and Hang Su. Cross-domain Collaboration Recommendation. In Proceedings of the Eighteenth ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD’12), pages 1285-1293. [PDF] [Slides_PDFSlides_PPT] [Poster]
[8] Jie Tang, A.C.M. Fong, Bo Wang, and Jing Zhang. A Unified Probabilistic Framework for Name Disambiguation in Digital Library. IEEE Transaction on Knowledge and Data Engineering (TKDE), 2012, Volume 24, Issue 6, Pages 975-987. (if =2.236). [PDF]
[9] Jie Tang, Jimeng Sun, Chi Wang, and Zi Yang. Social Influence Analysis in Large-scale Networks. In Proceedings of the Fifteenth ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD’09), pages 807-816. [PDF] [Slides][Code]
[10]Jie Tang, Jing Zhang, Limin Yao, Juanzi Li, Li Zhang, and Zhong Su. ArnetMiner: Extraction and Mining of Academic Social Networks. In Proceedings of the Fourteenth ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD’08), pages990-998. [PDF] [Slides] [Author-Conference-Topic (ACT) Model (source code)](Top 3 cited papers among all KDD 2008’s papers,More…)

