WAIC 2026(2026世界人工智能大会)上,中国工程院院士、之江实验室主任、阿里云创始人王坚的演讲题目为《让科学数据成为基础模型的原住民》

本文根据 WAIC 2026 世界人工智能大会暨人工智能全球治理高级别会议主论坛下午场,中国工程院院士、之江实验室主任、阿里云创始人王坚的演讲内容整理。

在一个全场都在讨论 AI 能替人干多少活的会场上,王坚院士讲了另一件事:今天的人工智能其实还没有真正碰到科学,它碰到的只是科学论文。他从一个 18 岁高中生用退役卫星的旧数据发现近 150 万个太空物体的故事讲起,一路推到地球科学里那些不会说话的石头——光谱、地震波、化石,占了关键信息的七成以上,却全都不在文本里。他的结论是,真正的出路是让科学数据本身成为大模型的源头,而不是让模型去读别人写完的论文。
以下为演讲内容:
各位嘉宾,大家好。
我今天想从一个例子讲起。
2024 年 11 月,有一篇文章发表在一本天文学领域的顶级期刊上。它只有一个作者。今天的人工智能论文,动辄有几十个、上百个作者,只有一个作者的文章已经很少见了。更有意思的是,这位作者发现了将近 150 万个此前没有被编目的太空物体。
如果只是这样,大家可能还不会特别吃惊。但如果我告诉你,这位唯一作者是一名 18 岁的中学生,而且他使用的数据来自一颗已经退役的卫星;那颗卫星当初收集这些数据,本来并不是为了完成他后来做出的发现,而是用于监测小行星等其他目标。这个故事就很值得我们重新思考:我们对数据的理解,可能还远远没有到位;同时,科学发现的专业逻辑,也可能正在发生巨大的变化。

他不是一位做了很多年研究、读完博士又继续做博士后的科学家。他只是一个高中生,尽管他是在 Caltech 做了实习工作。这让我想起一本关于科学革命结构的书。范式变革发生的时候,常常会出现一种现象:人们能够从旧数据里发现新问题。这几乎是科学变革中的一个基本逻辑。
大家都知道,伽利略当年用的数据,也并不都是他自己重新找来的新数据。所以,在今天这个时代,我们必须对“数据”有一个重新认识。
一、基础模型为什么重要
在人工智能领域,大约在 2021 年,斯坦福的一组教授写过一篇报告,第一次明确提出了今天大家都在使用的一个概念:Foundation Model,也就是基础模型。

我们今天讲模型、讲大语言模型,但“基础模型”这个概念,是到 2021 年才被这样明确提出的。它的重要性在于,它让我们意识到:数据不是简单地喂给模型的材料,而是模型能力形成的根基。
这也是我今天为什么要讲,科学数据应该被放进基础模型。
今天我们说“大模型”,在中文语境里,很多时候会把“大语言模型”里的“语言”两个字省掉。但事实上,完整地说,大语言模型是建立在文本数据上的基础模型。它的根本能力,来自人类对文本数据的长期积累和处理。
但处理文本这件事情,并不是人工智能出现以后才有的。
我们作为在中文环境里读书的人都知道,中国古代的典籍,最初是没有标点符号的,甚至也没有今天意义上的空格。中文是到一百多年以前,才逐渐开始系统使用标点符号。古拉丁文在早期也是如此,没有空格,也没有标点符号。

没有标点符号会带来什么影响?一个人如果不把这句话读出来,就很难完成阅读和理解。所以,对文本进行处理这件事,早在人类文明史中就已经存在。用今天的观点看,在文本之间加入空格和标点,某种程度上也可以理解为一种早期的 Tokenization。
今天的大语言模型,把人类对文本的处理带到了一个前所未有的高度。Tokenization 是其中非常关键的一环。
二、科学不应该只停留在论文文本里
再回到科学。
很多年前,我就开始和一些地球科学家讨论:我们怎样用人工智能帮助地球科学?
事实上,早在十几年前,也就是人工智能还没有像今天这样流行的时候,科学家们就已经提出过三个非常朴素、但极其重要的要求。
第一,科学家需要获取所有相关的科学数据。
第二,科学家需要获取相关领域的研究文章和论文。
第三,科学家需要一个基础设施。如果换一个说法,也可以把它叫作公共设施。
今天回过头来看,人工智能其实远远没有满足第一个条件。我们今天大多数所谓“AI 帮助科学研究”的工作,仍然停留在文本层面。也就是说,我们更多是在让模型读论文、读文章,最多再看一看论文附带的代码,而不是让模型真正触碰科学数据本身。
代码是一个很好的例子。
如果你学习编程,最早接触代码的时候,可能也是在一个文本编辑器里。但为什么 Coding 在今天变得这么重要?因为在模型里,代码没有被简单地当成另一种普通文本。
大家可以想一想:中文和法语之间的差别,中文和英语之间的差别,可能都没有英语和代码之间的差别那么大。代码作为一种数据,恰恰展示了数据如何驱动 AI 的思考。
所以今天我们要问:当人工智能帮助科学研究时,它到底是在理解科学,还是只是在理解科学论文?
如果只是把科学论文的文本读一读,把论文里的代码看一看,那它仍然没有碰到科学数据本身。它理解的仍然只是人类已经写出来的科学知识,而且是被论文形式表达出来的那一部分。
你可以想象,这后面还有多大的空间。
在地球科学里,70% 以上的重要信息并不在文本中。比如光谱、地震波、地层、化石、岩石样本,它们都不是传统文本。我们常说多模态模型,“一张图胜过千言万语”。但在科学里,可能一段光谱、一段地震波,就胜过千万张图。

这件事非常有意思。
三、什么是科学基础模型
所以,几年以前,我们定义了一个概念:科学基础模型。
所谓科学基础模型,就是建立在科学数据基础上的模型,而不是建立在科学论文文本基础上的模型。
它的目标非常清楚:让科学数据成为大模型的源头。
这里面当然有一个很直接的工作,就是要把科学数据做 Tokenization。可是最终,我们要做的不只是把科学数据切成 token。真正的科学基础模型,是要把文本、代码以及科学数据放到同一个空间里,放进同一个模型里,让模型能够统一处理这些信息。
从这个意义上说,科学基础模型不是一个 vertical model,不是一个简单的垂直模型。今天我们一讲到某个具体领域,就很自然地想到:这是不是一个垂直模型?但我今天讲的不是这样一个独立的、狭窄的技术模型。
科学基础模型应当改变我们对科学数据的整体理解。
四、让石头“说话”:地球科学里的例子
我很快举一个例子。这个故事还在进行当中。
大家都知道,地球科学很大一部分是在研究石头。石头是不会说话的,但所有这些工作,其实都希望石头能够“说话”。石头说话的目标也很简单:我们想知道这个世界是怎么演进的。

地球已经有几十亿年的历史。生命什么时候出现,恐龙什么时候出现,人类什么时候出现,这些问题都放在一个非常巨大的时间尺度里讨论。这里的时间精度,往往是以百万年为单位来计量的。
和地球科学家打交道以后,我逐渐明白了一件事情:人类最基本的目标之一,是能够在地球上生活得更长久一点。但要做到这一点,我们必须更好地理解地球的长时间尺度。
这很难。
所以,地球科学家和人工智能合作的一个基本目标,就是把对地质时间的认识精度,从过去常见的百万年尺度,推进到万年尺度。这是几个数量级的提升。大家都知道,在科学里,精度提升几个数量级,是非常重大的事情。
我们和南京大学、中科院南京地质古生物研究所等团队合作,做了一个地球科学模型。这个模型规模并不大,但已经做出了一些很有意思的工作。
要理解这项工作,首先要理解化石。
化石里既有时间信息,也有空间信息。但化石记录有一个重要问题,古生物学里叫 Signor-Lipps effect。简单来说,最后一个消失的物种,不一定会留下最后一个化石。一个生物能不能变成化石,本身是随机的。我们找到的某个物种最后一件化石记录,并不意味着那就是它真正消失的时间。
所以,当你根据化石推断年代时,并不能简单地说:它就是在那个时间点消失的。这种效应使得我们对时间的确定变得非常困难。
这恰恰是人工智能可以帮助的地方。
今年 7 月 1 日,在一次地质学会议上,相关团队展示了一项工作:参考十万种不同生物的种类、近两万多个地层剖面的数据,用模型把这些信息真正放到一个统一的时间轴上。这大概是目前世界上最完整、也最精确的相关时间轴之一。

大家可以想象,如果我们最终能够把百万年级别的精度推进到万年级别,我们对这个世界的理解会变得完全不一样。
我们也很高兴,这项工作近期入选了联合国“科学促进可持续发展国际十年”相关认可清单。大家可以由此看到,人工智能对基础科学的推动,已经不是一个抽象的口号。
五、科学基础模型也需要全球治理
当然,要完成这样一个全球性的事情,治理结构非常重要。
尽管这只是地球科学这样一个领域里的人工智能模型,但我们在将近四年多以前,就建立了一个全球治理结构的委员会。这些专家和机制,对这项工作在全球范围内产生影响,发挥了非常重要的作用。

这也说明,科学基础模型不是某一个机构、某一个实验室、某一个国家可以单独完成的事情。它需要科学共同体、数据共同体、模型共同体和治理共同体一起参与。
六、人工智能会像数学一样基础
最后我想说一句话。
因为有了科学基础模型,人工智能到了一个非常不一样的转折点。
这个转折点就是:人工智能会变得像数学一样基础。它不再只是某一个领域里的独立工具。
大家可以想一想,数学在人类科学史上起了什么作用。
未来五十年,人工智能对科学研究所起的作用,可能也会像数学一样深远。
谢谢大家。
www.smartcity.team


