2026年7月18日,2026世界人工智能大会期间,由国泰海通主办的“智见AI 合创未来”人工智能投融资论坛在上海世博中心成功举行。
论坛上,国泰海通发布《生根与重构:全球人工智能趋势全景白皮书(2026年)》(下文简称“白皮书”),以一年为观察周期,从资本市场全景、产业政策演进、产业链革新、全球巨头战略风向四个维度,系统梳理全球AI产业的最新格局。

国泰海通研究与机构业务委员会副总裁、研究所所长路颖于论坛现场介绍白皮书内容。

公众号“智慧城市行业分析”,回复关键字“生根与重构”,获得报告
以下为白皮书摘要:
全球人工智能资本市场全景:2026Q1中国与海外AI投融资分化,中国融资、上市同步回暖,海外融资边际回升但上市放缓。AI技术正从资本驱动转向产业驱动,在千行百业中加速生根,重构资本配置逻辑与一二级市场定价体系。2026Q1中国AI融资事件数同环比大幅增长,资金加速向AI软件应用及物理AI(具身智能、智能驾驶)赛道集中,早期融资占比达64.6%,反映开源生态繁荣下的创业热潮;上市端,中国IPO数量同环比均上升,芯片与应用层企业上市进程加速。2026Q1海外AI融资事件数同环比回升,但非全面复苏,资金高度集中于头部基础模型与部分软件应用公司,非头部企业融资环境未实质改善;海外上市端明显放缓,2026Q1无AI企业上市,反映二级市场对高溢价AI项目趋于理性,但2026Q2头部模型公司相继递交IPO文件,或带动2026H2海外AI产业链IPO回暖。 全球人工智能产业政策演进:2025年以来,全球AI政策的重点集中在治理规则落地、算力建设以及“人工智能+”场景应用扩展,为AI扎根实体重构发展框架与基础设施底座。中国方面,“人工智能+”行动、场景培育、智能体规范、伦理审查、深度合成标准和AI计量体系等陆续推进,政策重点覆盖模型、数据、算力、应用环境和安全治理等环节;算电协同、算力网建设等进一步强化基础设施支撑。海外方面,美国强调技术管制、芯片出口限制和全栈生态绑定;英国围绕主权AI与产业赋能推进能力建设;欧盟、日本、韩国聚焦AI工厂、本土大模型、GPU采购和产业基金等加快布局;东南亚和中东依托地缘优势、能源禀赋和主权资本,通过数据中心、制度创新和区域枢纽建设,在全球AI版图中抢占差异化生态位。 全球人工智能产业链革新:2025年以来,全球AI产业链的迭代集中在模型能力升级、基础设施效率优化与应用工程化交付三个层面。模型层面,大语言模型从参数扩张转向系统效能优化,围绕混合架构、原生多模态、后训练、长上下文及推理预算展开;物理模型以VLA(感知到动作)与世界模型(物理推演)并行推进;视频生成模型在短片段场景中初具商业化条件,长视频仍受一致性约束;Agent正从单次任务向持续运行演进。基础设施层面,训练侧聚焦整柜化交付,系统级有效算力、互联效率与HBM供应链决定集群交付节奏;推理侧围绕单位token成本,优化KV Cache管理、PD分离与异构芯片分层部署;边缘侧推进端边算力分层部署,软件工具链与预集成能力重要性上升。应用层面,机器人进入工业量产和家庭场景验证阶段,智能驾驶依靠仿真、端到端模型和运营车推进落地,企业Agent、AI编程、视频生成、金融等场景也在逐步形成可交付产品。 全球人工智能巨头战略风向:2025年以来,全球AI龙头战略集中于算力、模型、平台与场景落地。海外厂商中,英伟达围绕GPU、网络、液冷、AI工厂及物理AI工具链扩展基础设施;谷歌依托Gemini、TPU、云平台及搜索、办公等入口推进AI落地;微软以Azure和Copilot为核心,通过开发者工具与企业智能体平台强化软件生态;OpenAI通过模型分层、ChatGPT Agent、Codex及算力合作覆盖消费端与企业端市场;Anthropic聚焦Claude的可靠性、安全治理及企业工作流。中国厂商中,华为以昇腾算力、盘古模型及行业解决方案推动全栈落地;百度依托文心、飞桨、千帆平台及昆仑芯服务企业市场;字节跳动通过豆包、火山引擎及终端语音助手扩大生态覆盖;阿里巴巴以通义千问开源生态和AI云服务推动产业交付;腾讯通过混元模型与微信、游戏、广告、办公等场景衔接B端和C端。

以下为报告精选:
【数字经济研究】生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告
1. 全球人工智能资本市场全景
1.1. 中国人工智能产业链融资复盘
2026Q1中国AI产业链融资事件数同环比均呈上升态势。基于一级市场主流数据库数据整理:1)2025年,中国AI产业链共发生2820起融资事件(Q1~Q4分别为587、678、748、807起),全年呈现逐季上升态势;2)2026Q1中国AI产业链共发生1332起融资事件,较2025Q1同比+745起,较2025Q4环比+525起。2026年以来,AI推理成本显著下降,开源模型与闭源模型性能差距持续收窄,降低了AI应用落地的技术门槛与试错成本,直接扩大了可融资项目的供给池;同时,AI应用侧部分细分场景已形成可验证的商业化闭环,为一级市场提供了更清晰的估值参照,两端合力推高了当季融资事件数。
按产业链划分,2026Q1中国AI下游应用服务层融资事件数占比最高、增量贡献最大。基于一级市场主流数据库数据整理:2026Q1中国AI产业上游算力基础设施层融资事件数234起、占比17.6%,同比/环比+131/+123起;中游模型与支撑层融资事件数213起、占比16.0%,同比/环比+104/+64起;下游应用服务层融资事件数885起、占比66.4%,同比/环比+510/+338起。下游应用服务层中,硬件行业融资事件数563起、占比42.3%,同比/环比+323/178起;软件行业融资事件数322起、占比24.2%,同比/环比+187/+160起。下游应用服务层是AI产业链的融资主力,贡献了2026Q1全产业链同比增量的68.5%、环比增量的64.4%。2025Q1~2026Q1上游算力硬件层融资事件数占比保持在13.8%~17.7%区间,各季度波动幅度不大,在模型训练与推理服务对万卡集群、算力节点的需求继续高速增长的背景下,算力硬件层保持了较稳定的资本配置比例。
细分行业中,2026Q1中国AI软件应用、物理AI(具身智能)、物理AI(无人/智能驾驶)融资事件数占比较高。基于一级市场主流数据库数据整理:1)从融资结构来看,2026Q1中国AI软件应用/物理AI(具身智能)/物理AI(无人/智能驾驶)行业融资事件数为322/172/115起,占比24.2%/12.9%/8.6%,位列前三;其余行业融资事件数占比均在8%以下。2)从融资增量来看,2026Q1 AI软件应用、AI相关零部件及传感器、物理AI(工业机器人)、核心支撑芯片融资事件数环比增加较多(+160/+62/+46/+46起);AI软件应用、物理AI(具身智能)、智能AI硬件融资事件数同比增加较多(+187/+100/+64起)。
整体来看,当前AI融资已从单一环节的集中投入,扩展至应用、整机、上游元件多环节同步升温的格局。底层大模型技术趋于成熟,降低了新产品的试错成本,缩短了开发周期,直接推高了下游软件应用的融资活跃度。这一趋势在政策端也得到了呼应,2026年6月,上交所正式发布AI大模型企业适用科创板第五套上市标准审核指引,明确“在申报时至少有一个大模型产品已完成上线发布并实现规模化应用”,为符合条件的商业化AI企业提供了明确的制度入口与审核标尺,降低了政策不确定性。智能驾驶高速发展、具身智能正处于从试点向落地应用探索的过渡阶段,其产业链条长、可投标的细分程度高,也维持了较高的融资密度。同月,上交所拟通过规则修订,在科创板新增机器人等二级行业,有望提振一级市场投资情绪。此外,上游芯片、零部件及传感器环节的事件增量亦较为明显,主要与算力基建扩张、物理AI端逐步放量背景下的产业链繁荣传导与国产供应链崛起有关。
我们将融资轮次分为早期融资、中期融资、后期融资、IPO及其他。其中,早期融资包括种子轮(含种子+轮)、天使轮(含天使+~天使+++轮)、Pre-A轮(含Pre-A+~Pre-A+++轮)、A轮(含A+~A++++轮、A1~A3轮);中期融资包括Pre-B轮(含Pre-B+~Pre-B+++轮)、B轮(含B+~B+++轮);后期融资包括Pre-C轮~H轮、Pre-IPO(含Pre-IPO~Pre-IPO+轮);IPO上市(含SPAC上市);其他包括战略融资、债权融资、股权融资、定向增发等。
按融资轮次划分,2026Q1中国早期融资占比最高。随着开源模型能力的持续跃升和推理成本的进一步下降,大量轻量化AI创业公司在垂直细分赛道中涌现,叠加“投早、投小、投硬科技”的政策导向,资本在早期阶段集中布局。基于一级市场主流数据库数据整理:2026Q1早期融资/中期融资/后期融资/IPO/其他融资事件数860/181/120/23/148起,占总融资事件数的比重为64.6%/13.6%/9.0%/1.7%/ 11.1%,较2025Q1同比+501/+115/+82/+18/+29起,较2025Q4环比+384/+102/+55/ +6/-22起。早期融资占比高且增速快,反映出技术门槛下降后创业生态的活跃;中后期融资虽呈温和增长态势,但增幅明显低于早期且占比提升有限,表明资本在中后期阶段仍较为审慎。
细分融资轮次中,2026Q1中国天使轮、A轮融资事件数占比较高。基于一级市场主流数据库数据整理:1)从融资结构来看,2026Q1中国天使轮/A轮融资事件数为342/332起,占比25.7%/24.9%、位列前二,其余轮次事件数占比均在13%以下。2)从融资增量来看,2026Q1中国天使轮/A轮融资事件数较2025Q1同比+215/+166起,较2025Q4环比+150/+162起,同环比增量均位列前二;天使轮、A轮的爆发,反映出资本对新一轮技术长波周期的集体押注;B轮融资事件数较2025Q1同比+104起,较2025Q4环比+92起,增量位列第三,成长期可投项目供给有所增加。此外,2026Q1中国战略融资事件数为54起,同比/环比+33/+11起,反映了产业巨头与国资进场“占位”的趋势,华为、小米、阿里等产业巨头(CVC)及各地政府通过直投方式加速布局AI领域,旨在构建技术与生态闭环,引导产业发展方向。
从融资金额来看,大额融资主要出现在物理AI、芯片、基础大模型等行业。基于一级市场主流数据库数据整理:2025Q1~2026Q1,以赛力斯(两轮累计61.2亿人民币,战略融资)、优必选科技(10亿美元,战略融资授信协议)为代表的物理AI行业公司,以摩尔线程(80亿人民币,IPO上市)、澜起科技(70.43亿港元,IPO上市)等为代表的芯片行业公司,以阶跃星辰(超50亿人民币,B+轮)、智谱AI(43.48亿港元,IPO上市)为代表的基础大模型行业公司,融资金额处于较高水平。
1.2. 海外人工智能产业链融资复盘
2026Q1海外AI产业链融资事件数同环比均呈上升态势。基于一级市场主流数据库数据整理:1)2025年海外AI产业链共发生1440起融资事件(Q1~Q4分别为416、400、345、279起),呈现逐季下降的趋势;2)2026Q1海外AI产业链共发生436起融资事件,较2025Q1同比+20起,较2025Q4环比+157起。从融资总量看,海外资本市场从2025年度的审慎态度出现边际回暖,但这并不意味着市场的全面复苏,而是呈现出鲜明的结构性分化特征——资金高度集中于头部基础模型公司以及部分AI软件应用公司,非头部AI初创企业的融资环境并未实质性改善。
按产业链划分,2026Q1海外AI下游应用服务层融资事件数占比最高。基于一级市场主流数据库数据整理:2026Q1海外AI产业上游算力硬件层融资事件数29起、占比6.7%,同比/环比+16/+16起;中游模型与支撑层融资事件数92起、占比21.1%,同比/环比+3/-3起;下游应用服务层融资事件数315起、占比72.2%,同比/环比+1/+144起;下游应用服务层中,硬件行业融资事件数62起、占比14.2%,同比/环比+15/+21起;软件行业融资事件数253起、占比58.0%,同比/环比-14/+123起。2025Q1~2026Q1上游算力与基础硬件层融资事件数在2.8%~6.7%之间低位波动,与中国15%左右的占比数据相比,海外算力硬件层行业集中度更高,设计和流片成本与产能壁垒使得该赛道已进入由科技巨头主导的资本开支竞赛阶段;中游模型与支撑层融资事件数占比在20%~35%之间波动,2026Q1环比小幅回落,或与部分头部中游企业已进入IPO预备期、一级市场股权融资阶段性让位于上市进程有关;下游应用服务层是融资活动的重心,融资事件数占比维持在60%以上,2026Q1环比增量主要由软件行业融资活跃度修复所拉动,复苏以结构性局部回暖为主。
细分行业中,2026Q1海外AI软件应用、支撑软件/工具/生态融资事件数占比较高。基于一级市场主流数据库数据整理:1)从融资结构来看,2026Q1海外AI软件应用/(支撑软件/工具/生态)行业融资事件数为253/48起,占比58.0%/11.0%,位列前二;其余行业融资事件数占比均低于5%。以上结构表明,软件应用仍然是AI商业化最直接的落地场景,支撑工具链的稳固占比也反映出开发者基础设施作为“卖铲者层”的持续受关注。2)从融资增量来看,2026Q1 AI软件应用、物理AI(具身智能)、物理AI(AR)行业融资事件环比增加较多(+123/+7/+7起);核心算力芯片、核心支撑芯片、AI相关零部件及传感器、物理AI(具身智能)行业同比增加较多(+6/+5/+5/+5起)。物理AI(具身智能)是2026Q1融资增量的一大亮点,头部公司量产预期正牵引资金前移;上游芯片、零部件及传感器的扩张则与全球AI算力需求的持续扩张直接相关。需要注意的是,AI软件应用增长更多体现为季度间的周期性修复,而非趋势性反转,2026Q1 AI软件应用同比-14起。
按融资轮次划分,2026Q1海外早期融资占比最高。基于一级市场主流数据库数据整理:2026Q1海外早期融资/中期融资/后期融资/IPO/其他融资事件数218/72/ 71/0/75起,占总融资事件数的比重为50.0%/16.5%/16.3%/0.0%/17.2%,较2025Q1同比-35/+25/+21/-11/+20起,较2025Q4环比+57/+29/+31/-1/+41起。与2025Q1相比,2026Q1早期融资事件数有所回落,中后期融资占比温和提升,反映出AI投资进入深水区后,资本从“广撒网”向“精选化”收敛,资金对商业化验证与盈利可见性的要求明显抬升。但早期创新探索的热度并未因资本趋于谨慎而消退,2026Q1早期融资事件数环比增幅领先;投资人在保持对前沿技术关注的同时,更加注重在早期阶段锁定具备清晰落地路径的标的。
细分融资轮次中,2026Q1海外A轮、种子轮、B轮融资事件数占比较高。基于一级市场主流数据库数据整理:1)2026Q1海外A轮/种子轮/B轮融资事件数为114/75/72起,占比26.1%/17.2%/16.5%,位列前三;其余轮次事件数占比均在10%及以下。2)从同比来看,2026Q1 A轮、B轮事件数分别增加20、25起,位列前二,中期融资占比温和提升,资金向具备商业化验证潜力的成长期项目集中;种子轮事件数同比减少56起,降幅显著,主要受早期估值泡沫持续出清影响。从环比来看,A轮、B轮融资事件数分别增加49、29起,增幅领先各轮次,投资人在保持对前沿技术关注的同时,更倾向于在A轮阶段锁定具备明确商业化路径的标的;并购事件环比增加20起,反映出在IPO通道持续收窄、企业上市退出受阻的背景下,产业资本与头部企业正借助估值回调窗口,通过并购方式加速整合AI技术资产与市场份额,并购正取代IPO成为重要的退出与扩张路径;种子轮事件数环比减少7起,降幅有所收窄,但受限于少数大额融资项目的吸聚效应,资金在种子轮进一步向少数头部项目集中。
从融资金额来看,大额融资主要出现在AI软件应用和基础大模型行业。基于一级市场主流数据库数据整理,海外以Wiz(320亿美元,并购)为代表的AI软件应用公司,和以OpenAI(1100亿美元,战略融资)、Anthropic(130亿美元、300亿美元,战略融资)为代表的基础大模型公司融资金额较大。
1.3. 中国人工智能产业链上市企业复盘
2026Q1中国AI产业链上市企业数量同环比均呈上升态势。基于一级市场主流数据库数据整理:1)2025年中国AI产业链共有32家企业上市(Q1~Q4分别为5、4、6、17家),分季度总体呈现上升态势;2)2026Q1中国AI产业链共有23家企业上市,较2025Q1同比+18家,较2025Q4环比+6家。2026Q1中国AI产业链上市数量抬升,主要受终端硬件景气度上行与IPO审核节奏加快共同带动。大模型应用向端侧迁移使产业链企业营收确定性增强,叠加硬科技上市路径逐步清晰、前期辅导项目集中进入申报发行阶段,当期IPO节奏呈现阶段性提速。
按产业链划分,AI下游应用服务层上市企业数占比最高。中国AI行业中,下游应用层是上市主力,终端硬件在下游子板块中占据主导。基于一级市场主流数据库数据整理:2026Q1中国AI上游算力硬件层共9家企业上市、占比39.1%,同比/环比+8/+5家;中游模型与支撑层共4家企业上市、占比17.4%,同比/环比+2/+0家;下游应用服务层共10家企业上市、占比43.5%,同比/环比+8/+1家;下游应用服务层中,硬件行业共9家企业上市、占比39.1%,同比/环比+8/+4家;软件行业共1家企业上市、占比4.3%,同比/环比+0/-3家。这一格局的形成有多重原因:需求端,大模型应用向边缘端和终端迁移,带动下游物理AI与智能硬件出货上行,并同步拉动上游芯片与模组需求;商业模式上,硬件企业以产品销售为核心,收入确认清晰,现金流可预测,更易满足上市审核的财务指标要求;政策端,国家重点支持硬科技方向,相关企业上市通道更加通畅。
细分行业中,2026Q1中国核心支撑芯片行业上市企业数量最高、同环比增量领先。基于一级市场主流数据库数据整理:1)从上市企业结构来看,2026Q1中国核心支撑芯片/核心算力芯片/智能AI硬件行业上市企业数量为4/3/3家,占比17.4%/13.0%/13.0%,位列前三。2)从上市企业增量来看,2026Q1核心支撑芯片、核心算力芯片行业上市企业数量同比增加较多(+4/+3家),智能AI硬件、核心支撑芯片等行业上市企业数量环比增加较多(+3/+2家);芯片公司新增上市数量领先,主要与AI算力需求爆发及国产替代加速直接相关,下游终端出货增长也拉动上游芯片需求;智能AI硬件环比增长则反映了端侧AI应用放量对硬件市场的拉动。此外,AI软件应用行业上市企业数量环比下降较多(-3家),主要与软件企业商业化成熟度待验证,以及2025Q4集中上市形成的高基数有关。
从上市地点来看,2026Q1中国AI产业链上市企业中,香港交易所主板上市数量占比最高,且同环比增量最多。基于一级市场主流数据库数据整理:1)从上市企业结构来看,2026Q1中国AI上市企业中,香港交易所主板共20家企业上市、占比87.0%;上交所科创板共2家企业上市,占比8.7%;北交所共1家企业上市,占比4.3%;上交所主板、深交所主板、深交所创业板2026Q1均无AI企业上市。2)从上市企业增量来看,香港交易所主板上市企业数量同比/环比+18/+6家,增量领先,主要与18C章程的优化、互联互通机制的深化、港股对AI科技侧叙事接纳度更高有关;上交所科创板同比/环比+2/-1家,环比下降主要与2025Q4高基数有关(3家芯片公司集中在2025年年末上市)。
从募集资金来看,基于一级市场主流数据库数据整理,2025Q1~2026Q1,中国以赛力斯(142.83亿港元)为代表的物理AI(无人/智能驾驶)行业公司,以摩尔线程(80亿人民币)、壁仞科技(55.83亿港元)为代表的核心算力芯片行业公司和以澜起科技(70.43亿港元)、兆易创新(46.84亿港元)为代表的核心支撑芯片行业公司IPO募集资金总额较大。
1.4. 海外人工智能产业链上市企业复盘
2026Q1海外AI产业链新上市企业数量同环比均呈下降态势。基于一级市场主流数据库数据整理:1)2025年海外AI产业链共有24家企业上市(Q1~Q4分别为9、8、6、1家),总体呈现逐季下降态势;2)2026Q1海外AI产业链上市企业数量为0,较2025Q1同比-9家,较2025Q4环比-1家。2025年海外多只AI概念新股上市后表现不及预期,二级市场对高估值AI资产的承接力减弱,或导致投行放缓IPO项目推进节奏;同时,企业因估值折价压力和信息披露顾虑,或主动推迟发行,叠加私募融资、并购等替代路径的进一步分流,导致2026Q1上市数量为0,延续了2025年下半年以来IPO动能持续减弱的态势。
按产业链划分,海外AI下游应用服务层上市企业数量占比最高。基于一级市场主流数据库数据整理:1)2025年海外AI上游算力硬件层共3家企业上市、占比12.5%,中游模型与支撑层共1家企业上市、占比4.2%,下游应用服务层共20家企业上市、占比83.3%;下游应用服务层中,硬件行业共6家企业上市、占比25.0%,软件行业共14家企业上市、占比58.3%。2)2026Q1上游算力硬件层/中游模型层/下游应用服务层上市企业数量均为0家,较2025Q1同比-2/-1/-6家,较2025Q4环比+0/+0/-1家。尽管海外IPO节奏放缓,但进入Q2后,头部企业上市进程出现加速信号,Anthropic与OpenAI于2026年6月相继启动保密申报流程(Confidential Filing),进入IPO筹备轨道,标志着产业价值重心正从应用层向基座模型层回归。后续头部基座模型的超级IPO窗口开启,有望带动海外AI全产业链融资与上市节奏边际回暖。
细分行业中,海外AI软件应用行业上市企业数量占比最高,但IPO动能趋缓。基于一级市场主流数据库数据整理:2025年海外AI软件应用行业上市企业数量为14家,占比58.3%,位列第一;其余行业上市企业数量占比均在12.5%及以下。AI软件应用凭借轻资产、易规模化的SaaS模式,仍是当前IPO路径的首选。但从季度走势看,2025年下半年以来海外AI软件应用行业IPO动能明显衰减(2025Q1~2026Q1上市企业数量分别为3、5、5、1、0家),商业化验证瓶颈正逐步显现;AI应用层企业普遍面临从技术能力到可持续营收的跨越难题。硬科技与算力赛道虽在一级市场获得较高关注,但受制于技术落地周期较长与一级市场估值倒挂压力,短期内上市体量尚难与软件应用抗衡。
从上市地点来看,2025年海外AI产业链上市企业中,纳斯达克上市企业数量占比最高。基于一级市场主流数据库数据整理:1)2025年海外AI上市企业中,纳斯达克/纽交所/美交所上市企业数量为20/2/2家,占比83.3%/8.3%/8.3%。纳斯达克依然是全球AI科技企业最重要的融资阵地,其流动优势、投资结构成熟度与对亏损创新企业的纳新能力均具备不可替代性。2)2026Q1海外AI产业链面临上市空窗期,纳斯达克、纽交所、美交所均无AI企业上市,同比-10/+0/-1家,环比-1/+0/+0家。
从募集资金来看,基于一级市场主流数据库数据整理,海外以Core Weave(15亿美元)为代表的算力中心、算力服务行业公司,以SailPoint(13.8亿美元)为代表的AI软件应用行业公司募集资金总额较大。
2. 全球人工智能产业政策演进
2.1. 中国人工智能产业政策复盘:治理、基础设施与行业应用三线推进
中国人工智能政策重点在AI治理、基础设施和行业应用等方向推进。治理层面,顶层设计和行业规章已逐步延伸到智能体管理、伦理审查、技术标准、质量计量等更细的规则。基础设施层面,政策主要围绕算力扩容、算网互联、数据流通和算电协同展开,前期侧重规模和互联,后期补充数据供给与能源配合。行业应用层面,制造、教育、政务、医疗、交通等领域陆续出台专项政策,不同行业落地节奏有快有慢。
2.1.1 顶层战略与人工智能治理体系
近年来,我国人工智能治理政策从框架逐步细化到更具体的环节。以《关于深入实施“人工智能+”行动的意见》、《关于加快场景培育和开放推动新场景大规模应用的实施意见》为代表,顶层设计与行业应用方向率先明确。此后,智能体管理、伦理审查、技术标准、质量计量等更细颗粒度的规则陆续落地。各领域政策推进节奏并不是完全同步,但整体治理正向具体执行规范延伸。
- 2025年4月,中国气象局、国家互联网信息办公室联合发布《人工智能气象应用服务办法》,这是我国首部人工智能细分领域应用的部门规章,同时也是世界气象组织框架下首份针对人工智能气象应用的专项规范,为全球相关领域治理提供中国方案。
- 2025年8月,国务院发布《关于深入实施“人工智能+”行动的意见》,确立人工智能重塑生产力与生产关系的战略定位,围绕科技、产业、民生等六大领域布局,强化模型能力、数据供给、智能算力等八项基础支撑,成为AI与经济社会深度融合的纲领性文件。
- 2025年11月,国务院办公厅印发《关于加快场景培育和开放推动新场景大规模应用的实施意见》,明确构建“技术突破—场景验证—产业应用—体系升级”的完整发展路径,重点打造综合性、高价值应用场景,加速人工智能技术大规模商业化落地。
- 2026年3月,第十四届全国人大四次会议审议通过《政府工作报告》,指出“持续推进制造业数字化转型和‘人工智能+’行动,行业应用加快落地,新型智能终端不断涌现”。
- 2026年4月,工业和信息化部等十部门联合印发《人工智能科技伦理审查与服务办法(试行)》(3月成文、4月发布),该《办法》将“人类福祉、公平公正、可控可信、透明可解释、责任可追溯、隐私保护”等作为AI科技伦理审查的核心关注维度,通过设立审查主体、分级程序(一般/简易/专家复核/应急)与跟踪监督机制,对AI研发立项到落地实施的全流程伦理治理作出制度安排,以防范算法歧视、模型失控、深度伪造等风险。
- 2026年5月,国家网信办、国家发展改革委、工业和信息化部联合印发《智能体规范应用与创新发展实施意见》,文件对智能体作出权威定义,明确安全可控的发展原则,统筹推进技术攻关、场景落地、安全评估与合规监管工作。
- 2026年5月,市场监管总局、国家发展改革委联合印发《人工智能计量体系和能力建设指引(2026版)》,标志着我国人工智能产业发展重心从算力、规模扩张,转向质量提升与基础能力建设,为人工智能与实体经济深度融合、培育新质生产力提供有力支撑。
2.1.2 人工智能基础设施——聚焦算电协同与算力网构建国内人工智能基建相关政策围绕算电协同与算力网构建,同步推进算力扩容、算网互联、数据流通等。
政策前期重点是提升算力规模和推动互联互通,后期则逐步向数据供给规则与算电协同机制延伸,并将算力网建设提升至国家战略基础设施层面。这一系列部署的核心目的,在于解决AI发展中长期存在的算力孤岛、数据壁垒,以及算力基础设施扩张中存在的能源效率瓶颈与绿电供需错配问题,推动算力资源从“粗放供给”向“高效、绿色、可调度”的新型基础设施转型。
- 2025年5月,国家数据局综合司印发《数字中国建设2025年行动方案》,以数据要素市场化配置改革为主线,统筹部署“人工智能+”、基础设施提升、数据产业培育等八项重点工作。方案明确发展目标,计划到2025年底,数字经济核心产业增加值占国内生产总值比重超过10%,全国算力规模突破300 EFLOPS。
- 2025年5月,工业和信息化部印发《算力互联互通行动计划》,分阶段设定发展目标:到2026年建立较为完备的算力互联互通标准、标识和规则体系;到2028年基本实现全国公共算力标准化互联,逐步建成具备智能感知、实时发现、随需获取能力的算力互联网。
- 2025年9月,国家发展改革委、国家能源局印发《关于推进“人工智能+”能源高质量发展的实施意见》,聚焦人工智能与能源产业深度融合,提出到2027年初步构建能源领域AI创新体系,重点夯实算力与电力协同发展基础,推进行业大模型落地、典型场景应用及技术标准完善等工作。
- 2026年2月,国家数据局等部门印发《关于培育数据流通服务机构加快推进数据要素市场化价值化的意见》,一方面引导各地数据交易所完善交易规则与综合服务体系,推进公共数据产品进场交易;另一方面扶持数据流通平台、产业互联网、云服务商、专业数据商等市场主体专业化发展,拓展数据产品开发、行业定制化数据集等新模式,打通AI训练的数据供给链路。
- 2026年3月,《政府工作报告》首次将“算电协同”写入国家级新基建工程规划,明确提出“实施超大规模智算集群、算电协同等新基建工程,加强全国一体化算力监测调度,支持公共云发展”,标志着算力与电力的高效融合在国家层面正式上升为新型基础设施战略。
- 2026年4月,中共中央政治局召开会议部署经济工作,首次将“算力网”与新型电网、水网等并列,明确写入“六大网络基础设施”建设部署。国家发展改革委表示,将抓紧出台相关规划和实施方案,以进一步统筹“六张网”建设内容并明确各领域的投资重点。未来,各类基础设施在实现单独成网的同时,将发挥“多网协同”作用,共同推动现代化基础设施体系优化布局结构并促进集成融合。
- 2026年4月,国家发展改革委、国家能源局、工业和信息化部、国家数据局联合印发《关于促进人工智能与能源双向赋能的行动方案》,在保障算力可靠供能这一侧,方案提出三条抓手:统筹优化能源资源与算力布局、提高算力设施多元电力供给能力、提升算力设施能源供给质量。同时,《方案》主张促进算力电力高效经济协同,强化算电协同市场机制建设。
2.1.3. “人工智能+”垂直场景落地
国内 AI 应用落地逐步从顶层设计走向具体行业,不同领域的推进节奏有快有慢。制造领域出台了专项行动;教育领域从中小学通识教育延伸到全学段行动计划;政务领域部署了大模型应用指引;医疗卫生领域发布了应用发展、药品监管两份国家文件,北京等地也出台了地方行动计划;交通运输领域覆盖了综合交通和民航两个方向。
(1)AI+制造
- 2026年1月,工业和信息化部、中央网信办、国家发展改革委等八部门联合印发《“人工智能+制造”专项行动实施意见》,提出到2027年实现人工智能关键核心技术安全可靠供给,推动3~5个通用大模型在制造业深度落地,打造100个工业领域高质量数据集、推广500个典型应用场景,以人工智能全方位赋能新型工业化。
- 2026年4月,工业和信息化部印发《关于做好2026年工业和信息化质量工作的通知》,提出深化人工智能赋能质量提升工作,依托质量大模型、工业智能体,优化工业生产管控精准度。
- 2026年4月,工业和信息化部办公厅、国家数据局综合司联合印发《关于联合实施2026年“模数共振”行动的通知》,推动产出一批推广价值高、技术可行性强的人工智能应用场景,攻关一批蕴含工业和信息化领域技术机理的行业模型、专用模型和特色智能体,构建一批行业通识和行业专识高质量数据集,培育一批攻关联合体,优化人才、标准等产业配套生态。到2026年底,基本形成“数据—模型—场景应用”良性互促的循环,推动人工智能高水平赋能新型工业化。
(2)AI+教育
- 2025年5月,教育部发布《中小学人工智能通识教育指南(2025年版)》《中小学生成式人工智能使用指南(2025年版)》,以政策形式规范中小学人工智能教学与工具使用,是培育青少年人工智能素养、储备创新人才的重要举措。
- 2026年4月,教育部、国家发展改革委、工业和信息化部、科技部、国家数据局联合印发《“人工智能+教育”行动计划》,搭建起覆盖基础教育、高等教育、终身学习的全维度AI素养培育体系,同步推进AI教学落地、专业人才培养以及算力、数据等配套基础设施建设。
(3)AI+政务
- 2025年10月,中央网信办与国家发展改革委印发《政务领域人工智能大模型部署应用指引》,聚焦政务服务、社会治理、辅助决策等高频应用需求,引导各地各部门结合实际推进人工智能大模型落地,全面提升政务服务效能与数字化治理水平。
(4)AI+医疗卫生
- 2025年11月,国家卫健委、国家发展改革委、工信部等五部门印发《关于促进和规范“人工智能+医疗卫生”应用发展的实施意见》(10月成文、11月挂网),提出到2027年形成一批临床专病专科垂直大模型和智能体应用;到2030年基层诊疗智能辅助基本实现全覆盖,二级以上医院普遍开展影像智能辅助诊断。
- 2025年12月,北京市卫健委印发《北京市支持医疗健康领域人工智能应用发展行动计划(2026—2027年)》,提出到2027年建成需求对接、数据流通与技术转化的AI产业支撑体系。计划聚焦临床诊疗、基层卫生等核心场景,通过建设多模态、多病种数据集释放要素价值,并明确禁止AI替代医生的专业判断。
- 2026年4月,国家药监局印发《关于“人工智能+药品监管”的实施意见》,提出到2030年初步构建药品监管与人工智能融合创新体系,到2035年形成数智驱动、智能敏捷、自主可控、生态协同的智慧化药品安全治理新格局。任务包括构建人机协同智能审评审批体系、全链条风险监测等,推动监管由事后处置向事前预警转变。
(5)AI+交通运输
- 2025年9月,交通运输部、国家发展改革委、工信部等七部门印发《关于“人工智能+交通运输”的实施意见》,提出到2027年综合交通大模型体系落地;到2030年AI深度融入交通运输行业,实现关键核心技术自主可控。
- 2025年12月,中国民航局印发《关于推动“人工智能+民航”高质量发展的实施意见》(11月成文、12月印发),作为民航领域的细化部署。意见提出到2027年在安全、运行、出行等领域实现深度融合,并在附件《民航人工智能应用场景参考指引》中对具有较高推广前景的具体应用场景进行细化,通过数据集建设与民航大模型攻关提升智能化水平。
2.2. 海外人工智能产业政策复盘:技术、投资、监管多维度推进
2.2.1 美国:从技术壁垒到生态绑定美国人工智能政策从技术壁垒转向生态绑定。
其核心特征为对内松绑创新,对外精准遏制与生态绑定。对外,商务部多次调整对华先进芯片与AI模型权重的出口管制,同时推出全栈技术出口计划,将硬件、模型、数据系统打包绑定盟友。对内,一方面签署AI行动计划、创世纪计划,重新提出未来AI创新法案,重点投向基础设施、科研转化和标准研制;另一方面推动联邦立法优先于各州规则,并在数据透明度、智能体规范等领域引导行业自愿标准,以降低监管对创新的束缚。
- 2025年1月,美国商务部工业与安全局(BIS)发布《人工智能扩散框架》,通过修订《出口管理条例》(EAR),对先进计算集成电路和特定封闭式AI模型权重实施出口管控;同时引入了新的许可例外条款,并更新了数据中心认证最终用户(VEU)授权。
- 2025年5月,美国商务部工业和安全局(BIS)发布撤销拜登时期的《人工智能扩散框架》,并同步推出加强对海外AI芯片出口管制的三条指导意见,其中:1)《关于通用禁令10(GP10)对中华人民共和国先进计算芯片适用的指南》,提醒业界注意使用中国先进计算芯片(特别是华为昇腾系列芯片)的风险;2)《关于可能适用于先进计算芯片及其他用于训练人工智能模型商品的管制的政策声明》,明确了需要根据《出口管理条例》获得出口授权的活动类型;3)《关于防止先进计算芯片转移的行业指南》旨在帮助提升行业对涉及先进计算集成电路(IC)以及包含此类集成电路的商品的非法转用计划的认知。
- 2025年6月,美国国会推出《禁用敌对人工智能法案》(以下简称《法案》)。其核心目标在于赋予联邦政府识别、排除和移除敌对人工智能的能力,同时增强联邦人工智能的透明度和监督。《法案》通过一系列具体条款,构建了一个旨在实现上述目标的执行框架,包括创建联邦敌对人工智能清单、禁止联邦机构使用列入清单的AI系统、明确关键术语定义等。
- 2025 年 7 月,特朗普签署《赢得竞赛:美国人工智能行动计划》,该文件以“加速创新、建设基础设施、全球领导”三大支柱为核心,提出90余项政策,覆盖联邦采购、基建升级、技术研发等关键环节。随后,白宫发布《促进美国人工智能出口》行政命令,构建全栈式AI技术出口方案,面向盟友提供硬件、模型、软件及数据系统等完整技术包,以出口驱动美国AI产业规模化发展。
- 2025年11月,美国启动“创世纪计划”,旨在通过人工智能变革科学研究方式并加速科学发现。该命令指示美国能源部创建人工智能实验平台,整合美国超级计算机与数据资产以生成科学基础模型,并为机器人实验室提供技术支持,重点领域涵盖先进制造业、生物技术、关键材料、核裂变与聚变能、量子信息科学、半导体和微电子学及太空探索。
- 2026年2月,美国国家标准与技术研究院发布《AI智能体标准倡议》,制定自主AI智能体的互操作性、安全边界、身份认证、责任归属自愿标准,搭建行业协作平台,保障智能体可信、可控落地。
- 2026年2月,美国参议院两党议员Maria Cantwell(D-WA)、Todd Young(R-IN)等重新提出《未来人工智能创新法案》,授权NIST设立AI标准与创新中心(CAISI),制定自愿技术标准、建设国家实验室测试平台、设立AI创新奖金,巩固美国AI全球领先地位。
- 2026年3月,美国商务部发布《美国人工智能出口计划》,作为对2025年7月行政命令的落实;该计划推出一体化AI技术出口方案,支持企业向合作国家输出AI软硬件及安全解决方案,配套简化审批、贸易推广、融资扶持等相关政策。
- 2026年3月,白宫发布《国家人工智能政策框架:立法建议》,确立六大发展目标,提出联邦监管规则优先级高于各州法规,推动国会出台统一法律,解决各州AI监管规则碎片化问题。
- 2026年6月,美国总统签署《促进先进人工智能创新与安全》行政令,要求前沿AI模型在发布前向政府开放最长30天的网络安全测试窗口,接入联邦网络安全共享体系,依托人工智能技术排查关键基础设施安全漏洞,强化网络安全防护能力。
2.2.2. 从安全规范到主权AI与产业落地英国人工智能政策主要围绕主权能力建设和优势产业赋能两条线展开。算力方面,通过《计算路线图》和AI增长区扩充基础设施并简化审批。数据方面,DUAA法案调整了数据使用规则,平衡版权与模型训练需求。应用方面,在医疗、制造等领域设立AI成长实验室,提供受控测试环境。2026年进一步补充了主权AI基金、技能普及和数据合规细则,政策重心逐步从制度设计转向产业落地。
- 2025年1月,英国政府发布《人工智能机会行动计划》。该行动计划设定三大核心目标:促进经济增长、提升公共服务质量以及培育本国AI领军企业,以减少对外依赖。
- 2025年2月,英国政府与英国国家网络安全中心发布全球首个人工智能安全标准——《人工智能实践规范》,包含十三项原则,涵盖人工智能生命周期的安全设计、开发、部署、维护和报废等方面。
- 2025年6月,英国信息专员办公室(ICO)发布了《人工智能和生物识别战略》,该战略旨在加强对人工智能和生物识别技术的审查,重点关注三种优先情况:1)风险很高;2)公众对这项技术有明显的关注;3)监管明确性可以产生直接影响。
- 2025年7月,英国政府发布《计算路线图》,这是一项旨在变革国家计算基础设施的十点计划。该计划凸显了政府在人工智能(AI)时代推动创新、促进经济增长及增强国家韧性的坚定承诺。
- 2025年6月,《数据(使用与访问)法2025》(DUAA法案)获国王御准,7月政府公布首阶段实施条例。法规重点赋予信息专员办公室(ICO)新监管职能,激活关键技术条款,并依法要求政府开展AI训练版权合规与数据经济影响评估工作,旨在平衡监管清晰度与产业灵活性,为构建完善的AI数据合规制度奠定基础。
- 2025年9月,英国科学、创新与技术部发布《可信第三方人工智能保障路线图》。文件数据显示,2024年英国AI保障市场GVA约10.1亿英镑,并指出若能有效扫除应用障碍,该市场将成为新的经济增长极,预计到2035年GVA有望突破188亿英镑。
- 2025年10月,英国政府发布《人工智能监管新蓝图》,宣布设立AI成长实验室(AI Growth Labs)及配套机制。该政策将在医疗、制造等关键领域建立受控测试环境(Sandbox),允许在严格监督下适度放宽现有法规,旨在降低行政壁垒,加速AI产品的真实世界验证与商业化落地,提升公共服务效率。
- 2025年11月,英国政府宣布发布《推进人工智能增长区》政策文件,旨在通过加速电网连接与简化规划审批流程,强化AI基础设施部署,以创造就业机会并维系其在全球人工智能领域的领导地位。
- 2026年1月,英国科学、创新与技术部发布全民AI技能普及计划,联合行业机构推出免费AI基础课程,面向社会全面开放,计划到2030年完成千万职场人员AI能力提升,夯实全民AI应用基础。
- 2026年1月,英国科学、创新与技术部联合首相府发布《AI机遇行动计划:一周年回顾与更新》,作为国家级AI顶层政策,明确算力、数据、人才、产业投资四大发展方向,稳步推进AI增长区与主权AI单元落地建设。
- 2026年4月,英国科学、创新与技术部启动5亿英镑“主权AI基金”,作为对2025年《计算路线图》的延续与落实,通过整合国家级战略资源,赋能英国本土AI企业的孵化与规模化扩张,支撑前沿基础模型研发并强化英国AI主权能力。
- 2026年5月,英国信息专员办公室发布《数据保护(AI与自动化决策行为准则)条例》,制定专项合规标准,严格规范AI业务中个人信息、未成年人数据的采集与使用行为。
2.2.3. 欧盟:从风险监管到算力建设与行业应用
欧盟人工智能政策以风险监管为主,并逐步扩展到算力基础设施建设和垂直行业应用两个方向。监管层面,欧盟先后出台禁止AI实践指南、AI系统定义指南、通用AI实践准则,并于2026年就AI Act简化修订方案达成临时协议。算力层面,通过AI大陆行动计划和EuroHPC条例修订,投资建设多个AI工厂,提升自主算力能力。应用层面,应用AI、科学AI两项战略推动制造业、医疗、能源等领域的深度融合。
- 2025年2月,欧盟委员会发布《关于禁止的人工智能实践指南》(以下简称《指南》),对《人工智能法案》(AI Act)中禁止使用的人工智能实践类型进行进一步明确和细化。《指南》主要有两个目的:1)增强法律的清晰度:《指南》对《人工智能法案》第5条中的禁令进行详细阐释,让相关各方能够更准确地把握其内涵;2)提供欧盟委员会对这些禁令的解读,以保障禁令在实际应用中能够保持一致、高效和统一。该指南是欧盟AI伦理治理的具体落地,通过划定红线规范产业发展。
- 2025年2月,欧盟委员会发布《人工智能系统定义指南》,以帮助相关方判断某一系统是否属于该法案所定义的人工智能系统,促进法案的有效实施与执行。发布此指南是为了帮助供应商及其他相关人员,如市场和机构利益相关者,判断某一系统是否属于法案所定义的人工智能系统,从而推动法案的有效实施和执行。
- 2025年4月,欧盟委员会发布《人工智能大陆行动计划》,其致力于成为全球AI领导者。该计划通过五大核心领域推动AI发展。文档附件列出13个EuroHPC AI工厂的具体信息,涵盖17个成员国,聚焦健康、能源、制造业等关键领域,计划投资超100亿欧元升级算力设施。
- 2025年7月,欧盟委员会发布《通用AI实践准则》最终版,作为《AI法案》的重要补充将于2025年8月2日生效。准则明确了欧盟AI办公室的强制执行时间表(新模型一年后、存量模型两年后),旨在通过标准化手段确保投放欧洲市场的通用AI模型具备充分的安全性与透明度。
- 2025年10月,欧盟委员会发布两项战略文件,旨在确保欧洲在全球AI竞赛中保持差异化优势:1)《应用AI战略》致力于加速AI技术在欧洲关键垂直产业及公共部门的深度渗透;2)《科学AI战略》侧重于利用AI驱动前沿科学探索,巩固科研领域的领先地位。
- 2026年1月,欧盟理事会发布《欧洲高性能计算(EuroHPC)条例修订案》,对现行算力相关法规进行更新,新增AI超级工厂相关规定,为超大规模人工智能模型训练、运行搭建标准化基础设施,同时扩充量子技术发展相关内容。从立法层面夯实欧盟AI算力底座,强化本土算力自主能力,支撑前沿AI技术研发。
- 2026年5月,欧洲议会与欧盟理事会就修订《人工智能法案》的“数字综合包”(Digital Omnibus on AI)达成临时协议,旨在简化合规流程、为中小企业提供更大创新空间。
2.2.4. 日韩:从技术追赶到算力自主与行业赋能
日韩两国的人工智能政策均将本土算力保障和行业深度赋能作为核心方向。日本侧重通过软法监管和财政投入双轮驱动,以万亿日元级政府补贴撬动民间资本,联合开发国产基础大模型。韩国通过《AI基本法》确立合规框架,同时依托算力、数据、初创三大基建方案和超百万亿韩元公共基金,推动AI在经济各领域全面转型。
2.2.4.1.日本:从风险规避到战略主导与财政投入
日本的人工智能政策从风险规避,逐步转向国家战略主导。日本正通过监管松绑与财政投入并行的方式,缩小与中美在AI领域的差距。监管方面,日本AI基本法采用软法监管思路,未设置严格处罚条款,仅通过行政指导与点名批评机制平衡创新与风险管控,以降低企业进入门槛。财政方面,首部AI基本计划,确立了为期五年、总额约1万亿日元的公共投资,同时启动官民联合项目,由软银等牵头、民间出资约2万亿日元,共同构成3万亿日元总包规模,联合开发国产基础大模型。此外,财政预算也持续加码算力和工业AI投入,推进行业应用、技能培训和国际规则参与。
- 2025年5月,日本通过《人工智能相关技术研究开发及应用推进法》(AI基本法),明确了AI技术的定义,并设立以内阁总理大臣为首的人工智能战略总部,强化了政策推进的顶层协调机制。与此同时,日本同步推进《知识产权推进计划2025》,旨在通过激活专利、构建全链条服务体系促进AI等技术转化,参与并主导全球AI规则制定,呈现出创新驱动与规则输出并重的政策色彩。
- 2025年6月,日本发布《综合创新战略2025》,将AI与量子等前沿技术并列,强调研发与风险应对兼顾,明确了AI在国家前沿技术布局中的核心地位,为后续AI生态构建与技术突破奠定战略基础。
- 2025年12月,日本宣布《人工智能基本计划》,核心目标在于突破基础模型领域的对外依赖,确保AI技术主权,同时赋能日本传统优势产业,并建设本土AI人才高地,夯实日本AI产业发展的核心支撑能力。此外,日本于2026年4月启动《人工智能基本计划》修订研讨,围绕投资目标、人才培育、制度改革等方向推进内容扩充。
- 2025年12月,日本启动官民联合国产大模型专项项目,由软银集团牵头、十余家企业参与组建新公司,总投资规模约3万亿日元(其中政府出资约1万亿、民间出资约2万亿),目标是开发参数量达1万亿的日语基础大模型。
- 2025年12月,日本经济产业省发布《2026财年尖端半导体与AI研发预算方案》,划定半导体与AI整体研发预算规模,安排AI专项经费,重点扶持本土基础大模型、数据基础设施及工业物理AI技术研发,以财政专项投入为日本本土AI技术自主研发筑牢底层支撑。
2.2.4.2.韩国:从产业辅助到国家战略与资本驱动
韩国人工智能政策从产业辅助升级为国家战略核心。制度方面,韩国《AI基本法》于2024年底通过,2026年初正式施行,该法案明确高影响力AI的告知义务,对深度伪造内容强制水印标注;2025年末韩国发布《AI行动计划》,提出“物理AI第一”的2030年长远发展愿景。基础设施方面,2025年初发布算力、数据、初创三大方案。战略投资方面,设立规模超100万亿韩元的国民增长基金为AI转型提供资金支持。
- 2024年12月,韩国通过《人工智能发展及信任基础建立基本法》(AI基本法),初步建立合规框架,并拉开AI政策序幕。
- 2025年2月,韩国国家AI委员会发布《通过扩建人工智能计算基础设施强化国家人工智能实力的方案》、《通过培育人工智能初创企业扩大人工智能应用的方案》和《扩充人工智能数据并扩大开放的方案》三大核心方案,直指算力、初创企业与数据三大AI发展关键要素。方案明确提出2025年内完成1万块先进GPU的配备任务,同时计划投入1万亿韩元研发通用人工智能,凸显出韩国强化AI底层技术自主性、夯实产业发展基础设施的坚定决心。
- 2025年8月,韩国AI政策升级至国家整体经济增长层面,发布《新政府经济增长战略》。该战略宣布在经济各领域全面推动“AI大转型”,并配套计划设立规模超100万亿韩元的国民增长基金,以政策加资金的双重保障推动AI与全域经济深度融合。
- 2025年12月,韩国发布《AI行动计划》,提出“物理AI第一”的2030年长远发展愿景。计划明确将建设全国性“AI高速公路”,并将AI赋能范围从产业经济进一步扩展至国防与社会基础领域,最终构建起覆盖技术研发、产业应用到社会治理的全景式AI转型蓝图。
- 2026年1月,韩国科学技术信息通信部推进国家AI战略落地。据韩国企划预算处2026年度预算案,AI年度预算提升至10万亿韩元,计划撬动公私部门合计30万亿韩元投资,核心推进建设“人工智能高速公路”算力基础设施、升级国家级数据平台、扩大医学与工业等领域数据空间、吸引培育AI人才,以全链条布局冲刺全球AI强国,筑牢本土AI竞争力底座。
- 2026年1月,韩国正式施行《关于人工智能发展和构建信赖基础的基本法》(《AI基本法》),明确“高影响力AI”与生成式AI的告知、标注义务,要求AI具备可解释性,对深度伪造等非真实内容强制添加视觉标签或数字水印,兼顾产业健康发展与AI风险防控,奠定了韩国可信AI发展的法律框架。
2.2.5. 东南亚:地缘博弈中加速本土主权构建与产业集聚
东南亚主要国家在人工智能领域实现了从政策观望到实质入局的转变。各国政策的核心逻辑表现为:利用地缘优势吸引全球基建投资,同时通过技术自主与精准激励构建差异化竞争力。
- 越南:以税收杠杆驱动硬件制造,补齐治理短板。越南政策前期引资为主,后期转向AI治理。2025年6月颁布《数字技术产业法》,提供较大力度的所得税优惠及土地使用费豁免,试图通过极低成本吸引AI服务器组装及半导体封测企业入驻。12月,《人工智能法》引入类似欧盟的风险分级机制(分为高风险、中风险、低风险人工智能系统,附有禁止行为条款),希望在承接产业转移的同时,建立起符合国际主流(尤其是欧洲市场)要求的伦理框架,为未来AI产品外销铺路。2026年3月,《<人工智能法>实施计划》进一步明确各部门执行职责,要求定期更新国家人工智能战略与伦理框架、设立发展基金、建设国家AI数据库与一站式门户网站,并推动法律普法宣传。
- 新加坡:降低应用门槛,打造“可信AI”全球枢纽。新加坡继续强化其合规枢纽地位,重点解决成本与信任问题。2025年2月,《2025财政预算案》投入1.5亿新元补贴算力开支,并增加国家生产力基金,直接降低中小企业接入大模型的门槛;5月,新加坡资讯通信媒体发展管理局(IMDA)发布了《全球AI安全研究优先事项新加坡共识》,并升级了涵盖生成式AI风险管控的“AI Verify测试框架”,致力于将其可信AI治理标准与国际接轨;7月,新加坡推出了三项新举措——新的全球人工智能保障沙盒、新的PET采用指南以及新加坡数据保护标准,通过建立数据保护信任标志,试图将可信AI转化为一种商业准入标准。2026年5月,新加坡更新《国家人工智能战略》,通过国家AI任务推动制造、金融、医疗等行业与公共部门转型,支持企业规模化采用AI并提升劳动力AI技能,同时扩充算力资源、深化生态整合,巩固其作为可信AI解决方案开发与合作枢纽的地位。
- 马来西亚:明确主权AI战略,构建自主技术生态。2025年7月,马来西亚投资、贸易与工业部(MITI)新宣布将对来自美国、用于人工智能技术的高性能芯片的出口、转运和中转活动实施管控措施,这既可以视为对自身主权技术路线的保护,也反映了在全球科技博弈中谨慎平衡的姿态。2026年1月,马来西亚宣布制定《2026至2030年人工智能技术行动计划》与《人工智能管治草案》,前者推动多方协作,推进AI应用与数字转型;后者通过搭建监管框架,为AI发展补充行动路线与合规支撑。
2.2.6. 中东:石油资本驱动下的算力枢纽与制度探索中东地区(以阿联酋、沙特、卡塔尔为核心)的人工智能政策早期以资本投入为主,后期逐步转向算力基建、制度创新与人才培育并重。其核心逻辑是利用能源优势吸引全球算力资源,同时通过制度试验构建本土AI生态。
- 阿联酋:以政府数字化转型为核心引擎,强化算力基建与人才培养机制。基础设施建设方面,2025年1月,《2025-2027年阿布扎比政府数字战略》承诺投入巨资,旨在将政府自身打造成全球领先的AI应用样板,彰显了以公共部门数字化牵引全社会转型的决心;5月,与美国启动“美阿AI升级伙伴关系”,在阿布扎比建设规划容量达5吉瓦的AI园区,该园区将由英伟达、AMD等美国芯片巨头供应先进AI芯片,阿联酋有望从2025年起每年获得50万枚最先进的AI芯片。人才培养方面,2025年5月,教育领域AI强制政策将AI课程系统化、强制化地嵌入从幼儿园到高中的全阶段教育,旨在从根本上培育未来国民的AI素养,为长期竞争力储备本土人才。此外,阿联酋于2026年4月启动“自主智能政府”转型项目,目标两年内让50%政府服务由代理式AI驱动。
- 沙特阿拉伯:以国家资本与制度创新双轮驱动,构建AI主权生态。资金方面,2024年2月,沙特公共投资基金(PIF)正式宣布成立Alat公司,并计划到2030年在高科技领域投资1000亿美元,该公司的核心任务之一就是建立沙特的半导体和先进工业产业,包括AI服务器等关键硬件设备的本地化制造,以减少对外部供应链的依赖。法律方面,2025年4月《全球AI中心法(草案)》提出设立“数据大使馆”法律框架,允许外国政府及企业在沙特境内的数据中心在特定条件下适用其本国法律,旨在吸引全球科技巨头将数据基础设施落地沙特,以此确立其全球数据枢纽地位。人才方面,2026年1月启动SAMAI 2倡议,通过专业培训赋能政府部门劳动力;此外,沙特通过科技展、峰会等国际活动提升国际影响力,并进行招商引智。
- 卡塔尔:以主权基金驱动AI战略,聚焦算力基建、监管试点与研发创新。2025年12月,卡塔尔在政府官网宣布成立国家人工智能公司“Qai”,Qai将作为卡塔尔主权财富基金——资产规模达5240亿美元的卡塔尔投资局(QIA)的子公司,在卡塔尔及全球范围内开发、运营和投资人工智能基础设施和系统。国家资本下场直接确保了政府对AI战略资源的控制力,有助于服务国家经济多元化愿景。2026年2月,卡塔尔推出AI聊天机器人试点,在受监管环境中测试生成式AI,提升监管服务效率;同月发布“AI for Qatar”国家计划,为科研与初创企业提供开发平台,巩固区域创新中心地位。
3. 全球人工智能产业链革新
3.1. AI模型行业:多品类技术路线迭代,竞争转向系统效能、物理交互与场景落地
3.1.1. 大语言模型:从参数扩张到系统效能优化
大语言模型的竞争主线从参数规模扩张,逐步转向系统级效能优化。架构上,模型从稠密Transformer转向混合架构(稀疏MoE、混合注意力+MoE并联);原生多模态架构逐渐成为主流;后训练阶段成为新焦点;长上下文从静态扩容转向动态记忆,稀疏压缩与缓存折扣降低商用门槛;快慢思考动态编排成为主流实践,推理算力逐渐从固定开销变为可调预算。
1)模型架构从单一稠密Transformer向混合架构演进。稠密Transformer在参数规模从千亿向万亿扩展时,面临两个主要问题——显存占用、每token浮点运算成本的非线性增长。企业按量采购模型时往往较为关注推理账单,因此行业重点不再是堆参数,而是让每次前向传递只激活必要的计算,同时改进注意力算子来压低长序列的开销。由此形成两条技术路线:极端稀疏激活的MoE、混合注意力与MoE协同。
- 极端稀疏激活MoE将总参数与激活参数脱钩,降低了万亿级模型的推理成本。稠密模型在接近万亿参数时遭遇显存与算力瓶颈,行业因此转向稀疏激活方案,例如,DeepSeek-V4系列Pro版总参数1.6万亿、激活参数490亿,Flash版总参数2840亿、激活参数130亿;在百万token场景下,V4-Pro的单token浮点运算降至V3.2的27%,KV缓存占用降至约十分之一。商业定价方面,官方定价Pro版缓存未命中输入/输出$0.435/0.87/百万token,Flash版缓存未命中输入/输出$0.14/0.28/百万token,低于主流百万上下文大模型价格(例如Claude Sonnet 4.6输入/输出$3.00/15.00/百万token、GPT-5.4输入/输出$2.50/15.00/百万token),这让过去因成本过高而仅作展示的百万上下文场景,开始具备工程按量采购的经济可行性。

-
混合注意力与MoE协同设计有助于降低成本。纯参数级MoE架构并不能消解长上下文下注意力自身的计算负担,因此,在注意力机制中结合线性算子与MoE的协同设计成为另一种选择。以MiniMax M1为例:M1采用混合注意力+MoE架构,支持百万级上下文;在10万token生成长度下,推理计算量仅需DeepSeek-R1的25% FLOPs。定价方面,M1按输入长度阶梯计价,在常规任务(输入<32k)中,M1基础档输出价格为¥8/百万token(按美元兑人民币6.8的汇率折算约$1.18/百万token),仅为Claude Sonnet 4.6($15/百万token)的8%。这表明,即便模型总参数量规模庞大,通过架构层面的非对称设计,也能显著改变行业成本结构。
2)原生多模态架构逐渐成为主流。早期多模态方案大多采用拼接式架构(比如视觉编码器+大语言模型),不同模态的处理模块相互独立,导致跨模态理解存在信息损耗。新一代方案强调在模型主干层实现多模态深度融合,目前行业主要沿着两个方向推进:视觉与语言等模态在骨干网络内统一建模、利用端到端流式处理提升交互体验。
- 从模态拼接走向统一序列建模,视觉不再作为独立的外接模块进行后期拼接。早期方案通过投影层将视觉编码器与语言模型拼接,跨模态交互依赖额外转换,存在信息损耗。Gemini 3延续Gemini系列原生多模态设计,能够在统一模型框架下综合处理文本、图像、视频、音频等多类型信息。智源Emu3则将图像、文本、视频等统一离散化到同一表示空间,通过单一Transformer进行联合训练,在《Nature》上发表了研究成果。这些方案验证了统一架构的可行性。
- 端到端全模态模型支持流式输入输出,降低了交互延迟。为了减少模态转换带来的性能损耗,Qwen3-Omni采用Thinker-Talker的MoE架构,原生支持文本、图像、音频、视频的同步处理与流式输出。官方数据显示,其端到端音频对话延迟为211毫秒,视频对话延迟为507毫秒。这种设计使模型可以边接收输入、边生成输出,交互从轮次式问答转向更连续的对话体验。

3)后训练对模型性能的影响权重上升。随着预训练侧高质量公开语料的边际收益递减,继续增加token带来的能力提升越来越薄,行业竞争开始下沉到后训练阶段。目前,可验证的强化学习(RLVR)和蒸馏+拒绝采样正在成为后训练的主要手段。DeepSeek系列从R1到V3.2再到V4,验证了GRPO算法加可验证奖励能引导模型在自己生成的轨迹上修正推理路径,在数学和代码领域效果显著。Qwen3技术报告也指出,用大模型批量生成推理轨迹、经拒绝采样筛选后灌给小模型,可以减少训练数据量、提升性能。后训练手段的有效性离不开数据,需要说明的是,目前合成数据在后训练中主要起辅助作用,后训练的最终可靠性与对齐校验,仍高度依赖真实数据。

4)长上下文技术正从静态窗口扩容转向动态任务记忆机制。
早期竞争把百万 token窗口当作容量能力,但全量注意力带来注意力稀释,远端信号被摊薄,同时 KV缓存随长度线性膨胀,二者叠加导致经济性下降。目前行业分两条线推进:模型侧用稀疏压缩把百万级推理开销压到可部署水平,系统侧把上下文从静态缓冲区改造成可检索、可复用的动态记忆。
- 模型侧:稀疏注意力与分段记忆让百万窗口变成可用能力。DeepSeek-V4通过CSA/HCA混合压缩注意力和DSA稀疏选择机制,在百万token场景下大幅降低KV缓存和计算量。这使得五百页合同比对、整库源码跨文件追踪等长尾场景有了工程交付的可能。同时,长上下文的价值重心也从承载超长文本,转向任务状态连续性。例如,GPT5.1CodexMax将百万上下文与原生工具搜索、跨应用操作融合,让上下文成为跨步骤任务的工作记忆,模型能追踪执行进度并依据反馈调整动作。

- 系统侧:KV缓存共享与分层检索让长上下文的成本控制变成系统层面的问题。全量自注意力在同时处理多个任务时浪费较大,行业开始从系统工程找优化办法。2025年下半年以来,主流API服务商推出缓存命中折扣,例如,Claude Sonnet 4.6缓存命中价格为$0.30/百万token,为基准输入价($3.00/百万token)的十分之一;DeepSeek-V4-Pro缓存命中低至¥0.025/百万token,为基准输入价(¥3/百万token)的1/120。这反过来也推动模型侧优化前缀复用和上下文截断策略。长上下文能不能真正商用,不再只看模型窗口有多大,还要看推理调度层能不能把显存和算力成本降到企业愿意接受的价位。
5)快慢思考动态编排成为主流实践,推理算力逐渐从固定开销变为可调预算。推理成本长期被当作模型的固定开销,但大多数请求不需要深度思维链,只要能根据任务难度分配不同的推理深度,就能在不牺牲体验的前提下降低平均成本。目前主流的做法分为三类:自动分流、可调推理预算、并行采样。
- 自动分流:把推理算力预算从平均分配转为按需投放,按任务难度走不同通道。单一稠密模型很难同时兼顾即时响应和深度推理。GPT-5系列内置了一个自动判断机制,能够根据问题复杂度,决定用普通模型还是推理模型。简单问题走轻量通道,复杂问题才启动深度推理。据OpenAI披露,GPT-5取消了用户手动选择模型的做法,改为系统自动判断并分配计算资源。相比OpenAI o3,输出token数量减少了50%到80%,重试次数也明显减少,单位服务成本随之下降。
- 可调推理预算:思考深度可由开发者直接设定。Qwen3引入了思考预算(thinking budget)概念,开发者可通过API或控制台参数设置思考长度,在阿里云百炼等主流平台上,该参数常被配置为上限4000 token,实现推理成本精细化管理。Claude Opus 4.7主推自适应思考模式(替代旧有的固定预算长思考),由模型自主判断任务难度动态分配推理资源;同时新增了任务预算(Task Budget)功能,用于在任务层级进行更宏观的资源配额管理。

- 并行采样:用额外算力换取更高成功率。在高价值决策场景中(比如代码生成、金融分析),企业对成功率的要求高于对推理成本的敏感度。这意味着额外推理计算可以换来可量化的性能提升,在需要高可靠性的任务中具有商业价值。以Claude Sonnet 4.5为例:在SWE-bench Verified编程基准测试中,该模型基础得分77.2%;启用并行采样时,模型会同时生成多组候选结果并筛选最优解,得分提升至82.0%。


3.1.2. 物理模型:VLA与世界模型为技术主线,高质量物理交互数据决定产业化进度
物理模型的核心任务是在物理世界中感知、推理和行动。行业主要沿着VLA模型和世界模型两条路线推进:前者解决模型如何根据感知和指令生成动作,后者解决环境将如何变化的问题。当前VLA模型正从模块化拼接走向端到端统一,世界模型在承担物理推演职能的同时,弥补VLA模型预判不足。两条路线的共同瓶颈在于,高质量物理交互数据仍然稀缺,其质量、规模与多样性决定了模型的泛化上限和产业化进度。
1)VLA模型从模块化拼接走向端到端统一,推动智能驾驶与机器人向更高成熟度和量产落地迈进。开发重心逐渐转向两个方向:通过大规模数据训练与空间推理能力提升操作精度和鲁棒性,利用多机器人和多任务数据训练增强跨场景泛化能力。
- 大规模数据训练与空间推理能力是提升VLA模型操作精度和鲁棒性的关键。传统模块化系统需要在感知结果、语言指令和动作控制之间进行多次转换,不同模块之间的接口误差会影响最终动作执行效果。VLA模型采取端到端架构,直接学习从环境状态到动作的映射,其中多模态感知(如视觉、语言指令)提供输入信号,三维空间理解帮助定位目标物体的位置和姿态,端侧算力优化则是保证模型实时运行的必要条件。以小鹏第二代VLA为例,其通过每秒处理53亿字节视觉信息、累计使用50 PB训练数据强化空间推理能力,实现绕行事故现场、起伏烂路提前降速等场景适应。

- 多机器人和多任务数据训练提升跨场景泛化能力。VLA模型要从实验室任务进入真实环境,需要适应不同机器人本体、不同任务流程和不同操作场景。单一机器人或单一任务数据通常只能覆盖有限环境,难以支撑模型在新场景中的稳定表现。以Physical Intelligenceπ0.5为例,该模型在π0的基础上使用来自多种机器人、任务和数据来源的混合样本,结合高层语义预测和低层动作输出,使模型能够在新的家庭环境中执行较长流程的操作任务,例如清洁厨房和卧室。但考虑到机器人动作数据的采集成本较高,单一企业难以覆盖全场景,目前主要依赖行业联盟共建数据集来整合多方异构数据、分摊成本并降低单一数据源的分布偏差风险。

2)世界模型承担物理推演职能,弥补VLA模型预判不足。机器人和自动驾驶系统在真实环境中采集操作数据的成本高、速度慢,世界模型提供了另一条路径:先从大量视频中学习物体运动和环境变化规律,再用少量真实数据做校准,使模型具备对未见场景的预测和规划能力,从而减少对大规模真实采集的依赖。NVIDIA Cosmos通过生成和增强合成数据,为机器人和自动驾驶系统补充更多可控场景,例如不同光照、天气、道路条件和物体运动变化,从而帮助模型在训练阶段覆盖更多真实环境中难以高频采集的场景。从中长期架构看,世界模型有望作为VLA动作回路外的近似推演层,比如用于候选动作预筛、离线策略评估、场景覆盖生成等场景,从而降低实机试错开销。

3)高质量物理交互数据仍然稀缺,数据的质量、规模与多样性共同决定模型的泛化上限。VLA模型和世界模型最终都指向真实物理交互数据不足的问题。语言模型可以使用互联网上的大规模文本训练,机器人数据则必须依赖真实硬件或高质量仿真环境采集,采集成本明显更高。目前行业同时依赖三类数据:仿真数据与视频数据用于大规模预训练,真实数据用于强化学习以覆盖长尾场景。三类方案各有利弊,技术路线尚未收敛;仿真、视频数据与真实数据相结合的路径,或是未来数据采集与训练的主流方向。
- 真实数据具备高保真优势,但采集成本高昂。真实机器人数据能够记录机器人在真实环境中的动作执行结果和环境反馈,对VLA模型训练具有较高价值。但这类数据依赖真实硬件、人工遥操作和任务设计,采集成本较高,规模化难度较大。在真实数据规模化方向上,蚂蚁灵波科技开源的LingBot-VLA提供了一个参照。该模型使用来自9种双臂机器人平台的约2万小时真实操作数据进行预训练,覆盖AgiBot G1、AgileX和Galaxea R1Pro等多种异构硬件配置。项目验证了真实数据规模与模型性能之间的正相关规律:随着预训练数据从3000小时扩展至2万小时,模型在下游任务的成功率持续提升,且在2万小时时仍未出现明显的性能饱和。在RoboTwin 2.0仿真基准的50项任务测试中,LingBot-VLA的跨任务泛化成功率比Π0.5高出9.92个百分点。

- 仿真数据和视频数据在预训练阶段发挥重要作用,与真实数据形成互补分工。由于真实数据成本较高,行业需要同时利用仿真数据和视频数据补充训练样本。仿真数据可大规模获取,成本投入低,能覆盖真实采集中难以获得的危险场景和长尾场景,例如,RoboTwin 2.0提供了一个参照,它覆盖50项双臂操作任务和5种机器人本体,并通过杂乱程度、光照、背景、桌面高度和语言等维度提升场景多样性。但仿真环境与真实环境之间仍然存在迁移损耗,不能完全替代真实数据。视频数据兼具来源广泛、训练成本低的优势,可以提供较大规模的视觉和时序信息,适合帮助模型学习物体运动和环境变化规律,例如,V-JEPA 2先用超过100万小时互联网视频做预训练,再用不到62小时机器人操作数据做后训练,最终在陌生环境中完成抓取和放置任务。但视频数据存在物理交互缺失、噪音干扰大、具身本体差异、缺乏精确标注等问题,直接应用较为困难。


3.1.3. 视频生成模型:从能力趋同到分化竞争
当前视频生成模型在基础画质与短片段生成能力上已较为接近,行业竞争重心正从单一的生成质量,转向物理与时空一致性、实时交互能力的综合要求,并进一步延伸至垂直场景的具体应用。技术层面,长视频的连续性与可控性、音视频的联合生成、低延迟流式输出仍是主要瓶颈;商业层面,基础模型厂商通过API生态向下游渗透,抬高了通用型应用的准入门槛,差异化机会更多集中在企业培训、数字营销等特定行业。
1)视频生成模型的迭代重点正从画面清晰度,转向物理规律、时空一致性与多模态同步。当前主流模型在分辨率和画质上已接近部分场景的商用门槛,行业的关注点随之转移。生成视频中连续帧的物理合理性、角色与场景的跨帧稳定性,以及画面与音频的同步能力,正共同成为决定模型能否进入生产环节的关键因素。
- 物理规律建模能力仍处早期验证阶段。模型在处理惯性、碰撞及重力等基础力学表现时,需要符合基本常识;生成内容从静态展示转向复杂动态场景时,模型对现实世界运动规律的理解变得尤为重要。若模型无法稳定处理物理交互逻辑,即便单帧画质达标,整体输出的可信度依然受限。OpenAI Sora的关停反映出,单纯依靠“世界模拟”的宏大叙事不足以支撑消费级商业模式,行业认知正回归至工程层面的运动约束与可控性优化。快手可灵3.0通过运动轨迹迁移与元素绑定技术,将物理一致性转化为用户可控的参数,是目前可见的落地路径之一。

- 时空一致性制约长视频商业化落地。长视频生成仍面临角色漂移、动作断裂及场景突变等技术瓶颈。视频时长增加后,维持人物外观、服装纹理及镜头运动的跨帧稳定性难度显著提升。若面部特征或场景结构在叙事过程中出现无规律变化,将直接影响内容的商业可用性。针对这一问题,Runway Gen-4让用户上传参考图来锚定角色的关键特征,再结合技术手段确保不同镜头下的一致性,从而规避长程记忆缺失的问题。但在部分大幅运镜或复杂光照场景下,该技术的稳定性仍有进一步提升的空间。

- 音视频联合生成逐步成为主流方向。视频生成正从纯视觉输出向视听一体化演进。在内容生产场景中,画面、对白、背景音效及动作节奏的一致性,决定了后期剪辑的工作量。2026年以来,头部模型普遍将音视频联合生成作为迭代重点。字节Seedance 2.0、Google Veo 3.1、快手可灵3.0等均已在架构层面支持音视频联合输出,通过单次前向传播,同时输出视频与原生立体声,改变了传统的“先生成视频、再后期配音”的工作流。需要注意的是,同品牌早期版本(如Seedance 1.0)及部分中尾部产品仍以静音输出为主,原生音画同步能力尚未完全成熟,短期内尚难完全取代后期制作环节。
2)AI视频生成质量已能够满足部分短片段制作需求,长视频仍待突破。当前主流模型在分辨率、画面细节和镜头表现方面持续提升,单次生成的短片段输出已具备一定的商业辅助价值。行业竞争进一步延伸到视频时长和镜头连续性等方面。
- 短片段生成质量已具备较强的辅助生产价值。对于视频营销、企业培训等场景而言,客户更关注内容能否快速生成,并在较短时长内保持画面稳定和表达清晰。当前头部视频生成模型在画面清晰度、运动表现和场景还原方面持续提升,单次生成的短片段已可用于短视频素材等标准化内容的生产场景。以Google Veo 3.1为例,其支持生成最长8秒的视频,提供720p至4K的多种分辨率选项,并具备原生音频生成能力。国内快手可灵3.0、字节Seedance 2.0均支持最长15秒的生成时长,且在画面稳定性和内容可控性上表现较好,是目前短平快内容生产的主流选择之一。

- 长视频仍受一致性和可控性约束。相比短片段生成,长视频对人物外观、动作连续性和镜头逻辑的稳定性要求更高。视频时长拉长后,动作断裂和场景突变等问题更容易暴露,影响叙事连贯性和商业可用性。主流模型目前主要通过工程手段应对这一问题:Runway Gen-4.5依靠References(参考图)和Keyframe(关键帧)控制来维持跨段视觉统一;可灵3.0则锁定关键主体特征,确保多镜头生成中人物外观的一致性。但目前学术界和工业界对单段端到端分钟级视频生成仍处于探索阶段,现有技术路线普遍面临长程记忆缺失和质量退化等瓶颈。因此,当前视频生成更适合承担分镜头素材或片段内容生产,难以在完整叙事层面替代专业影视制作流程。
3)实时交互场景对系统工程能力提出了更高要求。随着视频生成从离线制作向实时交互演进,关键指标从单帧画质,扩展到延迟与稳定性。在数字人、虚拟客服、在线教育和互动营销等场景中,用户更关注模型能否及时响应输入,并持续生成自然连贯的画面。
- 流式输出与低延迟推流是当前支撑实时交互的主要落地方式。对于实时数字人和虚拟助手而言,低延迟直接决定用户是否会感受到明显等待和交流中断。目前具有代表性的方案主要分为两类:一类是以HeyGen LiveAvatar为代表的数字人驱动路线,通过WebRTC协议,实现音视频流的低延迟传输,并支持接入企业自有大模型,完成实时对话与表情反馈;另一类是以PixVerse为代表的通用生成路线,侧重于缩短生成等待时间,通过自回归流式框架追求连续视觉输出,但目前主要面向游戏/XR/互动叙事等场景。

- 系统并发和稳定性成为企业级应用的竞争维度。与个人创作者单次生成不同,企业级应用往往需要支持多用户的同时请求,系统性能在高并发下的稳定性就成为关键因素。同时,企业级实时视频生成往往需要接入客服系统、培训平台或营销系统,对服务连续性和响应稳定性要求更高。如果在高并发情况下出现明显延迟波动或画面中断,将直接影响商业场景中的交付质量。
4)产业格局加速分化,差异化机会更多出现在垂直场景。通用文生视频、图生视频和模板化编辑工具之间的功能差异正在缩小,行业竞争从单一工具能力转向模型平台的生态入口和垂直交付能力的综合竞争。Google、快手等基础模型厂商通过模型升级、API开放和生态集成,将视频生成能力嵌入开发者工具和企业工作流中。这种从底层模型向下游应用渗透的策略,抬高通用视频生成赛道的准入门槛,对仅提供标准化生成功能的独立AI视频SaaS构成潜在挤压效应。
- 头部厂商具备算力、数据以及生态集成的综合优势,可以通过API和平台分发能力持续降低视频生成的使用门槛。随着基础模型能力持续迭代,通用视频生成工具在画质、时长和基础编辑能力上的差距会进一步缩小。Google将Veo系列通过Vertex AI和Gemini API向企业开发者开放,其中Veo 3.1 Fast(Veo推出的面向开发者的低成本快速版本)按秒计费,1080p有音频版每秒约0.12美元;同时,通过Google AI Studio提供开发者接入层,将视频生成能力直接嵌入开发者工作流。快手旗下可灵同样开放了API,支持第三方平台集成。
- 企业培训与知识传播已形成初步可量化的市场需求。企业内部培训是视频生成较早形成规模化的场景。传统培训视频制作通常涉及拍摄、剪辑、配音、字幕和多语言版本制作,流程较长且更新成本较高。视频生成模型可以通过数字人模板、文本转视频和多语言配音能力提高培训内容的生产效率,尤其适合标准化表达的企业知识场景。以Synthesia为例,公司专注企业视频制作,于2025年4月披露其年度经常性收入已突破1亿美元,客户数量超过6万家。国内市场中,腾讯智影、百家云等厂商也推出了面向企业培训的AI视频生成工具,不过整体市场规模尚处于早期爬坡阶段。
- 数字营销与广告生产具备较强商业深耕价值。视频生成可快速制作短片广告、品牌营销素材和多版本内容,提升内容迭代效率,在营销场景中,可以降低创意测试和内容改版成本,具备较强辅助价值。Havas Group旗下Prose on Pixels将Runway用于全球品牌广告生产,其创意负责人表示约80%的客户请求会主动询问AI在制作中的使用。Under Armour “Forever is Made Now”项目也使用Runway辅助制作,项目周期约4周,较传统类似广告项目常见的5~6周周期有所缩短。


3.1.4. Agent:从单次任务完成到系统级持续运行
Agent的竞争重心正从单次任务的完成率,转向系统级的持续运行能力。早期行业关心能不能完成任务,现在更关注能否在企业环境中长周期连续运行而不出错。多Agent协作、自适应推理与持久化记忆、安全隔离体系,是当前支撑这一转变的三大主流技术方向。
1)多Agent协作与长周期自主决策深度融合,推动Agent承接复杂业务边界。单Agent在处理复杂任务时面临两个结构性约束:一方面上下文窗口限制了单次可处理的信息量,另一方面串行执行方式限制了任务的整体展开。多Agent协作架构可以将复杂任务分解为可并行执行的异构子任务,绕开上述约束,从而承接此前因规模或复杂度超限而无法落地的业务场景。
- 任务分解与多Agent并行协作,能够突破单次会话的窗口限制,扩展复杂任务的执行边界。单Agent架构下,跨文件代码重构、多文档综合分析等任务受制于上下文窗口,往往需要人工拆分后通过多次会话接力完成。多Agent架构的核心机制是由调度层将任务分解为若干异构子任务,再分配给各专职子Agent并行执行,最终汇总结果。这一机制将模型上下文窗口的硬约束,转化为调度层的编排能力问题。以月之暗面Kimi K2.6为例,其Agent Swarm能力支持最多300个子Agent并行执行4000步,相较前代K2.5的100个子Agent和1500步有明显提升;在BrowseComp基准测试中,K2.6得分为86.3%,高于K2.5的78.4%。

- 长周期执行对编排层的可靠性提出了更高要求。多Agent并行扩展了单次任务的处理边界,但当执行周期从分钟级延伸至小时级乃至天级时,将出现短时工作流框架没有涉及的新设计目标,比如会话中断后的状态恢复、子Agent失败后的任务重分配、长时间运行中的上下文漂移等。这意味着Agent的可用上限当前不完全取决于模型能力,还受制于编排基础设施的成熟度。根据月之暗面披露,内部测试案例显示,Kimi K2.6能支持运行数小时甚至连续五天的代理任务;在某项开源金融撮合引擎exchange-core的深度重构中,K2.6历时13小时、1000余次工具调用,自主重构了一个开源金融撮合引擎,实现中位吞吐量从0.43 MT/s跃升至1.24 MT/s(同比提升185%)。
2)自适应推理与持久化记忆,是Agent向持续工作流演进的两大支柱。Agent向持续工作流演进主要依赖于两项基础能力——在推理侧根据当前子任务的难度动态调配推理深度,在记忆侧跨会话保留任务状态与累积知识。
- 多步骤工作流中,推理深度的按需分配降低了Agent在低复杂度子任务上的无效算力消耗。Agent场景下,一个长周期工作流往往包含数十甚至数百个子任务,难度差异显著,比如数据格式转换和跨模块逻辑推理,需要的思考深度完全不同。如果所有子任务都启用深度推理模式,算力成本会随启用深度推理的子任务数线性上涨。因此,需要根据难度灵活分配,在不影响整体质量的前提下控制成本。例如,Claude Opus 4.7引入了自适应思考模式,由模型自主判断各步骤的推理需求;阿里巴巴Qwen3系列模型则提供了thinking_token_budget参数,允许开发者在API层面为不同子任务设定推理上限。
- 跨会话持久化记忆让Agent能够持续积累特定场景的认知。无状态Agent每次调用时需重新加载完整背景,有效上限受制于单次上下文窗口。具备持久记忆的Agent可在多次会话间保留对特定用户偏好、代码库结构或业务流程规则的认知,并随执行次数的增加逐步提升针对该场景的输出质量。2026年4月,Anthropic向Managed Agents平台开放持久化记忆公开测试版,将Agent各会话的习得内容以文件形式存储于受管文件系统。从运行效果来看,早期企业用户Rakuten(日本乐天)报告启用跨会话记忆后Agent的首次错误率下降97%、运行成本下降27%、延迟降低34%。

3)配套安全体系持续落地,防护思路从内容管控转向系统分层隔离。随着Agent通过MCP协议大规模接入企业真实系统,安全问题的性质发生了根本变化。早期Agent的安全边界基本等同于模型本身,即通过训练和提示词约束模型的输出内容。当Agent获得调用外部工具、读写数据库、操作代码仓库的能力后,攻击路径从模型输出层延伸至整个工具调用链,传统的输出内容管控已不足以覆盖新的风险面。当前的主流应对方案是执行环境隔离与动态授权双轨并行。在执行侧,通过独立沙箱隔离Agent的运行环境,例如NVIDIA OpenShell和腾讯Cube Sandbox,将安全策略交由底层系统托管,防止Agent越权修改。在权限侧,遵循最小权限原则,相关标准组织正尝试通过动态授权解决权限时效问题,如IETF体系中已有围绕MCP的多份授权草案在推进。此外,引入运行时安全检测层(如AgentTrust框架),在工具调用前通过语义分析进行风险研判与拦截。
![]()


3.2. AI基础设施行业:训练、推理、边缘分域演进,软硬一体化重构竞争力
3.2.1. 训练侧AI基础设施:系统级算力、供应链锁定与架构创新的协同突破
随着大模型训练竞争进入深水区,训练端AI基础设施的迭代逻辑正在改变。单点算力瓶颈促使产业重心全面转向系统级有效算力(MFU)的争夺。整柜协同、供电散热前置、超节点成为架构设计的主流,华为“韬(τ)定律”进一步点出缩短数据传输时间是关键;同时,HBM与先进封装产能紧俏,供应链锁定能力也已成为左右交付的核心变量。
1)整柜化成为训练端主线,系统级有效算力成为核心指标。2026年,大模型训练基础设施的竞争重心从单芯片转向整柜系统。随着模型参数量与数据规模持续扩张,单卡峰值算力受存储墙与通信墙限制,训练效率更多取决于芯片间互联带宽、HBM容量、集群调度算法及散热供电的协同程度,系统级模型算力利用率(MFU)成为衡量交付能力的实际标准。
- 头部厂商竞争重心转向整柜级训练交付。以英伟达GB300 NVL72为例,其采用机架级设计,通过NVLink全互连技术将72个GPU与36个CPU整合,并配套NVLink、InfiniBand/Spectrum-X网络和Mission Control管理系统,针对性解决万亿参数模型训练中的通信与扩展瓶颈。相比上一代Hopper架构,该平台通过提升显存带宽与互联速率,改善了大规模并行训练中的同步开销与扩展效率;同时,其高功耗特性也倒逼全液冷方案成为该系统的必要组成部分。这反映出龙头公司正从芯片设计转向涵盖互联、液冷及运维软件的整柜级交付。

- 龙头厂商通过自研ASIC、开放机架等差异化路径强化训练平台的系统化能力。面对万卡乃至十万卡级别的训练集群,单一芯片性能无法决定整体收敛速度。对此,AWS采取封闭自研路线,推出Trainium3 UltraServers;该产品通过NeuronSwitch互连技术,将多达144个芯片整合,配合高带宽HBM3e内存,重点优化了分布式训练中的数据并行与模型并行效率。这表明自研芯片策略已从单纯的硬件替代,延伸至针对特定训练负载的系统级架构定制。AMD与HPE则押注开放标准路线,计划于2026年推出Helios机架级AI架构(基于OCP开放标准的机架级AI解决方案),通过UALink互联协议和Ultra Ethernet网络实现跨厂商兼容,客户能基于标准组件灵活构建集群。
![]()

2)供电散热成为训练端架构设计的前置条件,高密度机柜扩容从“服务器堆叠”转向“电力—液冷—TCO”的协同约束。2026年,训练端AI基础设施的瓶颈不再局限于芯片算力与互联带宽,电力容量、散热效率和机柜功率密度正成为持续扩容的硬约束。随着整柜系统与超节点集群部署,单机柜功率从传统几十千瓦向百千瓦级迈进,高压供电、液冷方案及整柜级热管理能力直接制约数据中心的部署密度与总体拥有成本。
- 单机柜功率密度快速提升,液冷从配套选项转为部署前提。2026年,大模型训练对算力密度的高要求迫使散热架构同步升级,传统风冷已难以支撑百千瓦级机柜的长期满载稳定运行,液冷开始从高端选配转向旗舰超节点档位的部署前提。以NVIDIA GB300 NVL72为例,其整柜功耗约120 kW,需配套相应的全液冷散热能力;同时,高带宽互联(如NVLink 130TB/s级)带来的高功耗密度,使得供电与散热必须在机架设计阶段即协同规划,而非部署后的补救措施。

- 高压直流供电重塑AI工厂电力架构,供电效率与TCO成为重要评价维度。随着单机柜功率突破百千瓦,传统54V机架配电在电流承载、线缆损耗及空间占用上逐渐逼近物理极限。根据NVIDIA官方博客披露,其提出的800V HVDC架构旨在通过提升电压等级、简化转换环节来降低能耗与铜缆成本;在公布的目标情景下,相较于54V系统,端到端效率提升最高约5%,总体拥有成本(TCO)降低最高约30%。
3)国产算力依托超节点架构,从系统层面弥补单点不足,训练端的突破路径也从单点追赶转向集群效率优化。国产训练端AI基础设施的核心矛盾不只在于单卡性能对标,更在于在先进制程、HBM供给和软件生态仍存在约束的情况下,通过超节点组织方式(高速互联+分层网络)与集群调度,提升实际训练吞吐与资源利用率。头部厂商的策略重心已从追求单芯片规格,逐步转向围绕超节点组织方式构建可交付、可扩展的集群能力。以华为CloudMatrix为例,其通过MatrixLink将网络拆分为两层:超节点内部走Scale‑Up总线域,实现384卡全对等互联(2.8 Tbps卡间互联带宽、纳秒级时延);跨超节点则通过Scale‑Out网络支持微秒级通信。当前,此类超节点集群主要落地于自动驾驶、科学计算、能源、政务等对技术可控性要求较高的场景。

4)华为提出“韬(τ)定律”,揭示训练端性能增长逻辑正从“几何缩微”转向“时间缩微”。随着摩尔定律放缓,计算系统的瓶颈逐步从晶体管密度延伸至信号传输、数据搬运、封装互联和内存带宽等环节。华为这一理念将优化目标从晶体管面积缩小,拓展至缩短数据在计算、存储、互联间的流转时间,反映出竞争正由单点制程能力转向系统级协同。在此框架下,数据流动效率正逐步成为与晶体管密度同等关键的变量。大模型训练对芯片间通信、HBM访问和节点同步要求极高,若互联架构未同步优化,单纯增加算力核心数量难以显著提升训练效率。“韬(τ)定律”以系统级关键路径总耗时(时间常数τ)作为统一优化目标,更聚焦减少等待时间,与提升有效算力的目标方向一致。

5)HBM与先进封装成为训练集群交付瓶颈,供应链锁定能力从配套产能升级为核心竞争变量。训练端AI基础设施的交付节奏受HBM、先进封装和高端制造产能的共同制约,CoWoS-L、Chiplet和2.5D/3D封装等先进封装能力,也直接影响AI芯片与HBM的集成效率和量产节奏。供应链的稳定性正成为云厂商和芯片厂商竞争的重要考量。
- 随着训练模型规模扩大,HBM等高性能存储供给已成为AI集群扩容的关键前置条件之一。落地产品中,HBM4正由客户验证阶段逐步迈向早期量产爬坡,例如,SK海力士在2025年3月已向主要客户交付12层HBM4样品,目前处于量产准备与产线验证阶段;HBM4E也已进入头部客户的工程样品阶段,例如,三星于2026年5月宣布开始向主要客户交付12层48GB HBM4E样品,并按客户节奏规划后续量产,也说明头部存储厂商正围绕下一代AI服务器需求,提前布局产能并与核心客户深度绑定。
- 先进封装产能与HBM供应配额共同决定整柜级平台交付能力,AI基础设施竞争向上游供应链延伸。对训练端而言,芯片设计完成仅是第一步,HBM供应、CoWoS-L等先进封装产能,以及液冷、电力和整柜集成能力,都会影响最终部署节奏。随着NVIDIA、AMD、Google等客户对AI服务器内存需求持续增长,台积电等先进制造与封装资源更加稀缺。云厂商和芯片厂商正通过长期锁单、供应链绑定和整柜交付能力争夺扩容主动权,掌握关键产能的厂商将具备更强的议价权和交付优势。

3.2.2. 推理侧AI基础设施:从单点性能比拼转向系统级效率优化
随着模型调用量增加,推理侧AI基础设施的重点从能否支撑推理,转向能否在低成本下稳定运行。2026年,推理侧AI基础设施主要围绕单位Token成本优化、KV Cache管理、PD分离、异构芯片以及液冷与高压供电展开,基础设施竞争正从单一硬件堆叠转向系统级效率优化。
1)Token成本成为推理侧核心锚点,基础设施竞争从硬件堆叠转向单位服务成本优化。2026年,推理侧竞争不再只看服务器算力规模,而是更关注每个Token背后的综合成本;模型服务的商业化正进入更精细的成本测算阶段。2026年5月底,DeepSeek-V4-Pro模型结束优惠后,永久调整为原定价的1/4,费用核算方式与Token消耗量和模型单价直接挂钩——即每百万tokens输入0.025元(缓存命中)/3元(缓存未命中),输出6元。单位token的成本和芯片选型、显存利用率、请求调度、缓存复用和电力消耗等因素有关,这一价格水平下,如果推理系统的显存利用率、请求调度效率和缓存复用率没有显著提升,模型厂商在高并发调用场景中将很难维持正向毛利,这也倒逼底层推理系统提高资源利用率。由此看,推理侧AI基础设施的核心不只是提供更多算力,而是用更低能耗、更低时延和更高并发能力,支撑模型服务长期稳定运行。

2)Agent应用推高显存与缓存压力,KV Cache管理从推理优化项升级为长上下文服务的关键瓶颈。2026年,推理负载正从单轮问答转向多轮交互、工具调用和任务编排,模型服务对长上下文承载、显存容量、KV Cache管理和请求调度提出更高要求。推理平台性能不再只取决于GPU算力,而更多取决于显存、缓存、路由和调度的整体效率。
- 长上下文与工具调用放大KV Cache占用,推理系统瓶颈从计算吞吐延伸至显存与缓存管理。DeepSeek-V4-Pro支持1M上下文,在1M token上下文设置下,单token推理FLOPs降至DeepSeek-V3.2的27%,KV缓存占用仅为10%。但即使KV缓存已大幅优化,1M上下文下的绝对占用规模仍然可观(可达数十GB),结合较高并发限制(多请求竞争显存容量)和多轮工具调用(拉长KV Cache生命周期)场景,显存占用、缓存复用和请求路由成为影响推理吞吐的关键因素。

- MoE、MLA等模型算法反向影响推理基础设施设计,软件栈开始围绕缓存复用和多节点调度重构。以DeepSeek系列模型为例,DeepSeek-V3采用MLA(多头潜在注意力),DeepSeek-V4在注意力层采用CSA(压缩稀疏注意力)与HCA(重度压缩注意力)的混合结构,核心方向都是通过压缩注意力表示来降低KV Cache占用、提升推理效率。模型结构的变化直接体现在推理软件栈的优化方向上:以NVIDIA Dynamo为例,其开源框架通过KV缓存感知路由,将新请求导向缓存重叠度最高的节点,减少重复的预填充计算。

3)PD分离成为推理集群主流架构,推理服务器从统一部署转向阶段化资源调度。推理过程中,Prefill(预填充)和Decode(解码)属于两类不同负载:Prefill处理长上下文输入,偏计算密集;Decode以逐token生成和KV Cache读取为主,偏存储密集。两类任务混合部署会导致GPU算力、显存和带宽利用不均等问题,影响整体吞吐。PD分离则采取分开部署的方式,使Prefill专注计算、Decode专注显存带宽和KV Cache管理。以NVIDIA Dynamo为例,采用PD分离架构后,在Blackwell架构上通过PD分离将长输入场景下的交互速度至高提升4倍,在671B MoE模型上将吞吐量提升2.5倍,这表明PD分离的核心价值在于按负载特性分阶段调度资源,而非单纯增加GPU数量。

4)推理侧芯片选择正从通用性能转向场景成本最优,GPU、ASIC与LPU进入异构共存阶段。推理场景差异较大,单一路线难以覆盖全部需求,产业侧更可能形成通用GPU、定制ASIC与专用推理架构的组合路线,而非单一路线替代。
- 不同芯片路线围绕推理负载分工,通用性、经济性与低延迟成为异构部署的核心取舍。GPU适合新模型验证、复杂推理和多模态任务,能够覆盖模型快速迭代下的软件兼容与生态适配需求。ASIC更适合稳定模型和高频调用场景,通过定制化设计降低单位推理成本;根据TrendForce预测,2026年ASIC出货量增长率将达44.6%,高于GPU的16.1%。LPU等低延迟专用架构则面向token流式生成和响应速度要求较高的交互场景;英伟达在GTC 2026上将Groq LPU纳入核心战略,推出Groq 3 LPX机架(集成256颗LP30芯片,片上SRAM合计128GB),其加入使Vera Rubin平台每兆瓦的推理吞吐量提升35倍。未来推理端芯片竞争将不再是单一性能对比,而是围绕不同负载特征进行分层部署和成本优化。

- 异构部署能否真正降本,取决于互联效率、显存利用率和缓存层级设计。PD分离后,Prefill和Decode节点之间需要频繁传输KV Cache,对节点间互联带宽提出更高要求;同时,显存碎片和缓存占用可能导致显存浪费,推高系统成本。英伟达2026年数据中心方案正是围绕这三个维度进行设计:其产品布局涉及Vera CPU、Rubin GPU、BlueField DPU以及Groq LPU等异构处理器,并通过统一的传输库和多级KV缓存(GPU显存、CPU内存、SSD、远程存储)扩展有效容量。

5)液冷与高压供电从工程偏好转为财务刚需。推理业务具有持续调用、高并发和成本敏感的特点,芯片折旧、电力消耗、液冷运维等都将进入长期成本核算;液冷叠加800V高压架构有助于降低数据中心PUE,成为推理集群TCO优化的关键路径。
- 液冷从可选方案升级为高密度推理集群的基础配置。代表性产品中,英伟达GB300 NVL72峰值功耗约130~140 kW,远超传统风冷承载范围,因此,平台GPU、CPU与NVSwitch核心器件全部采用直触冷板液冷设计。根据Tom’s Hardware报道,下一代Vera Rubin单芯片功耗预计突破2300 W;维谛技术(Vertiv)高管接受访谈时指出,Rubin把单机柜功率密度推高至240~250 kW。字节跳动杭州余杭智算中心采用浸没+冷板复合液冷技术,利用江水自然冷却,750台液冷机柜实现PUE低至1.08;2026年,字节跳动新建智算中心已100%采用液冷。

- 高压直流供电替代传统48V/54V体系。根据英伟达官方博客披露,当机架功率超过200 kW时,传统的54 V配电方式开始达到物理极限:且铜材消耗量较大(1GW机架对应20万公斤铜母线),整个电力链中重复的AC/DC转换也不节能。与之相比,使用800V总线通道并从415V AC切换到800V DC,可通过相同的导体尺寸多传输85%的功率,将铜缆需求降低45%;DC系统还可消除AC特有的低效现象,进一步提高效率。国内公司中,华为数字能源模块化HVDC已支持800 V架构;字节跳动也开展800V HVDC试点。

3.2.3. 边缘侧AI基础设施:从硬件堆叠,向软硬协同的端边一体演进
边缘侧AI基础设施正从硬件堆叠向软硬协同的端边一体演进。算力部署上,端边分层部署成为主流,端侧依托低功耗设计、紧凑形态承载轻量化模型,边缘节点高带宽显存与工业加固应对高并发推理。在此基础上,软件工具链与系统级交付成为竞争焦点。硬件层面,依托存算架构降低数据搬运功耗,通过紧凑封装与工业加固提升工况稳定性。同时,交付模式转向订阅式租赁,芯片虚拟化分割提高异构算力利用率。
1)算力架构分层部署成为主流,端边协同实现算力资源与业务需求的精准匹配。在边缘侧电力供应、散热预算及物理空间受限的背景下,基础设施不再追求通用设备的全功能堆叠,而是转向端侧设备与边缘节点的协同调度:端侧设备采用低功耗紧凑形态,从而降低现场部署门槛,承载轻量化模型;边缘节点侧重高带宽显存与工业级加固,以应对内存墙瓶颈。
- 端侧设备:采用低功耗设计和无风扇紧凑形态,降低现场部署门槛,为轻量化小模型在端侧的应用创造条件。2025年3月,Supermicro发布迭代版SYS-E300系列机型(SYS-E300-14AR);作为Compact Embedded平台,其依托短深度与接口组合优势,适配设备现场机柜的嵌入式部署需求。2025年9月,研华推出DS-011超薄无风扇边缘终端,整机厚度约23 mm,搭载高通QCS6490平台,拥有双GMSL接口与超低功耗(TDP 6~9W),适用于商超数字标牌和质检场景。2026年上半年,随着端侧模型轻量化,参数规模在1B~3B的小语言模型在终端逐步具备落地条件;在此背景下,更多终端SoC/NPU加速路径倾向于通过INT4、FP8等低位宽量化手段,在既定功耗预算内提升有效算力,不再只依赖峰值TOPS指标。

- 边缘节点:侧重高带宽显存架构,通过工业级加固整机,满足本地高并发推理与隐私保护需求。边缘服务器多部署在弱电间或电控柜等无空调环境,通常需要采用短深度、防尘、支持宽温的工业加固结构。受大模型解码阶段的内存墙瓶颈约束,现阶段这类设备选型通常将显存容量与显存带宽作为重要考量。在此背景下,戴尔于2025年9月推出PowerEdge XR8720t短深度边缘服务器,面向电信/基站侧边缘与RAN融合场景。华硕于2026年6月在COMPUTEX发布RUC-2000系列边缘整机,采用2U半深机柜和宽温防尘无风扇工业规格,搭载Intel Core Ultra Series 3处理器,提供最高180 AI TOPS算力,适用于机器视觉、自动驾驶等边缘推理场景。

2)软件工具链与系统级交付成为竞争焦点,开发与交付水平构成厂商护城河。随着底层芯片算力差距收窄,软件适配成本、成套交付能力开始成为芯片及服务器厂商博弈的关键。其中,编译与量化工具链的成熟度直接影响算法部署效率;交付模式则逐步向预集成、整套系统方案过渡,以减少软硬件联调的摩擦。
- 软件工具链:编译及量化工具链的成熟度决定了算法从开发环境到现场设备的部署效率。在分散的边缘场景中,硬件碎片化且现场条件受限,开发者能否快速完成量化、转换与调试,往往比峰值算力更能拉开交付差距。为此,芯片厂商逐步将研发重心向能够快速部署、自动量化和对接通用框架的工具链倾斜,以降低部署门槛为目标,例如,开发者可以通过瑞芯微RKNN工具链,将模型量化后部署到Rockchip平台;通过高通AI Engine Direct路径,对接骁龙/IoT平台推理运行。2026年1月,恩智浦在CES发布eIQ Agentic AI Framework,在eIQ机器学习软件栈上提供面向边缘智能体的开发框架与硬件优化调度,帮助设备在资源受限条件下做低延迟本地决策。在工具链逐步成熟的基础上,Agent生态侧的标准化(如Anthropic提出的MCP)也在推动工具调用接口趋同,长期看有助于边端推理服务被更一致地封装与复用。

- 系统级交付:交付模式逐步从芯片、裸机交付,向预集成系统方案过渡,以降低现场部署与联调复杂度。为补齐软件与算法层短板,半导体公司通过并购强化一体化能力,核心逻辑在于将原本分散的“芯片+算法+工具链”打包成可直接落地的解决方案:2025年3月,高通宣布拟收购边缘AI开发平台Edge Impulse,旨在补齐从数据采集、训练到设备端部署的全流程软件栈,降低客户自行开发工作流的门槛;2025年10月,恩智浦完成对高性能推理NPU厂商Kinara的收购,在硬件层面补强独立NPU算力,并与自有eIQ软件栈形成协同。除了芯片原厂的纵向整合外,边缘整机与工控方案商的交付内容也正纵深延伸。部分厂商开始在出厂阶段预装推理引擎及视觉算法模板,将原本需要在客户现场完成的集成工作前置到生产环节,让智慧工厂、零售网点等客户能以更低集成代价完成批量上线。2026年5月,瑞萨电子宣布完成对希腊视觉感知软件商Irida Labs的收购,将其PerCV.ai轻量化视觉AI套件融入Renesas 365平台,进一步实现了从芯片到应用层的一站式交付闭环。

3)依托架构设计与结构优化,提升整机工况稳定性。边缘端硬件设计需同时应对功耗上限、物理空间和现场工况等多重约束。芯片端主要通过存算或近存架构降低数据搬运功耗,整机端则通过紧凑封装和工业加固结构,适配狭小安装位并提升抗振、防尘、宽温能力。
- 芯片端:低功耗推理需要做架构取舍,通过提升能效比,在有限功耗预算内持续运行。无风扇嵌入式档通常锁在10~30W的量级,芯片发热与热节流主要来自存储访问与数据搬运。行业主流方向是采用存算或近存架构,降低数据搬运功耗。例如,后摩漫界M30将存储与计算单元高度集成,在12~35W典型功耗下提供100~256 TOPS(INT8)的物理算力,已在信创AI PC等端侧场景落地;Syntiant的NDP系列则在毫瓦级完成音频/低帧率视觉的常开感知,适合传感器侧常驻负载。

- 整机端:采用紧凑型封装与工业加固结构,在适配受限物理空间的同时,增强现场抗扰能力。部署于产线、车载或户外电控环境的设备,通常面临安装位局促、粉尘、宽温与振动等挑战,因此设计上需要两头兼顾:一是选好器件封装,二是把整机结构做结实。器件层面,瑞芯微车规级SoC RK3588M(集成6 TOPS NPU)已通过AEC-Q100认证,已在广汽、上汽等多款车型量产;其采用BGA紧凑封装,占板面积小,适配车载中控、仪表等空间紧张的位置。AMD Ryzen Embedded处理器线的BGA封装方案也类似,短深度、宽温的工控节点采取这种方案有助于把整机做薄、做小。整机结构层面,以东田工控的加固产品线为例,其采用铝镁合金加固机身,配备IP54级防护与-20℃~55℃宽温设计,通过结构密封、减震和导热管理,应对粉尘、温差和高频振动,减少现场冲击造成的宕机。

4)交付模式与算力配置方式持续演进,订阅式租赁与虚拟化分割技术共同改善边缘部署的经济性。边缘节点比较分散,初期采购支出并不低,后期运维复杂度较高,因此基础设施不再只靠一次性买断和设备独立运行,而是转向按需付费和资源分割共享。具体来说:交付模式向分期租赁转变,降低企业前期投入成本;资源分配上引入算力虚拟化技术,将单颗加速芯片、整机算力拆分为多个逻辑实例,提高多任务并行的设备利用率。
- 商业交付:转向分期租赁与按需付费模式,缓解初期固定资产投入压力。对于分布式小微网点(如连锁零售、智慧药店等),设备一次性采购支出和后期技术维护门槛往往偏高。在此背景下,边缘算力租赁服务逐步推开。顺网科技通过旗下“顺网云边缘算力平台”,将电竞场所的闲时算力向外调度;截至2025Q3末,顺网科技已落地300多个节点机房,覆盖近200个重点城市,可为近80万台终端提供就近算力服务。戴尔自2020年起发布APEX订阅服务,联想于2023年推出Lenovo TruScale for Edge and AI方案,均面向边缘场景提供按需付费的算力部署选项,在一定程度上减轻了企业的一次性资金支出压力。

- 资源配置:引入算力虚拟化技术,提升异构算力资源的综合利用效率。传统单机单业务部署模式下,硬件利用率偏低。2026年上半年,依托边缘虚拟化管理软件,单台设备可拆分异构算力,并行承载AI客服、视觉质检等多业务。例如,戴尔于2026年5月将NativeEdge边缘管控平台升级为Dell Distributed Private Cloud,借助统一编排与零接触部署能力管控不同型号的硬件设备,在编排环节显著缩短了部署耗时。同时,边缘计算服务商Armada于2026年3月将其边缘平台整合至NVIDIA AI Grid架构,通过跨分布式GPU站点的统一编排与多租户隔离,支持运营商在多样化的边缘环境中统一运营分布式AI基础设施。

3.3. AI应用行业:下游机器人、自动驾驶、智能硬件等领域多点开花
3.3.1. AI+机器人领域:软件数据与模型能力迭代升级,硬件落地加速量产验证与场景试水
AI+机器人技术迭代节奏加快,整体沿着软件研发、硬件落地两个方向推进。软件层面主要通过优化数据工具、迭代基础模型,降低研发门槛,提升机器人对不同任务的适配能力;硬件层面的迭代更贴合细分场景需求,工业机器人逐步解决量产与商业化落地问题,家庭机器人侧重优化安全设计与真实场景测试能力,持续缩小样机演示与实际落地的差距。
1.1.1.1.软件侧:数据工具向全链路研发辅助演进,基础模型强化新任务适配能力
1)数据端:具身训练形成“视频预训练+仿真扩充+真机微调”的融合路径,数据工具向全链路研发辅助演进。
- 真实数据、仿真/合成数据与视频数据构成行业数据采集三大解决方案。在数据金字塔中,互联网数据作为根基,海量的在线视频与文本提供了模型训练所需的规模与多样性,但噪声过滤与动作对齐技术仍是攻关难点。仿真数据作为中层,通过仿真器大规模生成,可扩展性高,是破解数据瓶颈的重要路径,但需克服仿真到现实的差距。顶层是最稀缺宝贵的真实数据,直接从机器人硬件端采集,对模型的精准微调与最终性能验证具有不可替代的价值,但受制于高昂采集成本尚难以规模化。
- 数据工具正从单一仿真生成向“生成—评估—训练”闭环延伸。2026年1月,NVIDIA更新了Cosmos和Isaac工具链。其中,Cosmos Transfer 2.5和Cosmos Predict 2.5可生成合成数据和开展仿真评估,Isaac Lab-Arena用于机器人策略评估,OSMO可编排数据生成、训练和测试任务。相比单独使用某一个仿真数据工具,企业可以在同一套研发流程中反复生成数据、训练模型并检查执行效果,有望进一步提升研发效率。

2)模型层:基础模型逐步摆脱固定预设动作约束,可低成本适配多元新场景,复杂任务能力、泛化能力提升。
- 通用机器人模型和开源工具数量持续增加,为企业开展二次开发提供了更多选择。2025年2月,Physical Intelligence开放了通用机器人基础模型π0的权重,开发者可以在已有模型基础上开展微调和场景适配;2025年9月,考拉悠然开源悠然无界大模型BLM-1.0,模型可适配机械臂、AGV、工业机器人等多类设备,具备跨设备通用适配能力;2025年10月,北京人形机器人创新中心开放通用具身智能平台慧思开物SDK和具身世界模型WoW,进一步丰富行业通用模型研发工具生态。

- 基础模型的复杂任务规划与结果校验能力持续升级,适配高难度实操场景。现阶段机器人基础模型逐步具备空间感知、自主规划、工具调用与结果核验的综合能力,可更好应对复杂非标准化场景。例如,Google DeepMind的Gemini Robotics-ER系列于1.5版本重点优化机器人空间理解、任务规划与第三方工具调用核心能力,在1.6版本新增多视角空间感知、仪表读数识别、任务执行结果核验等功能。根据Google官方披露,叠加视觉智能体能力后,Gemini Robotics-ER 1.6在仪表读数测试中的准确率达93%,远高于Gemini Robotics-ER 1.5的23%。

- 行业聚焦基础模型场景迁移能力建设,持续强化跨任务、跨本体适配性能。现阶段模型研发更侧重于泛化能力升级,可在无专属训练数据、少量指令提示的前提下适配全新任务。2026年2月,小米机器人实验室发布Xiaomi-Robotics-0,该模型在LIBERO基准测试中平均成功率达98.7%,通过乐高拆解、毛巾折叠等多项真实机器人实操测试,展现出强大的跨任务泛化能力;2026年4月,Physical Intelligence发布π0.7,延续π0系列跨本体适配架构,可接收语言指令、任务元数据、视觉子目标等多维度提示信息,在没有采集该系统对应的洗衣折叠数据的情况下可完成折叠任务。

3.3.1.2.硬件侧:工业场景走向量产与商业化落地,家庭场景聚焦安全与长链验证
1)工业场景:产品形态依任务需求分化,评价标准从演示性能转向量产稳定性与商业验证。
- 机器人的硬件形态从单一固定臂向多元化本体延伸。工业场景对效率、可靠性和任务适配的要求较为明确,企业依据作业环境选择适配的具身形态。2025年7月,深圳赛博格机器人发布Cyborg-R01人形机器人,双臂负载20kg,面向危化品搬运、电力巡检等高危非结构化场景。2025年9月,越疆科技推出“多形态具身智能超级工厂”方案,可适配多品类机器人硬件协同作业,覆盖工厂物流、分拣、检测、精密组装等全工况。2026年4月,宇树科技推出R1系列双臂操作平台(含固定基座R1-A7与移动底盘版R1-A7-D),末端支持快换执行器,手臂负载约2~4kg,面向轻工业辅助、实验室与科教场景。

- 制造体系逐渐完善,软硬件协同升级成为重要方向。以Figure为代表的厂商推动人形机器人制造能力迈向工程化成熟。根据Figure2026年4月的BotQ工厂产线数据,Figure 03机型在四个月内产量由日产1台提升至每小时1台,累计下线超350台,整机一次通过率超80%,电池包良率达99.3%,并规划老化测试流程,标志着量产良率与测试体系成为衡量成熟度的硬指标。同时,产业链上下游合作推动开发范式向软硬件协同演进。2026年6月,英伟达与宇树科技等推出Isaac GR00T人形机器人开发栈的开放参考设计,以宇树H2 Plus为本机,搭载Jetson Thor算力与GR00T平台,统一数据采集、仿真训练与真机部署链路;整机计划于2026年底由宇树科技交付,首批面向科研机构。

2)家庭场景:安全设计与居家交互是产品准入前提,实测重点由单次操作向长时序连续任务延伸。
- 家庭机器人需要在人附近活动,安全设计与适配居家交互是产品研发的核心抓手。与工业场景相比,家庭空间中的物体摆放、人员活动和任务指令更不固定,产品需要在完成任务的同时,控制好接触风险。2025年8月,镜识科技发布双形态家庭机器人BAOBAO,其四足形态便于在家庭空间中移动,类人形态则更适用于交互场景任务。2025年10月,1X发布家用人形机器人NEO,依托腱驱动系统和软质外壳,降低机器人在家庭环境中活动时的碰撞风险。

- 家庭机器人的任务测试由单次单点抓取,延伸至长时序连续作业、工具实操与多机协同场景。Figure搭载Helix 02系统的人形机器人于2026年1月完成整套厨房洗碗机操作,全流程历时4分钟,拆分61步动作;同年3月落地客厅综合整理测试,覆盖桌面清扫、软质物件收纳等多类实操;同年5月完成无中央调度架构下的双机协同卧室整理,整套作业耗时不足两分钟。居家场景实测周期不断拉长、任务链路贴近生活化流程,便于在交付落地前排查连续运行环节的产品隐患。




3.3.2. AI+智能驾驶领域:仿真验证与模型架构迭代,运营车扩张、乘用车渗透提升
AI+智能驾驶行业的技术迭代整体沿着技术和应用两个方向推进。技术侧主要通过仿真工具和世界模型降低测试成本,通过端到端架构和云端训练提升车端决策能力,通过软硬协同平台缩短量产周期;应用侧分为运营车和乘用车两条路线:运营车扩大订单和车队规模,乘用车L2渗透率提升、L3开始试点。
3.3.2.1.技术侧:仿真验证体系成熟,端到端架构收敛,软硬平台沿双路径演进
1)仿真验证:不再局限于扩充训练样本,更多用于在虚拟环境中反复测试低频高风险场景,帮助缓解安全合规与测试成本压力。
- 仿真重建与生成式世界模型的价值,已从提供更多训练素材,逐渐延伸到在虚拟环境中反复测试低频高风险场景。2025年8月,NVIDIA发布Omniverse NuRec库(神经重建工具集),可将真实驾驶传感器数据重建为真实感3D场景,并接入CARLA开源模拟器用于重播与测试。2025年12月,Wayve发布GAIA-3生成式世界模型(约15B参数),强调以生成式仿真做离线假设性边缘场景评估,并与学术机构合作验证合成测试与实车结果的一致性。

- 仿真工具进一步完善闭环测试能力,而不只是开环数据生成。2026年1月,NVIDIA在CES发布Alpamayo系列,包括Alpamayo 1(100亿参数VLA模型)、开源闭环仿真框架AlpaSim,以及覆盖25个国家、超过1700小时的多传感器驾驶数据集。该系列定位偏研究评估与开发辅助,开发者可基于重建场景在AlpaSim里跑闭环,围绕具体问题反复验证策略表现。
- 世界模型的控制能力与诊断用途增强,开始被用于定向补足长尾场景。2026年2月,Waymo发布Waymo World Model,该模型基于Google DeepMind的Genie 3构建,可生成多传感器仿真结果;研发人员可以通过驾驶动作、场景布局和文本指令等调整模拟场景,用于测试极端天气、异常车辆和罕见障碍物等低频复杂情况。2026年4月,小马智行发布PonyWorld 2.0,该模型可识别智能驾驶系统自身表现不足的场景类型,并反向指导定向数据采集与模型的训练迭代。

2)模型架构:从实现基础功能转向提升量产稳定性,配套推理验证工具链提供迭代支撑。当前辅助驾驶系统正通过持续迭代提升复杂场景处理能力。2025年10月,特斯拉向北美HW4用户推送FSD(Supervised)V14,重点优化路口、环岛及施工区等城市工况的决策连贯性,并增加速度偏好和到达选项等功能。NVIDIA的Alpamayo 1(暂未用于车端量产部署)则代表了另一种技术路线:将VLA式推理轨迹引入驾驶评估,模型除输出轨迹外,还附带逐步推理文本,便于开发侧在仿真中定位判断逻辑问题,从而间接服务于量产稳定性的验证与改进。随着端到端架构与世界模型的结合日益深入,云端训练范式的升级成为提升车端能力的关键支撑。例如,华为于2025年4月发布的乾崑智驾ADS 4采用WEWA架构(云端世界引擎+车端世界行为模型)替代传统分层规划;2026年4月升级的ADS 5(WEWA 2.0)则通过在云端引入多智能体博弈与在线强化学习、车端引入安全风险场,系统性提升复杂交互与防御性驾驶能力。

3)平台架构:行业形成垂直整合、开放平台化两条软硬协同路线,分别依托全栈自研、标准化接口降低车企开发成本、缩短车型量产周期。前者以华为为代表,自研芯片、操作系统与感知硬件形成闭环;后者以NVIDIA为代表,通过预集成参考架构,降低车企重复开发成本。华为方向,2026年3月,华为推出896线双光路图像级激光雷达,强化逆光、雨雾、异形障碍物等复杂场景感知能力,构建高精度感知硬件底座;同年4月,发布乾崑智驾ADS 5,并首发专属乾崑OS自动驾驶操作系统。依托自研感知硬件、车载操作系统与智架算法的闭环体系,华为实现了软硬件深度适配与统一调度,有助于降低车企多供应商选型的协调成本,压缩车型量产落地周期。NVIDIA方向,公司于2026年3月公布DRIVE Hyperion L4参考架构,以预集成的计算、传感器、网络硬件搭配Halos OS安全架构层,供比亚迪、吉利、五十铃和日产等车企在此基础上开发L4级项目,以减少不同车型间的重复适配工作。

3.3.2.2.应用侧:运营车运营范围与规模迅速扩大,乘用车辅助驾驶加快量产落地
1)运营车场景:自动驾驶出行服务保持较快增长,头部企业持续投入。近年来,自动驾驶出行服务保持较快增长。2025年,萝卜快跑全球覆盖22座城市,周均全无人订单量超过25万单,截至11月累计出行服务超过1700万次;Waymo全年出行次数达到1500万次(累计超过2000万次)。2026年扩张态势延续:萝卜快跑一季度完成320万次全无人运营订单,同比增长超过120%,截至5月全球业务覆盖27座城市,并在迪拜多个区域开展全无人运营;Waymo第六代Driver进入全无人运营,通过精简传感器配置降低成本;小马智行一季度Robotaxi收入同比增长395.4%,截至5月车队规模超过1700辆。

2)乘用车场景:L2渗透率稳步提升,L3处于限定条件试点阶段,共同推动商业化进程。截至2026年2月,国内L2级新车渗透率达69.15%,较上年同期提高10 pct。辅助驾驶方案也开始适配更多芯片平台和量产车型。例如,文远知行于2026年4月发布WRD 3.0辅助驾驶方案,支持NVIDIA DRIVE、高通骁龙和芯擎科技星光AD1000等计算平台,已获得近30款车型量产定点;其首款合作量产乘用车广汽埃安N60于4月开启预售,功能覆盖城市、高速、泊车和主动安全场景。目前L3级仍处于限定条件试点阶段。2025年12月,工业和信息化部向长安和极狐两款车型发放首批L3准入许可,其中长安深蓝SL03可在重庆试点区域内以最高50km/h速度行驶,极狐阿尔法S6可在北京指定高速以最高80km/h速度行驶。




3.3.3.AI+智能硬件领域:端侧算力与终端形态升级
AI与智能硬件的结合正在由单项功能叠加转向系统级整合。手机和PC仍然是主要载体,但行业的竞争重点已经不只是增加问答、修图和文本生成等独立功能,而是让模型进入操作系统和应用生态,理解用户当前场景并协助完成多步骤任务。同时,智能眼镜、耳机和家庭设备逐步成为新的交互入口。
1)手机端和PC端:端侧算力继续提高,硬件升级围绕系统级AI展开。手机和PC仍然是端侧AI的主要计算载体,持续运行的系统级智能体也对芯片算力、内存、散热和续航提出了更高要求。手机端,三星于2026年2月发布的Galaxy S26 Ultra采用定制版骁龙8 Elite Gen 5移动平台,NPU性能较上一代提升约39%,用于支持持续运行的Galaxy AI功能。PC侧,Intel于2026年1月发布Core Ultra Series 3处理器,这是公司首款采用Intel 18A制程的AI PC平台,覆盖超过200款终端设计,其中高端型号的NPU算力最高可达50 TOPS;华硕同月在CES发布多款AI PC,其中Zenbook A16采用Snapdragon X2 Elite Extreme平台,NPU算力约为80 TOPS。智能终端的升级重点正在由单独增加一个AI应用,转向为本地推理和系统级任务执行提供更稳定的硬件基础。

2)智能眼镜端:优先推进日常佩戴与语音交互场景,视觉理解和任务执行能力逐步接入。
- 智能眼镜逐步成为较受关注的新型AI终端。智能眼镜可以通过摄像头、麦克风和扬声器获取周围环境信息,并在用户不拿出手机的情况下提供辅助。目前,相关产品优先围绕日常佩戴和高频语音交互设计,以降低用户持续使用的门槛。例如,Rokid于2026年1月在CES发布了智能眼镜Rokid Style,其采用无显示屏设计,重量仅为38.5克,支持调用ChatGPT、通义千问和DeepSeek等不同AI平台,并接入Google Maps和AI翻译等服务;联想也在CES 2026展示Lenovo AI Glasses Concept,强调将个人AI接入免手持的可穿戴交互设备。

- 智能眼镜的功能延伸至视觉理解、任务执行和特定场景服务。早期智能眼镜主要以语音问答作为核心交互方式,用户通过语音提问获取信息或控制设备。近期的产品更新则开始将功能扩展至视觉理解、任务执行和特定场景服务。根据Google在2026年5月展示的Android XR方案,用户可以通过Gemini询问并完成实景识别、步行导航、消息发送、实时翻译等多步骤免手持任务。Google同时明确后续还将推出可以在镜片中显示信息的显示型眼镜。同月,Meta宣布AI眼镜无障碍功能更新,用户可以自定义快捷按键,快速调用环境描述或连接Be My Eyes志愿者;Meta Ray-Ban Display增加实时通话字幕,并推出面向开发者的Wearables Device Access Toolkit。

3)其他终端:耳机、手环、电视和家庭设备等开始围绕具体场景接入AI能力。
- 耳机、智能手环和其他可穿戴设备具有较稳定的佩戴习惯,适合承接语音交互、健康管理和环境感知等轻量化AI服务。2026年1月,联想旗下子公司Motorola在CES展示了Project Maxwell可穿戴AI伴侣概念,探索不同设备间同一上下文感知的连接。2026年2月,三星发布Galaxy Buds4系列,支持通过语音调用三星语音助手Bixby,同时可联动手机调用Google Gemini和Perplexity等AI助手或服务;Buds4 Pro还可以通过头部动作管理通话和调用Bixby。Google于2026年5月发布无屏智能手环/健康追踪器Fitbit Air,该设备可以与Google Health应用配合,用于全天健康监测、睡眠追踪和个性化健康建议。

- 电视和家庭设备中的AI应用由联网控制和固定规则逐步延伸至视觉识别和场景服务。三星于2026年1月在CES发布Vision AI Companion电视平台,该平台可以理解用户正在观看的内容,并在屏幕中提供相关信息;同期,三星展示了Home Companion家庭设备方案,Bespoke AI冰箱、Bespoke AI Laundry Combo洗烘设备和Bespoke AI Jet Bot Steam Ultra扫地机器人能够通过摄像头、屏幕和语音交互协同工作,Bespoke AI冰箱和酒柜也采用Google Gemini增强AI Vision功能。同月,TCL在CES展示了AI驱动的智能生活产品组合,包括AI电视、AR眼镜、投影设备和TCL AiMe模块化AI陪伴设备,强调AI在娱乐、家庭陪伴和智能家居中的连接能力。




3.3.4.AI Agent领域:企业流程与软件研发率先形成完整工作流,办公Agent持续跟进
AI Agent领域中,企业流程Agent和软件研发Agent率先形成完整工作流,分别接入业务系统和覆盖编码全流程;办公Agent则开始持续跟进个人任务,协调邮件、日历和文件等日常事务。
1)企业流程:Agent开始接入旧系统和审批规则,推动端到端流程执行。企业流程Agent的落地重点不是增加一个聊天入口,而是打通邮件、系统操作、业务规则和人工审批链路。2026年1月,ServiceNow与Anthropic宣布将Claude作为ServiceNow Build Agent的默认模型,使开发者可以通过自然语言构建和部署Agent工作流;ServiceNow还向超过2.9万名员工部署Claude和Claude Code,用于销售准备和工程研发。2026年5月,Graebel(一家全球人才流动与员工搬迁管理服务商)利用Copilot Studio计算机使用型Agent处理员工搬迁服务订单,Agent可以读取非结构化邮件、校验业务规则、直接操作缺少API的Global Connect平台,并在异常情况下转入人工流程,可扩展至30多类搬迁服务类别。

2)软件研发:由代码补全延伸至任务拆解、测试和交付,并提高复杂工程与长周期任务的处理能力。
- 软件研发流程具有明确的代码库、测试和版本控制体系,适合Agent执行可验证任务。编码Agent正在由提供代码建议,转向接收任务并交付可审查的变更。2026年2月,OpenAI发布Codex桌面应用,支持开发者并行管理多个编码Agent、运行后台任务并审查隔离工作区中的代码差异;4月更新后,Codex可以操作计算机、连接更多应用,并安排未来任务或在较长周期内继续工作。GitHub Copilot CLI也于2026年2月正式可用,能够在终端中规划、构建、审查并保留代码库记忆;Copilot coding agent则可以在独立环境中处理问题单,完成修改后提交草稿PR供开发者审查。

- 研发Agent正在提高复杂工程任务和长周期任务的处理能力。研发场景下的人机分工逐步明确:Agent负责检索代码、实施修改和运行验证,开发者负责确定目标、审查方案和决定是否交付。2026年2月,Apple Xcode 26.3原生集成Claude Agent SDK,使Claude可以在集成开发环境(IDE)中使用子Agent、后台任务和插件,根据目标拆解任务、修改多个文件并通过界面预览检查结果。同月,Anthropic发布Claude Opus 4.6,引入类似AI代理团队的Multi-Agent能力,与在前代模型相比编程能力进一步提升。5月,Google发布Antigravity 2.0开发平台,支持开发者并行编排多个Agent、调用动态子Agent和设置后台定时任务,并将项目在Google AI Studio、Android和Firebase等开发环境间流转。

3)办公助理:办公Agent从回答问题和生成初稿,逐渐延伸至收集信息、安排任务和直接产出工作成果。代表性Agent开始结合邮件、日历、文件等信息推进工作。2026年6月,Microsoft发布个人办公Agent Scout,目前面向部分客户和Frontier组织提供实验性体验;Scout可以跨Teams、Outlook、OneDrive和SharePoint运行,协调会议、生成会前材料、识别临近交付事项并在日历中预留时间。同月,OpenAI宣布Codex周活跃用户已超过500万,知识工作者约占用户的20%,主要使用其制作报告、表格、演示文稿和合同,并开展研究、数据分析和流程自动化。




3.3.5.AI+内容生成领域:视频生成进入生产流水线,AI编程强化长周期任务并降低开发门槛
AI内容生成向更复杂、更贴近专业生产的任务延伸。视频生成侧,国内厂商加快模型迭代,文本、图像、音频和视频等输入形式逐步统一,模型开始同时处理画面、对白和音效,强化分镜、角色一致性和视频编辑能力;AI编程侧,海外开发工具也在加速向复杂任务和研发全流程延伸。
1)AI+视频生成:视频生成工具正从个人生成单条短片,逐步进入团队协作与生产流水线。可灵AI推出Team Plan,支持最多15名成员协同管理素材与内容生产流程,并参与《太平年》《大卫王朝》等影视项目的视觉制作。Seedance 2.0发布后接入豆包及火山方舟平台,当前付费使用场景集中在影视、广告、电商、游戏等内容生产领域,例如,2026年央视春晚《贺花神》成为全球首个深度应用该AI视频生成模型的公开项目;据快手2026Q1业绩公告,可灵AI当季收入超过6.5亿元,同比增长超300%。MiniMax旗下海螺AI作为世界人工智能电影节合作伙伴,在圣保罗、首尔及京都等地开展影像创作交流活动。需要注意的是,AI视频创作的定位仍以人机协同的生产力工具为主,尚未完全替代传统拍摄与后期流程。

2)AI+编程:代码模型层面,竞争重点从单次生成正确代码,转向理解大型项目并完成长周期任务。产品形态层面,面向专业开发者的工具已从编辑器插件扩展到云端Agent、终端工具,并初步支持版本控制和代码审查;同时,面向非专业开发者的自然语言开发工具也在快速降低软件生产门槛。
- 代码模型:竞争重点正从单次生成正确代码,转向理解大型项目并持续完成复杂任务。2026年4月,OpenAI发布GPT-5.5并将其接入Codex,该模型强化复杂代码库理解、长周期任务执行以及调用工具调试和验证代码的能力,在Terminal-Bench 2.0和SWE-Bench Pro上的准确率分别达到82.7%和58.6%。5月,Anthropic发布Claude Opus 4.8,强化编码、Agent任务和专业知识工作表现;旗下的AI编程代理Claude Code同步增加动态工作流功能,用于处理更大规模的工程问题;同月,Cursor发布自研编码模型Composer 2.5,重点提高长周期Agent任务中的智能水平和行为稳定性。

- 产品形态(面向专业开发者):AI编程工具已覆盖终端、云端环境和版本控制流程。2026年2月,GitHub Copilot CLI正式发布了Copilot CLI的General Availability版本,它不是VS Code插件的命令行移植版,而是一个独立的、终端原生的AI编程 Agent,可以在终端中规划、构建和审查代码。同月,Cursor升级云端Agent,为Agent提供独立虚拟机和完整开发环境,使其能够修改代码、运行软件并生成视频、截图和日志等验证材料,最终提交可合并的PR;4月,Cursor 3将多个Agent、编辑器和代码审查整合进统一工作区。

- 产品形态(面向非专业开发者):自然语言开发工具降低软件生产门槛。2026年3月,Replit发布Agent 4,用户可以通过自然语言生成网页、移动应用、数据看板和AI工具,并在设计画布中调整界面;多个Agent可以并行处理身份认证、数据库、后端和前端设计等任务。4月,Windsurf发布Windsurf 2.0,将Agent Command Center和Devin能力接入开发环境,用于统一管理不同编码任务。



3.3.6.AI+其他领域:AI在金融、医药、科研、教育领域加快应用落地
1)AI+金融:从信息查询和内容生成延伸至企业级Agent部署。金融机构早期主要将AI用于客服问答、材料总结和代码辅助,当前应用范围正向财富管理、研究分析、贷款处理和风险合规等专业环节延伸;部分头部金融机构正在同时建设面向客户和员工的AI应用、连接核心系统的执行平台以及可供Agent调用的专业数据接口。2026年4月,花旗发布面向财富管理客户的Citi Sky,该工具基于Google Cloud和Google DeepMind技术提供市场信息和个性化财富管理支持,目前定位为投顾辅助工具,不直接替代人工决策;同月,花旗推出内部AI Agent开发平台Arc,用于在风险管理框架内开发和部署Agent,使其承担研究、信息整理、业务准备和执行等任务。5月,Fiserv推出面向银行业的agentOS,将Agent接入核心银行、支付、发卡处理和服务系统,首批覆盖商业贷款开户、运营报告、存款分析和反洗钱审查等流程,并内置身份绑定、政策执行和运行追踪机制,预计将于同年8月全面开放商用。同月,伦敦证券交易所集团通过MCP向Amazon Quick开放定价、公司基本面、宏观经济和分析模型等持牌数据,使Agent可以在研究和受监管业务流程中调用经过治理的专业数据。



2)AI+医药:模型、Agent和自动化实验室逐步连接研发全流程。医药研发周期长、实验成本高,AI的应用价值正在从预测药物性质、设计实验并依据结果调整方向,延伸到连接计算、实验和企业数据的连续研发流程。随着模型、算力平台和自动化实验设备逐步连接,大型药企与科技企业的合作重点也从提供算力或模型,转向共同建设连接计算实验、湿实验和企业经营系统的AI平台。2026年1月,英伟达与礼来宣布在五年内共同投入最高10亿美元建设AI联合创新实验室,依托BioNeMo平台和新一代计算架构连接计算实验室与Agent驱动的湿实验室,使模型预测、实验执行和数据反馈能够持续循环。同年3月,默沙东披露,其与英伟达联合研发的KERMT基础模型(使用超过1100万种分子训练)可用于预测候选分子在人体内的表现,帮助研究人员更早识别先导化合物优化中的潜在问题。4月,默沙东与Google Cloud达成最高10亿美元的多年合作,计划在研发、制造、商业和企业管理等环节部署基于Gemini Enterprise的Agent平台。



3)AI+科研:科研AI正从辅助基础工作、提高单项效率,延伸至参与科研问题的分析和验证过程。科研场景中的AI应用目前分为两类:一类用于论文撰写、资料整理和专业计算,减少研究人员的重复劳动;另一类开始介入假设提出、实验优化和结果验证,直接参与科研问题的分析过程。相应地,科研AI的产品形态正沿着三个方向推进:通用研究工具(服务协作与文档处理)、学科专用模型(比如气象预测)和多Agent实验平台(用于复杂问题验证)。2026年1月,OpenAI推出科研写作与协作平台Prism,将GPT-5.2接入论文撰写、公式处理和多人协作流程,减少资料整理与文档编辑等重复工作。在通用科研协作工具之后,英伟达AI进入气象等垂直领域,同月发布Earth-2开放气象模型系列,覆盖观测数据处理、最长15天的全球天气预测以及0至6小时局地强天气预报,为科研机构和气象部门提供可部署的模型及工具链。6月,微软宣布Microsoft Discovery正式可用,研究人员可以部署由多个专业Agent组成的团队,用于检索知识、提出假设、优化实验和验证理论;微软第二代拓扑量子芯片Majorana 2正是依托该平台进行测量管理、制造优化、缺陷识别。


4)AI+教育:由直接回答问题,转向引导学习和辅助教学。教育AI的产品设计正在更多考虑学习过程,而非快速给答案;面向学生的工具通过分步提问引导思考,面向教师的工具辅助备课、作业生成和进度分析。随着学校介入账号与数据管理,AI从通用聊天工具,转向围绕课程目标部署的辅助系统。头部厂商正围绕引导式学习、课程管理和个性化练习三个方向,分别服务学生自学与教师管理。2025年7月,OpenAI推出ChatGPT学习模式,通过分步骤提问、难度调整和理解检查,引导学生自行完成推理过程。2026年1月,Google更新Gemini和Google Classroom,为学生提供由The Princeton Review内容支持的完整SAT模拟测试,并允许教师利用课程上下文生成作业、总结学生进度;Classroom还增加学习参与度和任务完成情况分析,帮助教师识别需要额外支持的学生。5月,微软正式推出Microsoft 365 Copilot中的Study and Learn Agent,该工具可以根据学生上传的文档、课件和PDF生成分步辅导、抽认卡、测验及配对练习,并通过学校现有账号、管理权限和数据保护体系部署。


4. 全球人工智能巨头战略风向
4.1. 英伟达(NVIDIA):从算力硬件向AI系统方案延伸,物理AI、AI工厂布局逐步落地
2025年以来,英伟达将业务重心从算力供应转向“AI工厂”系统方案,通过硬件平台迭代、物理AI工具链扩展、推理软件栈优化及供应链协同整合,逐步构建覆盖训练、推理、网络与部署的全链路基础设施能力。
1)硬件架构实现突破,产品重心从单颗芯片性能转向系统级方案。2025年以来,英伟达逐步将产品重心从单颗芯片领先,转向AI基础设施整体效能;通过整合芯片、网络、软件等系统级能力,提升交付效率与平台适配能力。
- Blackwell系列完善算力产品布局,互连技术支撑集群扩展。2025年,英伟达围绕Blackwell架构推出GB300 Grace Blackwell Ultra、DGX Spark、DGX Station等多层次产品,覆盖不同场景需求,并公布了后续技术路线图。同年,英伟达在互连技术方面取得进展,Spectrum-X以太网解决方案的迭代,为大规模GPU集群的高效通信提供支撑,推动算力系统从单一节点向数据中心级协同发展。
- Rubin平台强化系统级整合能力,延续其在高端AI算力市场的既有优势。2026年1月CES会上,英伟达展示了下一代AI芯片平台Vera Rubin,该产品以系统级协同设计为核心,整合Vera CPU、Rubin GPU等组件,面向大规模训练、MoE及智能体推理等场景进行优化。3月GTC期间,公司宣布Vera Rubin平台相关7款芯片进入全面生产阶段,并推出Vera Rubin DSX AI Factory参考设计,为AI算力中心的建设提供从架构设计到能效优化的全链路解决方案。

2)技术能力逐步拓展至机器人、自动驾驶及工业数字孪生领域。2025年1月CES,公司推出Cosmos物理AI平台,为机器人及自动驾驶系统提供基于物理规律的虚拟训练环境;同期发布Omniverse蓝图Mega,用于在工厂/仓库的数字孪生中大规模开发和测试机器人集群,推动仿真优先的部署流程。2025年9月CoRL,公司发布开源推理视觉语言动作模型Isaac GR00T N1.6,并与Google DeepMind、Disney Research共同推进Newton开源GPU加速物理引擎,以提升机器人在复杂物理场景中的推理与Sim2Real迁移效率。2026年1月CES,Alpamayo开放模型生态,为自动驾驶开发者提供从模型权重、仿真到数据集的开放工具链。

3)通过强化推理软件栈与智能体开发工具,英伟达将业务边界延伸至软件工具与企业级AI平台。
- 推理框架与智能体工具链升级。2025年3月,英伟达发布Dynamo开源推理框架,通过提升吞吐量、缩短响应时间、降低总拥有成本,帮助客户降低单位token服务成本。2026年3月,公司推出Dynamo 1.0,在大规模GPU集群中协调计算和内存资源,优化请求路由、KV缓存管理和分布式推理调度,并与LangChain、vLLM等生态框架集成。同月,公司推出NVIDIA Agent Toolkit、OpenShell和AI-Q Blueprint,覆盖企业级智能体开发、部署、安全和成本管理需求,推动业务从底层算力向智能体应用开发延伸。

- 本地AI计算产品布局完善。2026年6月,英伟达联合微软推进面向Windows PC的本地智能体计算布局,推出RTX Spark(基于Blackwell RTX超级芯片的Windows PC平台)及DGX Station for Windows(桌面级AI超算),完善从数据中心至端侧设备的计算版图。其中,RTX Spark面向本地大模型运行与智能体调度,DGX Station for Windows则定位于本地模型开发与智能体开发平台,支持开发者在桌面环境完成模型开发、调试和测试,同时与云端部署形成协同。该系列产品的推广,有助于提升CUDA与TensorRT等软件栈在桌面与本地AI场景中的渗透,增强生态粘性。

4)业务边界延伸至AI工厂供应链,强化基础设施协同布局。2025年9月,英伟达与OpenAI建立战略合作,计划部署至少10吉瓦NVIDIA系统,以最大买方需求牵引AI工厂交付标准与供应链组织。2025年10月,公司发布用于吉瓦级AI工厂设计与运营的Omniverse DSX Blueprint,为园区级部署提供数字孪生参考框架,将协同关系落实到具体的工程标准上。2026年5月,公司与Corning建立长期合作,Corning将在美国本土将光连接制造产能提升10倍、扩建三座工厂,以保障AI集群所需先进光互连供应;同月与IREN合作,计划部署最高5GW、与DSX架构对齐的基础设施,锁定核心园区的电力与场地资源,由此形成从建设标准到上游配套产能的全链条落地。


4.2. 谷歌(Google):模型、物理场景、云平台与搜索协同推进AI能力落地
2025年以来,谷歌持续迭代Gemini模型,并同步推进具身智能、开发者工具、搜索办公入口及多模态生成,将AI能力从独立应用扩展到用户入口、企业工作流和物理场景。
1)大语言模型持续迭代,拓展搜索、开发工具和企业应用场景。2025年2月,谷歌宣布Gemini 2.0系列全面更新,发布了Gemini 2.0 Flash、Gemini 2.0 Pro实验版和Gemini 2.0 Flash-Lite三款模型,分别面向高频调用、复杂推理和成本敏感场景;3月发布Gemini 2.5 Pro,在LMArena排行榜中登顶,并在推理、代码生成和多模态理解三项能力上均有提升。2026年,谷歌沿Gemini 3系列升级模型:2月发布Gemini 3 Deep Think及Gemini 3.1 Pro,面向科研和工程领域的复杂推理问题;5月在I/O大会上推出Gemini 3.5 Flash,据谷歌公告及第三方测试,3.5 Flash在多项基准测试中超越前代旗舰3.1 Pro,输出速度(约289 tokens/秒)为GPT-5.5等前沿模型的约4倍,成本约为同类模型的一半;该模型已被设定为AI Mode、Gemini App及Antigravity平台的默认模型,侧重真实任务场景中的高效应用。

2)具身智能与物理场景能力增强,机器人模型正从动作执行向任务规划、场景理解和成功检测等更高层级能力延伸。2025年3月,公司发布Gemini Robotics VLA模型和Gemini Robotics-ER模型,前者可直接将语言指令转化为机器人动作,后者专注于空间推理与任务规划。6月推出Gemini Robotics On-Device,可在机器人本地运行,无需依赖云端连接,适用于网络不稳定或隐私敏感环境;这也是谷歌首个可供开发者微调的VLA模型,约50~100次演示即可让机器人适应新任务。9月发布Gemini Robotics 1.5系列,包含VLA 1.5和ER 1.5两个版本,其中VLA 1.5负责动作执行,ER 1.5负责高层的任务规划和推理,两者配合可实现“先思考后行动”的工作方式;该系列还具备跨机器人形态的学习能力,可将在一种机器人上学到的技能迁移至其他形态的机器人上。2026年4月,公司发布Gemini Robotics-ER 1.6,与上一版本相比,空间推理、多视角成功检测和仪表读数能力均有提升。

3)开发者工具、云端平台与办公产品升级,持续扩展Gemini在企业工作流中的覆盖范围。2025年以来,谷歌从底层算力、开发者平台、用户入口等角度出发,全方位推进AI能力集成,使Gemini逐步进入开发者和企业用户的日常流程。
- 算力方面,谷歌同步推出第八代TPU双芯架构。2026年4月,公司发布TPU 8t和TPU 8i。TPU 8t面向前沿模型训练,可将模型开发周期从数月缩短至数周;TPU 8i面向Agent工作流中的高并发推理场景,针对低延迟进行优化。这也是谷歌首次将训练与推理芯片分开设计。
- 开发者工具与云端智能体平台同步升级,AI从辅助编码向智能体驱动的端到端开发演进。2025年以来,谷歌先后推出多款面向不同开发阶段和部署层级的AI工具。2025年5月,公司发布Alpha Evolve,用于算法发现与代码优化,能够在数学研究、芯片设计和编译器优化领域自主生成并改进算法代码;8月,异步AI编程智能体Jules与GitHub深度集成,并支持异步代码修复和更新。2026年4月,公司推出Gemini Enterprise Agent Platform,作为Vertex AI(谷歌开发的全托管AI开发与运维平台)升级版,整合了Agent开发、部署、治理和优化等完整能力,新增Agent Studio等一站式开发环境;5月,公司升级Google Antigravity 2.0,从原来的agent驱动的IDE升级为一个独立桌面应用,重点转向Agent优先模式,用户可通过Agent对话、Agent产出物和多Agent协同完成开发任务。

- 用户与企业入口强化:搜索与Workspace分别对应谷歌的消费入口和企业场景,是其推进AI能力商业化的重要基础。搜索方面,2026年5月的I/O大会上,谷歌将Gemini 3.5 Flash作为AI Mode默认模型,使搜索框能够处理更复杂的问题,并对信息进行整理和归纳。Workspace方面,2026年3月,谷歌在Docs、Sheets、Slides等工具中增强大模型能力,使其从独立应用进入办公和企业知识管理流程。

4)多模态内容创作、开放模型与科研工具推进,拓宽大模型应用边界。谷歌在多个方向同步推进,提升Gemini体系在创作、科研和企业应用中的覆盖能力。
- 多模态生成工具完善,内容创作能力强化。2025年5月,公司集中发布Imagen 4、Veo 3、Lyria 2等多模态生成工具,并推出AI电影创作工具Flow,覆盖图像、视频、音乐和影视创作;11月,推出图像生成与编辑模型Nano Banana Pro(基于Gemini 3 Pro构建,支持4K分辨率输出及角色一致性保持),进一步提升图像编辑与细节表现能力。2026年,Gemini App继续接入Lyria 3、Nano Banana 2及Gemini Omni等能力,并与YouTube Shorts Remix等入口结合,提升其在内容创作场景中的可用性。其中,Nano Banana 2支持最多5个角色的相貌一致及14个物体的忠实呈现。
- 开源模型和科研工具同步推进,覆盖企业部署与专业研究场景。2026年4月,谷歌发布Gemma 4开源模型系列,包含E2B、E4B、26B MoE和31B Dense四个版本,其中31B Dense模型具备最长256K上下文窗口;所有版本原生支持视觉处理,E2B/E4B额外支持音频输入。该系列采用Apache 2.0协议,允许企业自由商用、修改和分发,降低了私有化和定制化部署的门槛。科研方面,2026年5月,谷歌推出Gemini for Science,可通过连接30多个生命科学数据库和工具,为科研任务提供支持,进一步提升Gemini在企业和垂直行业中的适用性。




4.3. 微软(Microsoft):AI底层能力与开发者工具持续完善,企业应用门槛逐步降低
2025年以来,微软在自研模型、超算设施、开发者工具和智能体生态等方面持续投入,全栈AI能力逐步完善,降低了企业应用AI的门槛。
1)模型、芯片与云基础设施协同发展,增强对AI底层能力的掌控。微软的AI布局从应用层向模型训练、推理芯片和超算集群延伸,目标是减少对OpenAI模型和英伟达算力的过度依赖;通过自研模型、自研芯片以及扩建超算集群,在模型供给和算力成本上获得更多自主权,提高大模型的训练、推理和企业部署效率。
- 自研模型、推理芯片双线推进,强化模型供给和成本控制。2025年8月,微软发布首个端到端自研大模型系列,包括通用模型MAI-1-Preview和语音模型MAI-Voice-1。其中,MAI-1-Preview在约1.5万张NVIDIA H100 GPU上完成训练;MAI-Voice-1仅需单块GPU即可生成高保真音频,适用于语音生成和低成本推理场景。2026年1月,公司发布第二代自研AI推理加速器Maia 200,面向大规模token生成和推理成本优化,用于降低大规模AI工作负载的运行成本。2026年3~6月,公司进一步发布MAI-Image-2、MAI-Image-2.5和Phi-4-Reasoning-Vision-15B,并推出MAI-Transcribe-1.5、MAI-Voice-2、MAI-Code-1等新模型,覆盖文本生成图像、图内文字生成和视觉推理等场景。

- 超算集群与云平台扩容,支撑企业级训练、推理和部署需求。2025年10月,微软与英伟达合作部署全球首个生产级NVIDIA GB300 NVL72超算集群,搭载超过4600个Blackwell Ultra GPU,用于万亿参数模型训练与推理。2026年1月,微软宣布收购Osmos,并将其Agentic AI Data Engineering能力纳入Microsoft Fabric,用于增强企业数据处理和智能体应用落地环节。2026年3月,公司进一步扩展Microsoft Foundry与Azure AI Infrastructure能力,支持客户在NVIDIA加速器和Nemotron开放模型上构建、部署和运营生产级AI智能体。根据微软规划,Azure将成为首批部署下一代NVIDIA Vera Rubin NVL72系统的超大规模云之一。

2)开发者工具链持续优化,提升开发效率与易用性。2025年以来,模型定制和代码开发方向分别推出或升级了关键能力,降低企业和开发者使用AI的门槛。2025年5月,微软在Build大会上推出Copilot Tuning,提供可视化低代码微调能力;企业用户可基于自身业务语料调整模型表现,提升模型与具体场景的匹配度。代码开发方面,同月GitHub Copilot上线了Agent Mode,可根据GitHub问题或开发者指令完成问题分析、代码编写、测试和拉取请求提交等流程,主要面向中等复杂度任务。

3)多模型平台与智能体治理框架逐步完善,企业部署基础进一步加强。随着企业AI应用数量增加,微软将布局从开发工具延伸至模型选择、本地推理、云端部署和安全管理,重点降低企业在部署、运维和权限管理上的复杂度。
- Foundry扩展为多模型开发和部署平台。2025年以来,微软持续完善Foundry品牌下的两端产品——Windows AI Foundry(面向本地端侧推理)和Azure AI Foundry(面向云端开发),提供模型选择、微调、集成和运行能力。2025年11月,微软在Ignite大会上扩展Microsoft Foundry模型供给,引入Anthropic Claude、Cohere等第三方模型,完善多供应商模型目录。2026年4月,OpenAI GPT-5.5在Microsoft Foundry中开放,企业可在Azure上调用前沿模型。同月,Foundry继续更新模型和开发工具,包括GPT-Image-2、微软第一方MAI模型等;5月,Foundry Local正式发布,支持开发者在Windows、macOS Apple Silicon和Linux x64上进行本地模型推理;集成Foundry能力的VS Code插件正式可用,开发者可在IDE内完成模型选择、测试、调试并接入Foundry工作流。
- 开发框架与安全治理完善,Agent Framework和Agent 365强化全生命周期管理。2026年4月,微软发布Microsoft Agent Framework 1.0,提供从本地开发到云端部署的开发框架,支持多智能体协作、运行状态监控和生命周期管理。5月,Microsoft Agent 365正式发布,用于统一管控Microsoft生态及第三方生态中的智能体。Agent 365还支持未注册智能体的发现与管理,可借助Defender识别本地与云端未受管智能体,并通过Intune策略进行阻断或将其纳入合规管控。

4)深入办公场景,企业入口进一步强化。2025年以来,微软将Copilot嵌入文档、表格、演示等高频办公场景,使其从内容生成工具延伸至信息整理、任务拆解和日常事务处理。
- Copilot进入核心办公应用,提升企业内部信息调用效率。2026年3月,微软发布Microsoft 365 Copilot Wave 3,将Copilot嵌入Word、Excel、PowerPoint等应用,并在OpenAI模型之外引入Anthropic Claude模型,推进多模型编排策略,兼顾不同任务类型的适配需求与供应商多元化考量。同时,Copilot通过Work IQ接入企业文件、会议、邮件等上下文,可基于企业内部资料完成文档起草、数据分析、会议总结和任务整理,帮助企业更高效地调用内部知识和处理日常工作。
- 跨应用执行层进入测试阶段,Copilot Cowork强化长尾任务处理。2026年3月,微软通过Frontier program开放Copilot Cowork测试,支持基于用户邮件、会议和消息进行任务规划,并支持在后台持续推进工作,在关键节点由用户审阅。此后,Cowork陆续新增移动端支持、可复用工作流指令(Skills)以及LSEG等第三方插件,扩展了跨工具与跨设备的执行能力。


4.4. OpenAI:模型分层、智能体与算力同步推进,提升消费和企业端落地能力
2025年以来,OpenAI在模型分层、垂直能力、智能体产品和算力基建四个方向上同步推进,巩固其在消费和企业市场的竞争力。
1)通用GPT系列模型按需求分层,覆盖高频调用和复杂任务场景。2025年以来,OpenAI打破单一旗舰模型依赖,根据不同使用需求匹配不同规格的模型,在性能、成本和响应速度上形成更明确的分工。
- 轻量模型持续迭代,承担高频调用和低成本需求。2025年4月,公司发布GPT-4.1系列,其中GPT-4.1 mini在成本、延迟和通用任务表现之间取得平衡,GPT-4.1 nano主打低成本和低时延。2025年8月,GPT-5 Mini和GPT-5 Nano作为轻量版本推出。2025年11月,GPT-5.1 Instant上线;12月,GPT-5.2 Instant跟进。2026年2月,GPT-5.3-Codex-Spark发布,每秒可生成1000个token。2026年3月,GPT-5.4 mini和GPT-5.4 nano推出,专为高频低延迟场景设计。2026年5月,GPT-5.5 Instant版本成为ChatGPT新默认模型,主要承担高频日常对话需求。
- 高阶模型强化复杂任务能力,向长上下文、工具调用和专业场景延伸。2025年4月,GPT-4.1支持100万token上下文,适用于长文本和多模态理解任务。2025年12月,GPT-5.2 Thinking面向编程、数学和长文档分析等复杂任务,GPT-5.2 Pro则服务更高难度专业场景。2026年3月,GPT-5.4及GPT-5.4Pro提供原生computer-use和tool search功能,覆盖金融建模、法律分析、代码开发等场景。2026年4月,GPT-5.5及GPT-5.5 Pro推出,其中GPT-5.5 Thinking在智能体编程、知识工作和科学研究等任务上性能提升,GPT-5.5 Pro面向更高复杂度问题。

2)专用模型与垂直能力的多元探索。在通用GPT系列之外,OpenAI针对复杂分析、内容生成、实时交互和专业领域推出了专用模型和功能模块。
- 推理模型面向复杂分析任务不断迭代。2025年4月,OpenAI推出o3模型,主要面向视觉分析、高阶编程和商业咨询等任务,在外部评估中较前代o1错误减少。2025年6月,公司发布o3 pro,在GPQA等科学推理测试中表现提升,科研分析和专业问答能力强化;同期推出o4-mini,作为覆盖数学和编码等高频推理任务的轻量化版本,在接入Python解释器的条件下,AIME 2025数学竞赛中得分99.5%,实现高性能与高性价比的平衡。
- 实时语音模型覆盖对话、翻译和转写场景。2026年5月,OpenAI推出新一代实时语音模型,其中,GPT-Realtime-2用于复杂语音对话,可处理打断并保持连续交流;GPT-Realtime-Translate支持70多种输入语言翻译为13种输出语言,面向客户支持、跨境销售等场景;GPT-Realtime-Whisper则能够在说话人讲话的同时进行实时转录,为会议记录、实时字幕等应用提供了低延迟、高响应的体验。

- 专业产品进入金融、办公和生命科学场景。2026年3月,OpenAI推出ChatGPT for Excel beta,将ChatGPT嵌入Excel工作簿,并接入FactSet、道琼斯Factiva等金融数据源;2026年5月,ChatGPT for Excel和Google Sheets面向用户正式开放,服务金融分析、企业研究和报表建模。医疗与生命科学方面,2026年4月,公司发布GPT-Rosalind,用于药物发现、基因组学分析和蛋白质推理,并推出ChatGPT for Clinicians,面向美国已验证临床专业人员开放。

- Sora系列视频生成模型曾进行商业化探索,但后续已关停。2025年9月,OpenAI推出Sora 2,提升复杂动作、物理过程和多镜头指令的生成效果。相比早期视频生成模型,Sora 2在体操动作、浮力和刚体运动等场景中表现更稳定,并能在多个镜头中保持画面状态一致,可控性增强。公司同步推出Sora App,支持用户将个人形象融入生成视频,降低了个性化内容的制作门槛。但Sora上线后用户黏性持续走低,根据经济日报Appfigures披露,Sora 2025年12月下载量环比下降32%,2026年1月继续暴跌45%,30天留存率仅1%。此外,OpenAI处于冲击IPO的关键窗口期,需要将资源向企业级业务集中,Sora作为高投入、低产出的消费级产品被纳入关停范围。2026年3月,OpenAI宣布Sora消费级应用及API于4月关停,API服务延续至2026年9月。
3)智能体产品加快落地,逐步融入工作流。2025年以来,OpenAI推动ChatGPT从问答工具向可处理具体任务的智能体产品转型,将AI植入用户工作流。
- 研究和浏览器入口率先落地,长周期信息任务处理能力提升。2025年2月,OpenAI推出Deep Research,可在5~30分钟内完成多源检索、信息综合并以研究报告形式输出。2025年10月,公司推出ChatGPT Atlas——一款内置ChatGPT的浏览器,提供浏览器记忆和智能体模式,支持基于网页上下文的信息查找、对比分析和多步骤操作。
- Codex能力不断拓展。Dev Day 2025期间,OpenAI推出Codex正式版、AppsSDK和AgentKit,为开发者构建智能体应用提供基础工具。2026年2月,公司推出Codex App for macOS,支持用户管理多个智能体、并行运行长周期开发任务、跟踪进度和审阅代码变更,并于3月扩展至Windows端。2026年4月,Codex新增PR审阅、多文件与多终端查看、SSH远程开发环境和内置浏览器辅助开发等功能;5月,Codex进入ChatGPT移动端预览版,用户可在手机端跟进、指导和审批代码任务。

- 企业智能体和部署方式同步发展。2026年4月,OpenAI推出ChatGPT Workspace Agents,支持团队创建共享智能体,用于报告准备、代码编写、供应商风险管理等任务。部署方面,2026年4月,公司与AWS扩展合作,使OpenAI模型、Codex和托管智能体可在AWS环境中使用;5月,公司与Dell Technologies合作,将Codex引入混合云和本地企业环境。

4)算力合作持续加深,夯实基础设施护城河。2025年以来,为满足模型迭代与智能体部署的海量算力需求,OpenAI通过“联合基建、供应商绑定、拓展战略云伙伴”的组合策略,加速全球算力网络布局。2025年9月,OpenAI与甲骨文、日本软银宣布在美国新建5个人工智能数据中心,Stargate项目未来三年投资规模超过4000亿美元,规划总算力接近7吉瓦。同月,OpenAI与NVIDIA达成战略合作,计划部署至少10吉瓦NVIDIA系统,用于支撑后续模型训练和推理需求。2025年10月,OpenAI与博通合作开发适配自身模型的定制AI加速器,对应规划10吉瓦级算力集群落地,将自身模型和产品需求向硬件设计环节延伸;同月,公司与AMD达成6吉瓦GPU合作,首批1吉瓦AMD Instinct MI450系列GPU计划于2026年下半年部署。


4.5. Anthropic:以可靠性和安全治理为核心,从前沿模型研发走向企业级专业工作流
2025年以来,Anthropic战略重心从前沿模型研发转向企业级专业工作流。公司一方面继续提升Claude在复杂任务中的可靠性,另一方面围绕安全治理和生态接入提升企业部署能力,使模型更易进入开发、办公及更多专业工作场景。
1)模型聚焦可靠性和成本控制,支撑企业级专业工作流。2025年以来,Anthropic围绕Sonnet、Haiku和Opus系列持续升级,重点提升模型在代码开发、长周期任务和复杂推理中的稳定性,同时降低高性能模型的使用成本。
- Sonnet和Haiku系列不断迭代,聚焦长周期开发与高频调用。2025年9月,Anthropic发布Claude Sonnet 4.5,在SWE-bench Verified测试中得分77.2%,并行测试时可达82%,高于同期GPT-5 Codex和Gemini 2.5 Pro。据Anthropic披露,该模型可连续工作超过30小时,完成复杂项目开发(一次性敲出约1.1万行代码)。2025年10月,公司发布Claude Haiku 4.5,在成本约为Sonnet 4三分之一、速度提升至两倍以上的情况下,保持接近Sonnet 4的编码表现,适合企业在高频、低成本场景中调用。2026年2月,Anthropic推出能力增强版本Claude Sonnet 4.6,其在OSWorld基准中得分72.5%,在SWE-bench Verified中得分约80%,同时,该版本开始提供100万token上下文窗口的测试版。

- Opus系列面向高难度任务,成本持续优化。2025年11月,Anthropic发布Claude Opus 4.5,在Anthropic内部工程能力测试中创造了新的历史纪录。同时,公司将Opus 4.5 API调用成本大幅下调,并引入“努力参数”,使开发者可在效果和成本之间进行调节。2026年上半年,公司发布Opus系列的后续迭代版本(Claude Opus 4.6、4.7、4.8),继续强化代码和长周期任务能力。最新版Claude Opus 4.8默认支持100万token上下文窗口,最高输出达12.8万token,事实性错误率较前代明显下降,“快速模式”速度提升至前代的2.5倍,并实现成本的进一步优化。

2)开发者工具与智能体平台完善,企业工作流门槛降低。2025年以来,Anthropic围绕应用构建、代码开发和企业内部系统接入升级开发者工具,降低AI开发与应用门槛,帮助企业将Claude放入更具体的工作流程中。
- 开发工具从对话生成向应用构建与代码执行升级。2025年6月,Anthropic升级Artifacts,支持用户通过对话直接构建、托管和共享交互式应用,降低了非技术用户构建轻量应用的门槛。2025年9月,公司发布Claude Agent SDK,将内部构建智能体的基础框架开放给开发者,解决了长期记忆管理、多智能体协调等核心难题;同期Claude Code升级至2.0,新增检查点功能,使复杂任务能够保存状态并回滚。2026年5月,Claude Code进一步引入动态工作流,支持在单次会话中协调多个子任务,可独立完成从规划到合并的代码库级大规模迁移任务,显著提升了Claude处理超大规模工程的能力。
- 智能体平台强化长期任务和企业内网接入能力。2026年1月,Anthropic扩展Anthropic Labs,并发布Claude Cowork研究预览版,尝试将Claude接入桌面工作流。4月,公司发布Claude Managed Agents,将长期任务执行中的循环调度、上下文管理等能力平台化。5月,Claude Managed Agents新增自托管沙箱(self-hosted sandboxes)和MCP隧道(MCP tunnels)功能,前者允许企业将工具执行环境放在自有基础设施或受控沙箱中以保留控制权;后者支持智能体连接企业私有网络内的MCP服务器,调用内部数据库与私有API。

3)安全治理和透明度建设深化,夯实企业信任基础。
Anthropic延续其在安全与对齐上的优势,将模型透明度和安全能力作为企业部署的重要前提,尤其面向政府、金融、医疗等高合规场景。2025年2月,Anthropic推出Transparency Hub,公开模型开发与部署机制,有效提升了外部监督和合规沟通效率。9月,Claude Sonnet 4.5以ASL-3安全级别发布,在提示注入防御和不良行为控制方面进一步加强。2026年,安全能力向软件防护场景延伸。4月,Anthropic推出Claude Mythos Preview模型及配套安全项目Project Glasswing(玻璃翼计划),仅在由12家机构组成的小范围合作体系中提供访问;6月,Anthropic宣布计划面向超15个国家新增150家合作企业落地玻璃翼计划,合作机构将借助Mythos工具排查软件安全漏洞。

4)行业应用和生态合作扩展,推动大模型进入专业工作场景。Anthropic加快将Claude接入医疗、金融、法律和中小企业场景,通过云平台和算力合作提升企业交付能力。
- 行业垂直产品密集推出,注重合规性与专业性。2026年1月,公司推出ClaudeforHealthcare,并扩展ClaudeforLifeSciences,面向医疗服务方、健康科技公司和生命科学企业提供符合HIPAA要求的产品与工具。2026年5月,公司推出金融服务智能体,支持连接FactSet、S&PCapitalIQ、MSCI等市场数据和研究平台,能够在访问控制下接入企业内部系统;同期推出ClaudeforLegalIndustry,提供超过20个法律行业MCP连接器和12个面向法律工作及执业领域的插件。同时,公司面向中小企业推出ClaudeforSmallBusiness,支持接入IntuitQuickBooks、PayPal等工具。

- 云平台、服务伙伴和算力资源补齐企业交付能力。平台方面,Claude系列模型接入Microsoft Foundry,并深化在Amazon Bedrock、Google Cloud Vertex AI等云平台的部署,为企业客户提供更多选择。服务方面,2026年2月,Anthropic与Infosys合作,主要面向电信、金融服务等受监管行业构建智能体,与公司自有的金融服务智能体产品相互补充;2026年5月,公司与Blackstone、Hellman & Friedman、Goldman Sachs等机构商讨成立企业AI服务公司(独立运营),并与PwC、KPMG扩大战略合作,推动产品进入税务、法律、交易等场景。算力方面,Anthropic深化与微软、英伟达等伙伴的合作,2026年5月与SpaceX达成算力租赁协议,租用Colossus 1数据中心的全部容量,新增超过300 MW算力以及超过22万张NVIDIA GPU,这批算力资源将用于支撑Claude模型在云端的推理服务部署,直接提升了Claude Pro和Max订阅用户的调用容量上限,并将Claude Code五小时速率限制提高一倍。



4.6. 华为(Huawei):以昇腾算力为核心,推进硬件、模型、应用全链路落地
2025年以来,华为AI业务围绕昇腾算力底座推进全栈布局。硬件方面,昇腾芯片保持年度迭代,Atlas 900 A3超节点进入规模商用。模型方面,盘古大模型全面开源,昇腾集群同步完成DeepSeek等主流模型适配,形成“自研+开源”双轨供给。端侧方面,依托鸿蒙系统将小艺升级为系统级智能体,支持跨端协同与复杂任务处理。此外,依托昇腾算力,华为在金融(中国银联)、制造(江淮质检)、政务(贵人智办)等领域实现私有化部署落地。
1)算力架构保持年度迭代节奏,新一代超节点产品进入商用周期。芯片层,根据华为2025年9月全联接大会披露的官方规划,公司昇腾芯片保持一年一代、算力稳步提升的迭代节奏,同时公布了昇腾950系列及后续代际产品的研发落地规划。2026年3月,公司推出搭载昇腾950PR的Atlas 350推理卡;根据华为昇腾计算业务总裁张迪煊介绍,在对应测试环境下,Atlas 350单卡算力性能达到英伟达H20的2.87倍,称其为国内唯一支持FP4精度的AI推理产品。集群层,公司于2025年推出的Atlas 900 A3 SuperPoD超节点已进入规模商用阶段,其依托灵衢互联技术,可实现384卡统一内存编址,整机最大算力达307P,产品设计主要适配长序列、多模态大模型的训练需求。

2)盘古大模型全面开源,同步推进自研底座搭建与外部生态适配。华为AI模型业务采用自研技术底座搭建+主流开源模型适配的双向发展模式。其昇思(MindSpore)AI框架持续开源更新,2025年发布了支持大规模科学计算的MindSpore Science版本,重点强化了科学计算、分布式训练相关功能。2026年3月,华为宣布全面开放自研盘古大模型,推出涵盖718B到1B的版本矩阵,以此降低大模型使用与二次开发门槛。在模型训练优化环节,华为配套提供从持续预训练(CPT)、监督微调(SFT)到强化学习(RL)的全流程工具,可支持企业注入行业专属知识,完成模型个性化微调。目前,昇腾算力集群已基本完成DeepSeek等主流开源大模型的适配工作。

3)构建“云、边、端”协同生态,端侧AI领域鸿蒙座舱与小艺智能体加速落地。华为AI战略的核心特征是打造云、边、端协同的全栈技术能力,其中以鸿蒙操作系统(HarmonyOS NEXT)为核心的端侧AI生态,是其消费终端市场布局、构筑下一代智能体验的重要环节。通过鸿蒙操作系统的全面升级,华为将AI能力深度融入系统底层,支持智能体在手机、平板、汽车、全屋智能等终端设备上原生运行与跨端协同。车载座舱场景中,车载小艺依托华为盘古大模型,可覆盖导航设置、基础车辆控制、信息查询与伴随式对话等座舱核心需求。终端应用层面,2026年4月,鸿蒙小艺体系迎来一轮集中升级,其中小艺Claw(手机/平板等端侧触点的AI交互入口)正式接入DeepSeek-V4能力,支持百万级上下文处理与更强Agent推理、内容创作表现。

4)行业赋能加速产业AI化,持续拓宽AI垂直场景落地边界。华为持续推进AI技术向实体行业渗透落地,2026年在金融、制造、政务多个核心领域实现商业化应用突破,垂直场景落地成效逐步显现。金融领域,中国银联基于华为昇腾算力,完成DeepSeek-V4大模型的私有化部署工作,相关AI能力已逐步应用于精准营销、数字员工办公、技术研发等多个业务场景。制造领域,华为与江淮汽车联合推出CV质检大模型迈思特,项目落地数据显示,模型缺陷检出率可达99.99%,新场景开发周期缩短95%以上。政务领域,华为携手贵州大数据集团落地生成式AI政务解决方案,推出省内首个通过备案的政务AI助手“贵人智办”,可支撑430余项政务事项的智能化申报办理,依托对话式交互模式简化办事流程,将传统平均30分钟左右的办理时长压缩至10分钟以内,有效提升政务服务办理效率。



4.7. 百度(Baidu):技术自研与生态赋能并进
2025年以来,百度AI战略从技术自研向生态赋能延伸。依托飞桨框架、文心大模型、昆仑芯算力及千帆平台,百度已形成覆盖芯片、框架、模型、应用到生态的较为完整的AI能力链条;竞争焦点正从模型性能比较,转向以开源开放降低AI应用门槛。
1)飞桨框架持续迭代训练与推理能力,适配国产算力生态。2025年,飞桨框架3.0及3.2版本先后发布。其中,3.0版本在训练环节引入了“动静统一自动并行”机制,在推理环节采取“训推一体”设计,降低了分布式训练的开发与调优成本;3.2版本则在推理效率和硬件适配方面做了进一步优化,初步构建了覆盖多款国产芯片的硬件生态。在此基础上,百度于2026年进一步推出飞桨框架3.3,进一步优化了显存占用,大模型训练显存碎片占比从10%以上降至3%,分布式训练性能较Megatron-LM提升80%,并加强了对昆仑芯、海光DCU等国产硬件的适配支持。根据百度CTO王海峰披露,截至2025年9月,飞桨已开源90多个代码仓库,生态开发者达2333万,服务企业76万家,成为国内活跃度最高的开源项目之一。

2)文心大模型形成基础大模型与深度推理模型两条并行路线。2025年以来,百度围绕性能提升、成本优化与训练方法升级,持续推进文心大模型体系的迭代。基础大模型方面,2025年4月,百度推出4.5 Turbo(文心4.5的升级版),11月发布了文心5.0预览版(采用2.4万亿参数原生全模态架构,训练伊始便融合多模态数据)。2026年1月,文心5.0正式版上线;5月,文心5.1正式发布,其采用多维弹性预训练技术,总参数压缩至5.0的约三分之一(从2.4万亿降至约8000亿),激活参数压缩至约二分之一(从约720亿降至约360亿)。LMArena搜索榜显示(截至2026年5月9日),文心5.1以1223分位列国内第一、全球第四。深度推理模型方面,2025年4月,百度推出X1 Turbo,一款基于4.5 Turbo的深度思考模型,围绕多模态、强化推理能力、低成本设计。

3)围绕自研算力底座与千帆开发平台两条线,推进企业级AI交付。算力侧,2025年百度点亮基于自研昆仑芯三代搭建的国内首个万卡集群,据公司披露,在文心5.0训练中的有效训练率达98%。2026年5月,百度将百舸AI计算平台升级至6.0版本,定位于智能体时代的计算基础设施。新版本新增了高效缓存复用、异构推理调度和强化学习加速等能力,同时推出轻量化部署方案“百舸AI Stack”。平台侧,2025年8月,千帆平台升级至4.0版本,以Agent为核心提供一站式开发能力。截至2025年12月,千帆平台已累计开发超130万个智能体,工具日均调用量达千万级,并推出模型上下文协议服务及多智能体协作模式。目前由百舸6.0提供底层算力调度,千帆平台基于其能力进行模型训练与推理应用,二者形成上下层联动。

4)Agent生态发展驱动AI规模化落地,平台开放与安全治理同步推进。百度坚持走开源路线,核心产品飞桨框架全栈开源,文心大模型的部分版本(如4.5系列)已对外开源或开放API调用,千帆平台也接入了DeepSeek、Kimi等第三方模型,进一步降低了AI应用门槛。在此基础上,百度将智能体生态作为规模化落地的核心抓手。2026年Create大会上,百度提出以日活智能体数作为衡量指标,并集中展示了通用智能体DuMate、代码智能体秒哒3.0、数字人智能体百度一镜及决策智能体伐谋2.0。为保障上述生态的安全运行,2026年5月,百度推出Agent安全中心,覆盖智能体思考、行动、反馈全链路。该产品已通过中国信通院OpenClaw类智能体安全评估,获评国内首批能力评估证书。据百度披露,Agent安全中心已覆盖Skill主流仓库的100%,月扫描次数超100万次,累计拦截风险超1万次,并已接入DuMate等自有智能体,同时可对Claude市场等第三方Skill来源进行安全扫描。


4.8. 字节跳动(ByteDance):模型、平台、终端三线协同推进
字节跳动AI战略围绕模型、平台、终端三层次递进。模型侧,Seed系列从技术对标转向工业级可用,强化深度推理与多模态,通过DLCM(动态大概念模型)等优化成本效率。平台侧,火山引擎以Token调用量为核心指标,采用低价策略与生态绑定推动企业渗透。终端侧,公司以语音助手为切入点,通过轻资产合作布局多终端。
1)模型能力从技术对标向工业级可用靠拢。2025年以来,字节跳动的模型发展主要侧重于工业化部署能力的构建。其通过Seed系列模型的迭代,重点发展深度推理与复杂多模态交互两种能力,主要解决企业级应用中对稳定性、成本与效率的要求。
- 深度推理:从Seed1.5到Seed 2.0,持续面向复杂生产力场景。2025年推出的Seed1.5 Thinking已具备处理金融精算、代码架构等任务的能力,在AIME 2024、Codeforces等评测中排名靠前。2026年2月推出的Seed 2.0系列(包含Pro、Lite、Mini及Code模型)将目标从竞赛解题延伸到研究级推理。据字节官方披露,Seed 2.0 Pro在MathVista、MathVision等数学推理基准上达到业界较优水平,在跨学科STEM测试(如FrontierSci)中部分场景得分不低于Gemini 3 Pro,同时在ICPC、IMO、CMO测试中均获得金牌成绩。
- 多模态进化:从视觉感知向可执行任务的方向扩展。多模态能力围绕文生视频、图像理解与生成持续增强,并与可执行任务的智能体能力结合,提升了在内容生产、营销自动化等场景的落地效果。2025年的Seed-1.5-VL已在视觉时序理解和多目标定位上建立优势,并在抖音内部实现GUI自动化测试。2026年,字节更新了多个多模态模型。Seedance 2.0视频生成模型采用音视频联合生成架构,支持图片、视频、音频和文本四种模态输入,可生成15秒多镜头音视频,据称在运动稳定性、音画同步、指令遵循等维度上不亚于Sora 2 Pro、Veo 3.1等竞品;Seedream 5.0 Lite图像模型引入实时检索增强(RAG),可回应时效性创作需求;Seed3D 2.0据称在几何精度和材质生成上均达到行业领先水平。
- 工程化落地:匹配企业客户的成本约束。字节将其在互联网业务中积累的高并发、高稳定性能力引入模型交付,重点优化超长上下文处理与API调用的鲁棒性,降低错误率。成本控制方面,字节通过模型压缩与MoE架构优化,在单位成本下实现更高的吞吐量,这一技术进展在一定程度上回应了企业客户对AI投入产出比的敏感点,为大规模商业化交付提供了财务层面的支撑。2026年1月,Seed团队联合多家学术机构发布了DLCM架构,将推理粒度从词元升级到语义概念层级;其在推理类任务中计算量(FLOPs)下降34%,平均准确率同步提升2.69%,实现了成本降低与效果提升的兼顾。


2)云服务平台火山引擎承接企业侧落地,Token调用量成为衡量商业化进展与生态粘性的核心指标。火山引擎的战略重心已转向规模化生产级应用。截至2026年3月,豆包大模型日均Token调用量突破120万亿,较2024年发布时增长1000倍。从客户结构来看,累计Token使用量超过一万亿的企业增至140家。大规模token消耗已较多出现在企业生产环境中,火山引擎通过激励用量增长和生态绑定,将调用量优势逐步转化为可续费收入。
- 商业化策略方面,火山引擎没有采用传统软件的高溢价模式,而是追求高频、高粘性的生产级调用。其通过组合模型、工具链与成本优化,降低企业从试点迁移到生产环境的门槛,促进大客户的长期使用。2025年12月,火山引擎推出AI节省计划,通过阶梯折扣帮助企业最高节省47%的成本。此外,平台于2024年底推出的“方舟协作奖励计划”已进入第二期,该计划提供安心体验(个人用户,每个模型50万token)与协作奖励(企业用户,每日200万Token)两种免费额度,旨在通过初期算力补贴降低企业试错成本,配合低价策略,加速客户侧的应用渗透与生态绑定。
- 生态构建方面,火山引擎侧重将模型能力与Agent开发栈打包输出。客户采购的不仅是原始算力,还包括可复用的开发组件与运行框架。2025年底披露的AgentKit提供身份、沙箱、网关、记忆、评测与安全护栏等模块,定位为Agent规模化运行的底座;同期发布的TRAE CN企业版在字节内部工程师覆盖率超九成,抖音生活服务等团队AI代码贡献率超四成。2026年5月,火山引擎发布Agent Plan——以Agent燃料值为统一计量单位的订阅档位,整合自研Seed系列及GLM、Kimi等第三方模型,采用AFP统一计量单位,共四档订阅套餐。同期,扣子3.0上线,支持多Agent协作模式,预置行业技能包,可接入主流开发框架。

3)以AI语音助手为切入点,探索对下一代交互入口的覆盖。字节跳动延续与硬件厂商合作的轻资产策略,不自行制造硬件,以此规避硬件研发与库存成本。2025年底,豆包语音助手率先在中兴努比亚M153等机型落地,但初期合作量级相对有限。此外,公司通过输出标准化的AI能力接口,将语音对话、内容检索、任务执行等能力渗透到更广泛的终端生态中(如车载、智能家居等)。2026年4月,字节推出原生全双工语音大模型Seeduplex,在豆包App全量上线。该模型采用全双工架构,支持边听边说;据官方披露,在复杂声学场景下的误回复率和误打断率比传统半双工方案降低一半,抢话比例下降40%。这一技术升级与配套的工程化封装(SDK/端侧运行时)同步推进,提升了语音交互的自然度和稳定性,为后续向智能手机、智能眼镜、车载系统及智能家居等终端输出提供了更成熟的基础技术参考。




4.9. 阿里巴巴(Alibaba):以开源模型和AI云为核心,推动AI能力向产业交付
2025年以来,阿里巴巴围绕通义千问、阿里云和智能体工具链持续推进AI布局,工作重点从模型能力建设转向开源生态、云端部署和企业级应用。通过大规模开源、算力基础设施和面向企业的智能体开发平台,阿里试图将技术能力转化为生态影响力和成本优势,推动AI从工具辅助走向实际生产环节。
1)模型体系:以开源建立基础生态,从技术能力延伸至产业应用。2025以来,阿里巴巴持续推进模型开源,旨在将通义打造为AI时代的基础软件生态;通过降低开发门槛,形成更广泛的产业影响力。其核心逻辑是把模型技术优势转化为开发生态优势,从而缩短从实验室到生产环境的落地周期。
- 语言模型持续迭代,开源生态快速扩张,扩大开发者覆盖范围。2025年,阿里发布Qwen3混合推理模型家族和Qwen3-Max旗舰模型,增强了复杂推理、代码生成和智能体任务执行能力,模型设计重点从对话交互转向任务执行。2026年5月,阿里发布新一代旗舰模型Qwen3.7-Max,在Code Arena编程评测中得分1541,在大模型厂商中排名全球第二,仅次于Claude系列。同时,阿里采取开源策略,将模型能力向开发者开放,以此积累开发者基础。根据美国AI追踪机构Interconnects AI数据,截至2026年3月,通义千问系列模型在部分主流开源平台的下载总量中占比超过50%,累计下载量接近10亿次,衍生模型超过20万个。

- 多模态能力持续迭代,支撑内容生成与编辑需求。语言模型之外,阿里持续迭代视频生成模型(如万相系列),以支持从内容生成到理解、再到画面编辑的完整流程。该系列模型主要面向影视制作、广告创意和内容创作等行业。2025年,万相2.5、2.6系列先后发布,覆盖文生视频、图生视频、文生图和图像编辑等功能,单次生成视频时长延长至15秒,新增角色扮演和分镜控制,初步形成面向内容创作的模型组合。2026年4月,万相2.7系列进一步优化可编辑性,提升生产适配能力。其中Wan2.7-Image支持虚拟形象捏脸、精准色彩控制和3K Token超长文本渲染,Wan2.7-Video支持文本、图像、视频、音频全模态输入,并可对画面结构、剧情走向、局部细节和时序变化进行编辑。

2)平台与工具链:以百炼和智算集群为核心,向企业提供AI应用开发和部署服务。2025年以来,阿里云的重点不再是单一的模型调用服务,而是转向支撑企业开发、部署和运营智能体应用。百炼平台、ModelStudio系列开发工具,加上底层的算力和存储网络,将模型能力封装为企业可直接使用的开发和部署服务,以此降低AI从试点进入生产环境的门槛。
- 智能体开发工具持续完善,企业需求逐步释放。2025年9月云栖大会上,阿里云发布ModelStudio-ADK高代码开发框架,并升级低代码Agent开发平台ModelStudio-ADP,分别面向有高代码、低代码开发需求的客户,帮助其开发具备自主决策、多轮反思和任务执行能力的智能体。2026年3月,阿里成立Alibaba Token Hub事业群,强化组织和产品协同;该事业群整合了通义实验室、MaaS业务线(百炼平台)、千问、悟空及AI创新事业部,覆盖基础模型研发、模型服务平台和个人及企业端AI应用。需求侧,根据阿里财报披露,截至2026年3月,百炼平台客户数量同比增长八倍,Token消耗规模较上一季度也环比提升。
- 软硬协同优化,提升训练与推理效率。2025年,阿里云通过磐久超节点服务器、HPN 8.0高性能网络、AI优化存储和PAI平台,提升大规模训练与推理效率。根据阿里云在2025年云栖大会公布的数据,通过推理层全链路优化,通义千问模型推理吞吐量提升71%,时延降低70.6%。
- 通过自研芯片和训推一体架构,降低大规模部署的成本和门槛。2026年5月阿里云峰会,平头哥发布真武M890训推一体AI芯片,性能为上一代真武810E的3倍;搭配自研ICN Switch 1.0后,128颗芯片可组成一台计算机(磐久AL128超节点)。该超节点服务器已上线阿里云百炼,可支持Qwen、DeepSeek、Kimi等主流模型。集群效率方面,训练侧智能计算灵骏已支持十万卡级集群,万卡线性扩展率超过96%;推理侧通过优化调度和算力分配,根据《阿里云AI十大技术进展》报告,GPU利用率从34%提升至48%。


4.10. 腾讯(Tencent):依托超级应用生态,推动B端、C端AI能力的协同落地
2025年以来,腾讯围绕混元大模型持续推进AI能力的产品化。一方面,通过腾讯云智能体平台、开发工具和行业解决方案,将内部业务中验证过的AI能力向企业客户开放;另一方面,依托微信、腾讯元宝、QQ、腾讯文档等高频应用,将AI能力嵌入搜索、问答、办公、内容创作和社交等场景,通过用户入口和产业场景逐步形成使用粘性与商业转化。
1)通过架构升级和场景化迭代,混元模型体系进一步向产品落地靠拢。腾讯已形成语言模型与多模态模型并行发展的基础。语言模型侧,混元推出Turbo S和T1两个分支:Turbo S面向即时交互,T1面向复杂推理,形成差异化的快慢分工。多模态侧,图像、3D生成和视频模型持续迭代,面向游戏、广告、内容创作和数字资产生产等场景落地。
- 语言模型:从“快慢双轨”到“快慢融合”MoE架构。2025年,腾讯通过Turbo S(低延迟、及时响应)和T1(侧重上下文和复杂推理)分别覆盖不同推理场景,形成差异化模型基础。2026年,腾讯对混元模型底层架构进行重构,并于4月发布开源模型Hy3 preview,将快慢思考能力整合到统一的混合专家架构中。该模型总参数295B、激活参数21B,最大支持256K上下文,在复杂推理、代码开发、智能体执行和搜索智能体任务上均有提升。同时,Hy3 preview接入腾讯元宝、ima知识库、腾讯文档、QQ、微信公众号等核心产品,以社区反馈继续打磨正式版。
- 多模态领域:从内容生成走向开源生态与生产管线。2025年,腾讯先后发布混元图像2.0/3.0,在视频生成方面推出HunyuanVideo(文生视频)、HunyuanVideo-I2V(图生视频)以及HunyuanVideo 1.5(轻量级视频生成模型);在3D领域,发布混元3D世界模型1.0(支持沉浸式漫游)与混元3D世界模型1.5(实时交互),初步形成覆盖图像生成、视频生成和3D场景生成的多模态能力。据腾讯混元团队披露,截至2026年1月,腾讯混元图像、视频衍生模型数量合计达3000个,视频模型社区下载量超过500万,混元3D系列模型社区下载量超过300万。2026年,腾讯持续拓展混元多模态能力:1)图像模型方面,1月混元3.0图生图模型在原生多模态生图能力基础上,进一步补齐图像编辑与再生成能力,提升其在广告创意、视觉设计和内容生产中的可用性;2)3D世界模型方面,4月发布并开源混元3D世界模型2.0,支持根据文字、图片、视频等输入生成、重建和模拟3D世界,并可导出Mesh、3DGS、点云等多格式3D资产,便于接入游戏地图、关卡原型和数字资产生产流程。


2)B端市场:SaaS+AI的协同效应与云业务突围。B端市场,腾讯云在IaaS纯算力售卖层面持续承压。据市场调研机构英富曼统计,2025年阿里云在中国AI云市场占据38.1%的份额,腾讯云仅为6.3%。面对这一差距,腾讯调整了策略重心,不再单纯售卖算力,而是在PaaS与SaaS层面构建差异化竞争力。

- 企业智能体平台持续升级,腾讯从Agent开发工具延伸至企业级AgentOps体系。2025年,腾讯云ADP 3.0已支持企业基于私有数据零代码构建客服、营销等智能体。2026年6月,腾讯将重点转向企业智能体的开发、连接、分发和治理,ADP升级至4.0版本,定位为企业级AgentOps平台;同时,推出Claw构建模式,据官方介绍,该模式旨在帮助企业在同一平台内完成Agent开发与运行管理。产品侧,WorkBuddy成为B端落地代表,2026年3月上线桌面智能体,6月发布企业版及办公智能体套件Agent Suite,并升级ClawPro,形成覆盖办公执行和企业管控的产品矩阵。内部验证方面,WorkBuddy已覆盖腾讯内部超过2000名非技术员工;CodeBuddy据腾讯2025年研发大数据报告显示,内部使用率超过90%,AI生成代码占比超过50%,研发提效超过20%。
- 办公SaaS加速AI化,腾讯会议从会议工具升级为集成AI能力的协作入口。2025年,腾讯会议、腾讯文档已通过AI托管、智能纪要和文档AI功能提升办公效率,并带动用户活跃和付费转化。2026年,腾讯进一步把AI能力嵌入会议全流程。2026年5月,腾讯会议上线AI同传功能,基于腾讯云语音技术实现中英文双向实时翻译,官方称端到端时延控制在三秒以内;同时,支持模拟发言人原始音色,与实时转写、会中字幕打通,形成跨国会议场景下的听、译、看、记一体化体验。6月,腾讯会议继续升级智能录制、元宝纪要、问元宝等功能,将会议内容沉淀为可回溯、可检索的纪要文本。据腾讯会议官方披露,这些纪要可供后续业务流程调用。据官方数据,从2025年9月上线至2026年5月,腾讯会议内元宝纪要月使用时长增长近5倍,反映出AI办公功能的使用频率在逐步提升。

3)C端市场:AI加速进入高频入口,腾讯从单点助手转向多产品场景渗透。依托微信、QQ、腾讯元宝、QQ浏览器、搜狗输入法等高频入口,腾讯将AI能力嵌入用户已有使用场景。2025年,微信搜一搜在调用混元大模型的基础上,于灰度测试中接入DeepSeek-R1;腾讯元宝日活跃用户进入国内AI原生应用前列,并接入微信、QQ等多个产品,为C端AI分发奠定基础。2026年,腾讯进一步加大C端推广投入。春节期间,腾讯在元宝App内发起现金红包活动;2月18日,腾讯宣布元宝日活跃用户突破5000万、月活跃用户达1.14亿,该数据为春节10亿红包活动期的披露峰值,后期用户量有所回落。除通用助手外,腾讯也在知识管理和信息入口中推进AI应用:2026年3月,腾讯披露ima月活跃用户突破1300万,知识库文件总量达4.2亿份;据腾讯2025年四季度财报,QQ浏览器AI功能累计服务用户超1.3亿,搜狗输入法AI用户数突破1亿、移动端月活达6.7亿。


5. 风险提示技术迭代不及预期:AI技术发展日新月异,其演进路径及商业化进度存在较大不确定性。若未来算法、算力、数据等核心要素的技术突破速度放缓,或技术路线发生颠覆性变革,而行业内主要参与者未能及时跟进,可能导致技术代差扩大,产品竞争力下降。客户需求不及预期:AI技术的落地与商业化高度依赖于下游应用场景的渗透率提升及客户付费意愿。若宏观经济下行压力加大,各行业数字化转型进程放缓,可能导致企业客户资本开支趋于谨慎,削减AI相关预算,致使市场需求增速放缓,无法有效消化行业快速增长的供给,影响产业链相关公司的收入实现。研发迭代不及预期:AI行业属于技术密集型产业,产品与技术迭代周期极快。高昂的研发投入、顶尖人才的争夺以及复杂的工程化挑战,均可能导致企业的研发进度落后于规划。若公司未能持续推出具有竞争力的创新产品,或无法将前沿技术有效转化为可商业化的解决方案,将面临产品落后、客户流失及市场份额被侵蚀的风险。行业竞争加剧风险:AI赛道前景广阔,科技巨头、创业公司及跨界参与者大量涌入,市场竞争日趋白热化,可能引发价格战、人才争夺战及资源争夺战,导致行业整体利润率收窄。同时,部分领域可能存在技术同质化倾向,若企业无法构建坚固的技术壁垒或生态护城河,利润空间或将收窄。
来源:国泰海通
www.smartcity.team
