首页>>深窗综合>>热门资讯>>滚动热点>>正文

谁的数据,先成为AI的“原住民”?——从2026科学智能大会,看科技数据的下一个十年

作者:白鹏飞

一个判断,值得所有做产业的人想三秒。

8月21日,2026科学智能大会在北京举行,近50位院士和来自政府、高校、科研院所、企业等机构的4000余人参加。之江实验室主任王坚在科学数据平行会议上提出:人工智能的发展经历了数据、模型、算力等要素接续推动的过程,下一阶段将进入新的“数据周期”——未来3至5年,甚至10年,推动AI变革的关键是科学数据。

更重要的是,今天讲“AI+科学”,不能只理解为“用AI帮助科研”。科学问题的挑战、科学数据的独特性,也可能反过来推动AI自身发生质变。

就在这场会议上,“让科学数据成为基础模型的原住民”成为圆桌主题。

“原住民”其实是一个更大的议题:如果科学数据要“住进”AI,那么金融、制造、医疗、能源……这些行业最核心的专业数据,什么时候也能真正“住进”AI?

这可能是未来十年,比“谁的模型更大”更值得关注的竞争。

一、为什么AI还读不懂真正重要的原始数据?

今天的大语言模型擅长处理文本、代码等已经被人类整理过的信息。但科学世界并不是一个“文本世界”。

一条光谱、一组地震波、一段基因序列,真正有价值的信息,往往不在文字说明里,而在原始数据的结构、变化和关系中。

在地学领域,超过70%的地球科学信息并不存在于文字论文中,而是沉淀在光谱、地震波、声波等原始观测数据里。

这意味着,“先把数据变成文字,再让AI理解”的路径,可能从一开始就丢失了最有价值的信息。

大会讨论的科学数据Token化,本质上就是在解决这个问题:不是把数据“翻译”成人类语言再给AI,而是让AI学会理解数据自己的语言。

二、重大科学发现,总发生在“数据重新相遇”的地方

这次会议上,有一个关键词印象深刻:相遇。

之江实验室专家分享了一个很有张力的案例:米兰科维奇旋回的证实,是天文数据与地学数据在时间轴上的“相遇”——早期的天体力学计算,后来被海底沉积岩中的周期性数据进一步验证。

过去,这种相遇依赖科学家的知识边界、跨学科交流和偶然机遇。

今天,AI提供了一种新的可能:把过去依赖人脑完成的数据连接,变成可以规模化、持续化的机器能力。

之江实验室的021科学基础模型,正通过统一编码、统一表征和关联推理,探索把跨学科连接沉淀为模型能力。

真正值得期待的,也许不是“AI能回答更多问题”,而是:AI开始有机会发现过去没人注意到的数据关系。

三、Token化:让不同数据拥有“机器可理解的表达”

天文图像、气象数据、数学公式,本来就不是同一种东西,怎样让它们进入同一个模型体系?

这正是Token化的难点。

上海科学智能研究院分享的“伏羲”气象模型,探索让多类科学数据原生接入模型,通过跨模态联合建模进行语义对齐;新加坡国立大学张磊则提出,数学今天已经“数字化”,却还没有真正“数据化”,需要让数学内容像代码一样可编译、可验证。

之江实验室史大治进一步指出,下一代基础模型的重要增量,不只是更多文本,而是大量尚未被模型处理和充分理解的原始科学数据;围绕这一目标,之江实验室正在建设海纳数据枢纽,探索多类科学数据Token化的方法。

Token化真正要解决的,是让原本彼此不同、彼此隔离的专业数据,获得机器可以理解、比较、关联和推理的表达方式。

四、每个行业,都有自己的“原始数据巴别塔”

把视野从科学领域拉出来,会发现一个更有意思的现象:每个行业,都有自己的“原始数据巴别塔”。

金融有高频行情,制造有设备传感流,医疗有医学影像和组学,能源有运行曲线和地质数据。

知识产权领域,则有专利全文、权利要求、附图、引用网络、法律状态与长期技术演化记录。

专利不是一篇普通的技术文章。

一份专利同时承载技术问题、技术方案、权利要求、附图和结构式等多模态信息,也包含申请、公开、授权、无效等法律状态,以及引用关系和长期的技术演化信息。

从数据形态看,专利更像一种多模态、关系化、带时间演化属性的技术知识数据。

全球90%以上的技术情报首先通过专利公开。如果把这个判断放到AI时代重新看,专利就不只是“数据库里的资料”,而是一层持续记录技术创新、演化与积累的结构化数据。

那么问题也随之发生变化:AI什么时候才能真正“读懂”专利?

五、为什么知识产权数据,值得成为“原住民”样本?

这也是在现场听到“让科学数据成为基础模型的原住民”后,特别想到八月瓜科技的原因。

过去,知识产权数据更像一种信息资源;今天,它正逐渐变成一种技术基础设施。

八月瓜科技长期深耕知识产权数据与AI服务,已形成覆盖全球178个专利受理局、超过2亿条专利数据的数据底座,并持续向智能化数据服务延伸。

但真正值得关注的,不只是数据规模。

专业数据要成为AI的“原住民”,真正的门槛是把复杂的数据变成机器能够理解、关联和调用的知识。

对专利而言,从清洗、去重、分类和语义标引,到图文关联、关系组织和技术知识表达,这件事的本质,不是简单地“做一个更大的数据库”,而是让原本供人阅读、搜索和分析的数据,逐步变成AI可以理解、调用和推理的技术知识基础设施。

从“检索专利”,到“理解技术”,再到“辅助创新决策”,知识产权数据正在经历一次角色变化。

六、竞争正在从“模型”,转向“专业数据原住民”

这次大会释放出的信号,正在从科研议题走向产业基础设施议题。

大会围绕科学数据底座、数据采集、清洗、标注、质量评价和科研流程智能化展开讨论;北京市相关科学智能政策,也把标准化科学数据底座作为重要方向。

这意味着,“数据底座”已经不只是科研机构内部的数据建设问题,而正在成为科学智能乃至AI产业竞争的基础设施问题。未来AI真正难复制的,也许不是某个模型,而是四件事能否同时成立:高质量数据;机器可理解的数据表达;真实业务场景;持续产生新数据的闭环。

一旦这些能力形成闭环,模型就不再只是“问答工具”,而开始成为一个行业的基础设施。

在科技创新领域,也可能需要经历同样的一次跃迁:让论文成为数据,让专利成为数据,让技术关系成为数据,让产业知识成为AI真正可以调用的知识。

谁能更早让自己的核心数据被AI真正理解,谁就可能更早获得下一轮创新的入口。而知识产权数据,也许正是这场“专业数据原住民化”中,一个值得长期观察的样本。

数据的相遇,往往就是下一个发现的开始。

郑重声明:本文仅代表作者个人观点,与深圳之窗无关。其原创性及文中陈述内容未经本站证实,深圳之窗对本文及其中全部或者部分内容的真实性、完整性、及时性不作任何保证和承诺,请网友自行核实相关内容。

深圳之窗 微信公众号一大波便民功能上线啦!扫面下方二维码,关注后在微信对话框中回复 摇号 即可实时获取申请最新结果;回复“ 电费 即可在线查询用电信息以及缴费!

qrcode_for_gh_04f6adc5f733_430

相关推荐

谁的数据,先成为AI的“原住民”?——从2026科学智能大会,看科技数据的下一个十年

2026-08-25

告别烧钱与高门槛!海艺剧场 AI 短剧平台开启“全民”时代,让个人轻松做导演

2026-08-25

考研在宿舍学不进去?从书桌布置到专注力管理,手把手教你搭建高效学习区

2026-08-25

廿二载再启“蓝色通道”:华琛软件联合中国税务发布老客户双福利,新增科技金融与科技地产深度服务

2026-08-24

快讯|深圳市物流与供应链管理协会走进地上铁:共探新能源物流绿智融合新路径

2026-08-24

爱肯拿迎来了不起的40年:以专研配方守护四代犬猫健康,赢得长久信赖

2026-08-23