数据“跑”起来 创新“活”起来——浙江加快推动人工智能就绪高质量科学数据集建设

发布日期:2026-07-02 16:25 浏览次数:

当一位科研人员完成了科技计划项目,产生的海量实验数据该流向何处?当一个科学大模型开启训练,高质量的领域语料从何而来?这些曾长期困扰科研界的“数据之问”,正在浙江得到系统性的回答。

2026年6月,浙江出台《浙江省科学数据汇交与共享管理办法(试行)》(以下简称《管理办法》)及《浙江省科创平台科学数据官制度建设指南(试行)》(以下简称《建设指南》)。两项新政的出台,标志着浙江率先构建起覆盖科学数据汇交与共享全生命周期的省级治理体系,并为这一体系配备了专门的“数据管家”——科学数据官。

“浙江正加快建设具有国际影响力的科学数据库和人工智能就绪高质量科学数据集,两项政策的出台,分别从省级顶层统筹、科创平台一线执行两端发力,形成上下贯通、协同联动的管理体系,将有力赋能‘人工智能+科学’创新体系建设。”浙江省科技厅重大处相关负责人表示。

直面痛点:以制度创新破解科学数据共享难题

人工智能正深刻地改变科研范式,成为科学发现与技术突破的重要驱动力。高质量科学数据集是支撑科学模型建设与应用的核心燃料,其建设与管理水平影响着人工智能赋能科学的发展进程。

然而,在创新实践中,海量科研数据分散在高校、实验室、企业内部,权属界定模糊,科学数据“不愿共享、不敢共享、不会共享”的困境普遍存在。数据权属不清、共享机制缺失、安全边界模糊,导致大量宝贵的数据资源被“束之高阁”,严重制约了数据要素价值的释放。

“此次出台的《管理办法》构建了从职责分工到汇交管理、共享使用、保密安全、激励监督的全链条闭环管理体系,同时通过制度创新,提出允许数据实体不出域,汇交数据描述信息和访问接口信息,有效推动科学数据‘供得出、流得动、用得好’。”浙江省科技厅重大处相关负责人介绍道。

“数据实体不出域”,也即原始数据文件不离开它原来所在的存储环境。对于科研机构和数据持有方而言,原始数据往往涉及知识产权、核心技术或保密要求。传统的数据共享意味着“把家底交出去”,这让很多单位望而却步。“数据实体不出域”相当于给出了“定心丸”:原始数据始终留在自己手里,所有权和控制权不发生转移,让数据以Token的方式为模型训练或调用。“数据不动,信息动;数据不走,接口走”,通过这一方法,既保护了数据所有方的权益和安全,又实现了数据的开放共享。

除了明确科学数据汇交不改变其原有权属,鼓励进行数据知识产权、数据产权登记外,《管理办法》还将高质量科学数据作为研究成果纳入科研评价体系,积极推动在科学技术奖励中体现科学数据贡献,让科研人员从“被动交”变为“主动汇”。一系列举措,兼顾刚性管理与灵活探索,平衡数据开放流通与安全合规,旨在有效破解科学数据共享难题。

角色破题:科学数据官让数据管理责任到人

2026年3月,海纳数据枢纽创新中心(杭州)项目建设启动,这是之江实验室打造的集算力、数据、模型为一体的人工智能开放创新基础设施,旨在为创新主体提供一站式的语料生产、模型训练和开发服务。据了解,浙江将依托之江实验室海纳数据枢纽,启动科学数据汇交与服务平台建设,打造科学数据资源化与科学智能的统一底座。

平台的有序运行,离不开完善的制度体系作为支撑。如果说《管理办法》解决了“数据怎么管”的规则问题,那么《建设指南》则回答了“谁来管”的组织保障问题。

“科创平台是科学数据主要生产者和使用者,针对目前科学数据管理‘无岗无人、职责不清’的问题,我们以制度创新为突破口,率先在省内科创平台建立科学数据官制度,明确科学数据官作为统筹管理科学数据资源、推动数据集建设、促进开放共享、保障数据安全的专门负责人,并以省内科创平台的探索实践推动科学数据官制度向高校、企业等创新主体延伸。”浙江省科技厅重大处相关负责人介绍道。

为了更好发挥科学数据官的统筹协调作用,《建设指南》明确要求,科学数据官应设置在科创平台决策层,由平台负责人或分管科研、数据工作的负责人担任;数据产出规模较大的平台可建立“科学数据官+科学数据联络员”双层架构。

值得关注的是,《建设指南》对科学数据官的能力提出了鲜明的“人工智能素养”要求——熟悉高质量科学数据集的构建标准和质量评价体系,了解人工智能辅助数据治理工具等。这一定位,让科学数据官不仅是传统意义上的“数据管理员”,更是统筹数据资源、激活数据价值、驱动AI创新的“专业领航员”。

据了解,浙江正在省内科创平台开展科学数据官试点工作,并启动遴选第一批科学数据官,目前已收到一批科创平台的积极申报,将有力推动科学数据管理真正责任到人、落实到岗。

落地有声:为“人工智能+科学”筑牢数据底座

浙江此次制度创新,将科学数据治理深度嵌入了“人工智能+科学”的战略棋盘。

壹生检康(杭州)生命科技有限公司是首批入驻海纳数据枢纽创新中心的公司,其研发“豆蔻妇科大模型”的经历便是例证——团队使用之江实验室研发的数据生产管线,完成了百万级高质量医学数据的Token化,并在技术人员帮助下将“豆蔻妇科大模型”迁移至国产GPU卡上训练和部署,上线服务千余家医疗机构。目前,该模型已成功通过主任医师级认证,将有力赋能AI在妇产科临床决策辅助等场景的应用。

如果说高质量科学数据是AI大模型训练的“燃料”,那么其可得性与质量直接决定模型的性能边界。壹生检康的案例,生动诠释了高质量科学数据与专业训练平台相结合所释放的巨大能量。“我们的实践证明,中小型团队完全能够在专业训练平台支持下,通过科学的训练方法、高质量的领域数据与聚焦式技术攻坚,快速打造出达到顶尖专业水平的专属大模型。”企业相关负责人表示。

据了解,浙江已布局“人工智能+”数据集领域2026年度省“尖兵”“领雁”项目40项,取得首个人工智能中药大模型等重大科技成果。谋划实施人工智能科学数据集重大科技专项,突破多领域多模态数据token化等关键技术,在眼科医学、现代纺织、磁性材料等十余个领域建设“人工智能就绪”数据集。

下一步,省科技厅将推进科学数据汇交与共享平台开发,深化海纳科学数据创新中心(杭州)建设。同时,在重点领域打造“人工智能+科学”标杆应用场景,赋能千家以上科技型企业,加速构建全球“人工智能+科学”开发者开源社区。

当科学数据不再是束之高阁的“遗产”,而成为流动增值的“活水”,当每一份科学数据背后都有明确的责任人与安全阀,一个更加开放、协同、安全的科学数据生态正在之江大地加速成形。这既是浙江打造人工智能创新发展高地的关键落子,也是为全国科学数据治理探索的一份“浙江方案”。从“数据大省”迈向“数据强省”,浙江正以制度创新之手,按下科学数据价值释放的“快进键”。

(来源:创新浙江)