生物信息“数据孤岛”是如何打破的丨如何用好科学数据

今年1月，依托中国科学院北京基因组研究所（国家生物信息中心）（以下简称基因组所）的国家基因组科学数据中心（NGDC）一批成果集中亮相：10篇论文相继刊发于国际生物数据库期刊《核酸研究》。对于一本顶级期刊来说，这种情况并不多见。一个刚成立6年的数据中心何以取得这样的成绩？近日，《中国科学报》走进基因组所，了解NGDC成长背后的秘密。

NGDC可追溯至2016年2月基因组所成立的生命与健康大数据中心。

它的成立既是对接国家需求，也是研究所自身发展的需要。长期以来，全世界科学家产生的组学数据都要提交给三大数据库——美国国立生物技术信息中心（NCBI）、欧洲生物信息学研究所（EBI）、日本核酸数据库（DDBJ）。这3家于上世纪八九十年代成立的机构在2005年建立了国际核酸序列共享联盟（INSDC），形成领域内数据存储和共享使用的标准。

我国科学家需要在发表论文时通过互联网将数据提交到这些数据库，而做科研时则需要将数据从这些数据库下载下来，科研效率经常遭遇国际带宽瓶颈的约束。同时，我国科学基金项目和重点研发计划产生的大量基因组科学数据，分散在不同研究单位和实验室，成为无法共享和进一步挖掘利用的“数据孤岛”。

解决这些问题既是我国几代生命科学家的呼唤，也是年轻的基因组所内在发展的需求。为调整航向，基因组所进行了一系列学科布局与运行机制优化调整。在此基础上，2016年2月，该所生命与健康大数据中心应运而生，并构建了组学原始数据存储归档系统（GSA）。其目标是立足中国，服务全球。

2017年，鲍一明的加入让大数据中心团队有了学术带头人。围绕共同的愿景，他们凝心聚力，“撸起袖子加油干”。

在团队成员的努力下，GSA先后被爱思唯尔、威利、细胞、施普林格·自然等全球主要出版集团认可。2019年6月，我国生物学家终于迎来了企盼已久的时刻：NGDC作为首批20个国家科学数据中心之一获批成立。该中心由基因组所作为依托单位，联合中国科学院生物物理研究所和上海营养与健康研究所共同建设，旨在成为支撑我国生命科学发展、国际知名的基因组科学数据中心。

然而，新冠疫情突发而至。在研究所的部署下，该团队紧急开发新冠病毒信息库。2020年1月22日，距离春节前3天，2019新冠病毒信息库正式发布。该信息库整合了全球相关机构和数据库公开发布的冠状病毒基因组序列数据、元信息、学术文献等，并对不同冠状病毒株的基因组序列做了变异分析与展示。这为此后开展病毒分子溯源、追踪病毒株变异路径、制定疫情防控策略等提供了数据基础与决策支持。

6年来，NGDC不断夯实自身建设，已经建立了包含九大数据类型的63个数据库，形成“数据—信息—知识”一体化数据资源体系。鲍一明介绍，该资源体系可实现我国生物数据的安全汇交管理，同时开发了由数据可视化、序列比对、基因表达、表观遗传、基因组构成和新冠序列分析6个专题构成的生物信息在线分析平台（BIT），为我国生物数据的挖掘利用提供了重要支撑。

尽管还存在许多限制与挑战，作为一名“后起之秀”，NGDC已连续5年被《核酸研究》评价为与NCBI、EBI并列的全球主要生物数据中心。