

由于科学出版物的增加,跟上最新研究变得越来越困难。例如,仅在2022年就记录了超过800万篇科学文章。研究人员使用各种技术,从搜索界面到推荐系统,来研究连接的知识实体,如作者和机构。将基础学术数据建模为RDF知识图(KG)是一种高效的方法。这样可以更容易地进行标准化、可视化和与链接数据资源的关联。因此,学术KG对于将以文档为中心的学术材料转化为链接和可自动化的知识结构至关重要。
然而,现有学术KG存在以下一种或多种限制:
- 它们很少包括每个学科的全面作品列表。
- 它们经常只涵盖特定领域,如计算机科学。
- 它们更新频率较低,使得许多研究和商业模型过时。
- 它们常常有使用限制。
- 即使它们符合这些标准,它们也不符合RDF等W3C标准。
这些问题阻碍了科学KG的广泛部署,如全面的搜索和推荐系统,或用于量化科学影响力。例如,Microsoft学术知识图(MAKG)及其RDF后代无法更新,因为Microsoft学术图在2021年被终止。
创新的OpenAlex数据集旨在弥补这一差距。然而,OpenAlex的数据不符合链接数据原则,也无法以RDF形式访问。因此,OpenAlex不能被视为KG,这使得语义查询、应用集成和连接到新资源变得困难。乍一看,它似乎是将科学文章的学术信息纳入Wikidata的一种简单方法,从而支持WikiCite运动。除了特定的模式外,数据量已经如此庞大,以至于Wikidata查询服务的Blazegraph三元组存储接近其容量限制,无法集成任何内容。
本文介绍了Karlsruhe Institute of Technology和Metaphacts GmbH的研究人员引入的非常大规模的学术领域RDF数据集SemOpenAlex,其中包括论文、作者、来源、机构、思想和出版商。SemOpenAlex拥有约2.49亿篇来自各个学术领域的论文和超过260亿个语义三元组。它建立在他们的综合本体论上,并引用了其他LOD源,包括Wikidata、Wikipedia和MAKG。他们提供了一个公共的SPARQL接口,以便快速有效地使用SemOpenAlex与LOD云进行集成。此外,他们提供了一个复杂的语义搜索界面,使用户能够实时检索数据库中包含的实体及其语义关系的信息(例如,通过显示共同作者或作者最重要的概念,这些概念是通过语义推理而不是直接包含在数据库中推断出来的)。
他们还提供了完整的RDF数据快照,以便进行大规模数据分析。他们利用AWS创建了一个流水线,可以定期更新SemOpenAlex而完全没有任何服务中断,这是由于SemOpenAlex的规模和集成到SemOpenAlex中的科学文章数量的增加。此外,他们还使用先前存在的本体论尽可能地保证系统的互操作性,符合FAIR原则,并为将SemOpenAlex与Linked Open Data Cloud集成打开了大门。通过提供每月更新,使得可以持续监测作者的科学影响力、跟踪获奖研究以及其他使用其数据的用例,他们填补了MAKG终止后的空白。他们通过免费和无限制地提供SemOpenAlex,使来自许多学科背景的研究团队能够访问其提供的数据并将其纳入研究中。目前已经存在SemOpenAlex的初始应用案例和生产系统。
总体而言,他们做出了以下贡献:
1. 他们使用流行的词汇为SemOpenAlex开发本体论。
2. 在https://semopenalex.org上,他们以RDF形式生成SemOpenAlex知识图,包含260亿个三元组,并向公众提供了所有SemOpenAlex的数据、代码和服务。
3. 通过使所有URI可解析,他们使SemOpenAlex能够参与到Linked Open Data云中。他们使用SPARQL端点在三元组存储中索引所有数据,并使其对一般公众可访问。
4. 他们提供了一个语义搜索界面,带有实体消歧功能,使用户可以访问、搜索并即时查看知识图谱及其重要的统计数据。
5. 通过高性能计算,他们提供了针对SemOpenAlex中表示的实体的尖端知识图谱嵌入。