Semantic Scholar是什么?
Semantic Scholar是艾伦人工智能研究所推出的免费学术搜索与论文发现平台。它使用自然语言处理、机器学习和学术图谱,帮助研究者检索论文、理解摘要、追踪引用、管理阅读列表,并持续接收个性化推荐。
它不是生成式深度研究报告工具,而是一套建立在真实论文元数据和引用关系上的学术基础设施。当前官方产品页显示覆盖2.14亿多篇来自各学科的论文、24.9亿条引用关系和7900万名作者。
跨学科论文搜索
用户可以按论文题名、关键词、作者和主题搜索,并使用期刊或会议、作者、出版类型和日期范围等筛选条件缩小结果。搜索结果会展示作者、年份、引用量、摘要、开放获取状态和可用PDF入口。
搜索覆盖广不代表每条记录都完整。论文可能缺少摘要、全文、引用类型或规范作者信息;正式综述仍需配合Web of Science、Scopus、PubMed和学科数据库。
TLDR单句AI摘要
TLDR是Semantic Scholar为论文自动生成的一句话摘要,用非常短的文字概括研究目标和主要结果,便于用户在搜索结果中快速判断论文是否相关。
当前TLDR主要覆盖计算机科学、生物学和医学中的近6000万篇论文,也可通过API获取。它由NLP模型生成,可能省略方法、样本和限制,因此不能替代摘要和全文。
高影响力引用
Highly Influential Citations使用机器学习分析引用上下文、被引次数和论文之间的关系,识别对当前研究具有重要影响的引用。面对数百条参考文献时,它能帮助用户优先阅读关键工作。
“高影响力”是模型分类,不等于论文质量、结论正确或必须引用。不同学科的引用习惯差异明显,研究者仍需自行评估。
引用类型与引用上下文
部分论文页面会把引用关系区分为背景、方法和结果等类型,并展示相关引用片段。用户可以更快理解一篇论文为什么引用另一篇论文,而不是只看数字。
自动分类可能误读作者语气和否定关系。正式判断支持、扩展或质疑关系时,应打开原论文阅读完整上下文。
论文详情页
论文页面集中展示题名、作者、出版场所、年份、摘要、TLDR、主题、参考文献、引用论文、图表与相关研究。用户可以继续按年份、PDF状态和引用影响筛选后续文献。
Semantic Scholar聚合多种学术来源,偶尔可能出现重复记录、错误年份或作者合并。DOI、期刊卷期和页码应与出版社页面核对。
Semantic Reader
Semantic Reader是一款增强型论文阅读器,目前可用于大部分arXiv论文。它理解论文结构并将正文与Semantic Scholar学术图谱结合,在阅读时提供目录、引用卡片、TLDR和上下文信息。
阅读器主要改善在线阅读体验,不保证所有PDF都可用。复杂排版、扫描件、补充材料和受版权限制的全文仍需原始来源。
Goal、Method与Result高亮
对于多数计算机科学领域的英文arXiv论文,Semantic Reader可以自动高亮研究目标、方法和结果,帮助用户快速略读。用户可调整高亮数量和透明度。
高亮是AI分类,不能替代研究设计与结果解读。论文的限制、基线设置和统计细节往往需要完整阅读。
上下文定义
阅读器可为带标记的术语和缩写提供基于当前论文上下文的定义,减少反复离开页面查词的时间。跨学科阅读时尤其方便。
自动定义可能与作者的特殊用法不同,关键术语应查看论文定义、引用文献或权威教材。
引用卡片
阅读正文时,用户可以直接查看被引用论文的基本信息和TLDR,判断是否需要打开。若引用论文已经保存到个人Library,系统还能结合个人研究活动突出关系。
高亮与笔记
Semantic Reader通过Hypothesis集成支持高亮和笔记。用户需要相应账户才能保存与管理批注,也可以按Hypothesis的分享机制协作。
批注内容受第三方服务的数据与公开范围控制。记录未发表研究想法前应检查隐私设置。
Library文献库
登录后可以把论文保存到在线Library,创建自定义文件夹并批量导出引用。公开文件夹可与合作者分享,对方能够复制到自己的文献库。
Library适合发现和轻量整理,但不完全替代Zotero、EndNote等参考文献管理器的PDF管理、引用插件和去重能力。
Research Feeds
在Library文件夹中开启Research Feed后,系统会根据已保存论文自动推荐新研究。官方建议先加入至少5篇相关论文,并对不相关建议进行反馈,以提高推荐质量。
推荐从次日开始持续更新,也可通过邮件接收。文件夹主题越集中,结果通常越相关;混入多个领域会降低推荐精度。
论文、作者与推荐提醒
用户可以为论文创建新引用提醒,关注作者的新论文和新引用,也可以接收Research Feed邮件。Research Dashboard集中显示这些研究更新。
作者同名和资料合并可能造成提醒噪声。关注前应核对机构、领域和作者主页。
作者主页与认领
Semantic Scholar为作者建立聚合主页,列出论文、引用和合作者。研究者可以认领自己的作者页,管理论文归属并接收作品被引用的通知。
个人评价不应只依据总引用量。学科、职业阶段、作者顺序和数据覆盖都会影响数字。
引用导出
论文页面和搜索结果支持BibTeX、MLA、APA和Chicago等引用格式,Library还能批量导出。它适合把已发现论文带入写作或文献管理流程。
自动格式可能缺少页码、卷期或特殊字符,投稿前必须与原论文和期刊格式核对。
开放获取与PDF
平台会显示合法开放获取状态和可用PDF链接,部分信息来自Unpaywall等来源。Semantic Scholar本身并不绕过出版社付费墙,也不保证每篇记录都有全文。
无法下载时可使用所属机构订阅、馆际互借、作者存档或合法开放版本。
免费政策
Semantic Scholar网站、论文搜索、Library、Feeds和主要阅读功能均免费,没有面向普通研究者的付费会员套餐。服务由非营利研究机构AI2运营。
免费不表示没有速率、访问和数据许可限制。大规模抓取应使用官方API与数据集,而不是自动化访问网页。
Academic Graph API
Academic Graph API提供论文、作者、引用、参考文献、期刊会议、SPECTER2向量和开放获取信息。开发者可按关键词搜索、按Corpus ID或DOI查询,并批量获取指定字段。
应只请求实际需要的字段,使用分页、缓存和退避,避免无效的大批量重复调用。
Recommendations API
Recommendations API可以根据一组正向论文和可选负向论文推荐相似研究,适合构建文献发现、阅读列表和主题跟踪产品。
推荐算法不是系统综述完整性证明。应用应展示推荐依据、允许用户反馈并保留专业数据库检索入口。
Datasets API
Datasets API提供Semantic Scholar学术图谱的批量发布、下载与增量差异,适合机构和开发团队在本地托管数据并执行自定义查询。
数据规模很大,下载前应评估存储、更新、许可和去重成本。批量数据的不同部分可能具有各自许可与全文限制。
API密钥与速率限制
多数端点可以不认证访问,但未认证用户共享公共流量,稳定性较低。申请免费API Key后,官方教程当前说明默认可获得每秒1次请求的个人速率,并可按项目需求联系申请更高上限。
出现429错误时应降低速度并指数退避。API Key不能放入公开前端或代码仓库。
S2ORC开放研究语料库
S2ORC是Semantic Scholar Open Research Corpus,为科学文本挖掘和NLP研究提供论文元数据、引用关系和部分可用全文。当前建议通过Datasets API获取持续更新版本。
S2ORC数据采用ODC-By 1.0等相应许可,使用和再分发需署名并遵守各数据部分条款。Open Research Corpus不意味着所有论文全文都可任意再发布。
PDF与LaTeX解析工具
AI2在GitHub公开了s2orc-doc2json,可用Grobid等组件把PDF、JATS和LaTeX转换为S2ORC JSON结构。它适合研究开发者搭建科学文档处理流程。
解析工具需要独立安装依赖,结果也可能在公式、表格和参考文献链接上出错,不能等同于托管搜索产品。
Semantic Reader开放研究平台
Semantic Reader相关研究开放了PaperMage、PaperCraft等库与原型,供开发者研究智能论文阅读界面。这些组件展现了部分技术方法,但并非完整Semantic Scholar网站源代码。
开源状态
Semantic Scholar整体搜索服务、在线学术图谱和生产基础设施不是完整开源应用;但AI2公开了S2ORC、文档解析器、Semantic Reader研究组件、模型与论文数据资源。
因此目录应标记为“平台非完整开源,部分数据、模型和工具开源”。使用具体仓库前需要分别查看许可证。
与Google Scholar的区别
Google Scholar覆盖面广且擅长发现网页中的学术版本;Semantic Scholar更强调结构化学术图谱、TLDR、影响力引用、个性化Feeds和开放API。两者结果与收录不同,重要检索最好交叉使用。
与ResearchRabbit、Litmaps的区别
Semantic Scholar是大型搜索与数据基础设施;ResearchRabbit和Litmaps更强调从种子论文进行可视化网络探索与项目化综述。后两者也经常利用Semantic Scholar API或数据作为底层来源。
适合系统综述吗?
Semantic Scholar适合补充论文发现、引文追踪和关键词检索,但不应作为系统综述唯一数据库。完整综述需要记录可复现检索式、多数据库覆盖、去重、筛选和质量评估。
适合哪些用户?
- 寻找论文、作者和引用关系的学生与研究者;
- 需要快速筛选大量搜索结果的用户;
- 希望持续收到个性化论文推荐的科研人员;
- 阅读arXiv论文并需要上下文引用卡片的人;
- 开发学术搜索、推荐和文献工具的团队;
- 使用开放学术图谱进行NLP研究的机构。
产品优势
- 覆盖2.14亿多篇跨学科论文;
- TLDR和高影响力引用提升筛选效率;
- Library、Feeds和Alerts形成持续发现流程;
- Semantic Reader改善在线论文阅读;
- 网站与主要API免费使用;
- 开放数据、解析工具和研究组件丰富。
限制与注意事项
论文元数据、作者消歧、引用类型和AI摘要都可能出错,全文覆盖也不完整。TLDR、影响力标签和推荐不能替代专业判断。
API默认速率有限,批量数据需要较大存储和合规管理。系统综述必须与其他数据库结合。
常见问题
Semantic Scholar免费吗?
免费。网站搜索、Library、Research Feeds、提醒和主要API都没有普通用户订阅费。
Semantic Scholar有多少论文?
当前官方产品页显示超过2.14亿篇论文、24.9亿条引用和7900万名作者。
TLDR可靠吗?
TLDR适合快速筛选,但由AI自动生成,可能遗漏限定条件,正式研究必须阅读摘要和全文。
Semantic Scholar提供API吗?
提供Academic Graph、Recommendations和Datasets三类API。免费API Key默认速率约每秒1次请求。
可以下载全部数据吗?
可以通过Datasets API获取学术图谱批量数据和增量更新,但需要遵守许可、署名和全文使用限制。
Semantic Scholar开源吗?
完整在线平台并非全部开源,但S2ORC、文档解析器和Semantic Reader研究组件等资源已公开。
桂公网安备45132202000164号