Science Skills 文献搜索四合一:PubMed、OpenAlex、arXiv 与 bioRxiv 智能体文献检索实战技巧

发布时间:2026/9/29 14:59:40
Science Skills 文献搜索四合一:PubMed、OpenAlex、arXiv 与 bioRxiv 智能体文献检索实战技巧
Science Skills 文献搜索四合一PubMed、OpenAlex、arXiv 与 bioRxiv 智能体文献检索实战技巧【免费下载链接】science-skillsGDM Science Skills to speed up agentic scientific workflows with better grounding and higher token efficiency. Integrate insights from AlphaGenome, AFDB, UniProt and 30 other databases and tools.项目地址: https://gitcode.com/gh_mirrors/sc/science-skills想让 AI 智能体替你查文献Science Skills 正是为此而生——这个科学工作流技能包把PubMed 文献搜索、OpenAlex 学术数据库检索、arXiv 预印本查询、bioRxiv/medRxiv 预印本浏览四大文献能力装进同一个 AI 智能体覆盖从发现论文到下载全文、追踪引用的完整链路让文献调研又快又省 Token 先认识 Science Skills为什么文献检索要技能化概念说明Skill技能一个包含SKILL.md指令文件 辅助脚本 参考文档的目录教会 AI 智能体完成一项专门任务文献四件套本仓库中与文献搜索直接相关的 4 个技能PubMed、OpenAlex、arXiv、bioRxiv配套技能EuropePMC开源全文与 PDF 下载、credentialsAPI 密钥安全管理、uvPython 依赖管理每个技能都是即插即用的AI 读取 SKILL.md 中的结构化指令后自动调用对应的 CLI 脚本完成检索、限速、结果落盘你只需要用自然语言下需求。上图是 Science Skills 科学技能生成的基因剪接效应分析图COL6A2ALT/REF 对照轨道——文献检索与这类数据技能配合构成完整的科研工作流。 一键上手安装 Science Skills 与准备 API 密钥安装在终端执行一条命令即可安装整个技能包npx skills add google-deepmind/science-skills/或使用 Google Antigravity在插件设置中下载Science插件。首次触发技能时智能体经你同意后自动安装 uv 包管理器建议之后重启一次。API 密钥均可选但有它更快更稳技能密钥作用PubMedNCBI_API_KEY免费注册请求限速从 3 次/秒提升到 10 次/秒OpenAlexOPENALEX_API_KEY免费注册解锁更高配额支持 PDF 下载arXiv / bioRxiv无需密钥脚本内置限速密钥统一写入~/.env文件智能体会按照 credentials 技能的安全协议引导你完成无需手动管理。️ 四大文献技能怎么选一张表看懂技能数据源擅长亮点能力CLI 入口PubMedNCBI E-utilities / PMC BioC已发表医学/生物文献摘要、全文、跨库链接、拼写校验、引文匹配pubmed_api.pyOpenAlexOpenAlex 学术图谱论文/作者/机构/主题多维检索DOI 解析、被引数排序、机构影响力聚合、下载 PDFopenalex_cli.pyarXivarXiv 预印本计算机、物理、数学等 CS 方向字段级查询语法、PDF/HTML 全文下载search_arxiv.pybioRxivbioRxiv medRxiv生命科学、医学预印本按 DOI 秒查、按日期分类浏览、本地关键词过滤search_by_dates.py新手速记口诀查已发表找 PubMed查谁写的、被引多少找 OpenAlex查计算机/物理预印本找 arXiv查生物医学新预印本找 bioRxiv。 PubMed医学与生物文献的主力检索器PubMed 技能skills/pubmed_database/SKILL.md提供 10 个函数覆盖搜索、抓取、跨库链接、全文、拼写校验、引文匹配与缓存全部通过一个 CLI 完成。3 个新手最好用的场景搜文献 取摘要先search_pubmed拿一批 PMID再用fetch_article_abstracts一次性批量取摘要——技能内置的批量工作流references/bulk-workflows.md会在超过 10 篇时自动走 History Server 通道避免逐条请求。医学拼写校验verify_medical_spelling在搜索前帮你校正生物医学术语减少搜不到的尴尬。引文解析match_raw_citations把不完整的书目信息比如某年某刊某篇文章解析成精确 PMID参考文献列表整理神器 进阶查询语法字段限定、布尔组合见 references/advanced-search.md跨数据库关联论文 ↔ 基因/蛋白/化合物见 references/cross-database-linking.md。GATA4 基因在心脏组织的表达/剪接位点轨道±1.5kb 细节视图——此类基因-文献关联正是 PubMed 跨库链接能力的典型应用。 OpenAlex把学术影响力纳入检索OpenAlex 技能skills/literature_search_openalex/SKILL.md把论文、作者、机构、主题、出版社、资助方都变成可检索实体核心命令只有 5 个resolve名称转 ID、get取单条、filter条件筛选、download-pdf、rate-limit。新手记住一条黄金规则先 resolve再 filter——永远不要拿名字直接过滤先解析成 ID再按 ID 精确筛选结果才可靠。典型玩法在对话里直接说即可智能体会生成对应命令找 Geoffrey Hinton 引用最高的 10 篇论文 →resolve authorsfilter works --sort cited_by_count:desc查这个 DOI 的完整元数据 →get works https://doi.org/...一次请求拿到标题、年份、被引数、OA 状态MIT 每年的发文量 →--group-by publication_year一条命令完成聚合各实体可用的筛选/排序字段有完整文档works.md、authors.md、institutions.md、taxonomy.md。 小贴士OpenAlex 按操作计费get免费、filter约 $0.0001/次概览查询记得让智能体加--select与--per-page 5–10省配额又省 Token。 arXiv预印本领域的深度检索arXiv 技能skills/literature_search_arxiv/SKILL.md提供搜索 → 下载 PDF/HTML → 下载 LaTeX 源码三级能力。它的杀手锏是字段级查询语法详见 references/query_syntax.md前缀含义示例ti:标题ti:relativityau:作者au:einsteinabs:摘要abs:transformercat:学科分类cat:cs.AI配合AND / OR / ANDNOT、括号分组、双引号短语以及submittedDate:[...]日期过滤可以构造出非常精准的检索式例如uv run scripts/search_arxiv.py --query au:einstein AND ti:relativity --max_results 5两个新手容易踩的坑结果别贪多——一次取 100 篇会把上下文撑爆--max_results 5起步不够再翻页--start。下载后先验证——PDF 下载完智能体会检查文件非空未损坏LaTeX 源码解压时务必解到新建目录不要直接解进工作区。 bioRxiv / medRxiv生命科学预印本的正确打开方式bioRxiv 技能skills/literature_search_biorxiv/SKILL.md和其他三个不太一样它不支持服务端关键词搜索。关键词过滤是在本地完成的——脚本会先下载整个日期范围的全部元数据再筛选所以日期范围太大会导致成百上千次 API 调用甚至被封锁 ⚠️新手务必掌握的三条军规有 DOI 就先用 DOI 查——search_by_doi.py最快最稳是首选入口关键词搜索必须窄日期 分类--start_date/--end_date控制在1–4 周并加上--category如genomics、infectious_diseases只看主题没有日期别硬查——先让 OpenAlex 或 PubMed 找到相关 DOI再回 bioRxiv 取元数据。uv run scripts/search_by_dates.py --server medrxiv \ --start_date 2023-11-01 --end_date 2023-11-30 \ --category infectious_diseases \ --keywords covid sars-cov-2 --match_logic OR \ --include_abstracts covid_papers.json注意该技能不下载 PDF拿到 DOI 后交给 EuropePMC 技能查 PMCID 再取全文即可四件套 一个配套技能正好补齐全流程。 组合拳一个智能体的文献调研流水线单独每个技能都不弱但 Science Skills 真正的威力在于智能体自动串联它们。以调研 CRISPR 最新进展为例一条自然语言指令背后发生的事① OpenAlex 找高被引代表作resolve → filter → 按 cited_by_count 排序 ↓ 拿到一批 DOI ② bioRxiv 按 DOI 补充预印本元数据search_by_doi ↓ 锁定感兴趣的 DOI/PMID ③ PubMed 取摘要、关联基因/蛋白数据库记录 ↓ 找到 PMC 编号 ④ EuropePMC 下载开源全文 PDF、追踪引用网络全程无需你切换网页、手敲检索式智能体按各技能 SKILL.md 中的规则自动执行限速、重试和结果落盘。✅ 高手都在用的 6 条实战技巧结果先落盘再读所有技能都要求输出重定向到 JSON 文件再用jq精简字段后才进上下文——这是高 Token 效率的核心设计你也可以主动要求智能体先只取标题和摘要字段。批量操作别逐条超过 10 个 ID 时让智能体走 PubMed 的 History Server 缓存通道一次调用拿全部数据。搜索 3–5 次就收手技能规范建议高质量检索式试 3–5 次仍无结果大概率是没有符合的文献而不是再试一次能解决的。报告要可溯源各技能都强制要求输出中列出所引用论文的 URL——这是防止 AI幻觉文献的重要护栏保留它。密钥提前配好开工前把NCBI_API_KEY、OPENALEX_API_KEY写进~/.env能显著减少 429 限流等待。许可要留意每个技能首次使用会提示你确认对应数据源的服务条款并落一个.licenses/记录文件请认真阅读后再继续。 延伸阅读与文件导航项目总览与安装说明README.mdPubMed 技能skills/pubmed_database/SKILL.mdOpenAlex 技能skills/literature_search_openalex/SKILL.mdarXiv 技能skills/literature_search_arxiv/SKILL.mdbioRxiv 技能skills/literature_search_biorxiv/SKILL.mdEuropePMC 配套技能skills/literature_search_europepmc/SKILL.mdAPI 密钥安全协议skills/credentials/SKILL.md总结Science Skills 文献搜索四合一——PubMed 管已发表、OpenAlex 管影响力、arXiv 管理工预印本、bioRxiv 管生命科学预印本——用一套技能把 AI 智能体的文献调研能力拉满。安装只需一行命令密钥免费注册剩下的交给智能体你负责提问题它负责查文献、读摘要、下全文 使用提示本文基于 science-skills 仓库文档整理各数据源PubMed、OpenAlex、arXiv、bioRxiv有其自身许可条款批量使用前请阅读对应 SKILL_LICENSES.md 与技能内的许可提示。【免费下载链接】science-skillsGDM Science Skills to speed up agentic scientific workflows with better grounding and higher token efficiency. Integrate insights from AlphaGenome, AFDB, UniProt and 30 other databases and tools.项目地址: https://gitcode.com/gh_mirrors/sc/science-skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考