"你下载了 30 篇论文。你能说清楚哪几篇最该先读、谁和谁是一条线吗?"
导师甩给你 5 篇文献,你顺着参考文献越找越多,Zotero 里很快堆成一座山?
每篇都觉得"好像有用",可到底该精读、略读还是先放一放,始终说不清?
想写文献综述,却卡在最开头——读什么、先读谁、哪几篇能放进同一节?
滚到后面方向越跑越偏,回头一看一半文献跟主题根本不搭?
把几篇种子文献丢进去,让它双向滚雪球、逐篇判相关、映射到你的综述章节,滚出一张能直接动笔的文献地图。
输入种子文献 → 双向滚雪球(参考文献 + 被引文献)→ 自动查摘要分强中弱 → 映射综述章节 → 每轮停下汇报缺口与下一步。
💡 这是什么 / 给谁用(点击展开)
文献滚雪球是一个面向写综述的人的 AI 文献筛选 Skill。它不只是"帮你多找几篇论文",而是把一堆散落的参考文献,整理成一张可写综述的文献地图:哪些强相关、哪些是理论源头、谁和谁在争论、每篇该放进综述的哪一节。
- 给谁:要写学位论文、开题报告、投稿综述、课程论文的人;任何需要快速建立文献池、又不想读偏方向的人。
- 不是什么:不是"一键生成综述"的偷懒工具。相关性判断、理论路径识别、最终引用核对,仍然是你的学术判断——它负责把你从"读什么、先读谁"的泥潭里捞出来。
- 诚信底线:每条判断都标证据等级(已读全文 / 已读摘要 / 仅见题名 / 需核对),绝不编造摘要、DOI、页码或引文。
把「一堆论文 → 凭感觉乱读」变成「种子文献 → 双向滚雪球 → 文献地图 → 阅读优先级」。
读种子文献 → 判相关性 → 取参考文献 + 查被引文献 → API 批量查摘要
→ 分强中弱 → 映射综述章节 → 更新文献地图 → 缺口诊断 + 下轮检索词 → 停下汇报
你拿到的不是又一份待读清单,而是一张持续生长、能直接动笔的文献地图——它还会告诉你下一铲该往哪挖。
| 产出 | 给谁 | 解决什么 |
|---|---|---|
| 文献地图笔记 | 给你存 | 单一 Obsidian 大笔记:框架映射、强中弱清单、核心作者与争论、滚雪球日志,跨会话持续更新 |
| 本轮强相关文献表 | 给你读 | 引用 + 中文贡献理由 + 章节映射 + 证据等级 + 引用链,先读哪篇一目了然 |
| 缺口诊断 + 检索词 | 给你挖 | 具体到「缺纵向因果证据」这种粒度,附可直接复制去搜的中英文关键词 |
普通的"顺参考文献找"只会让你越滚越老。这个 Skill 两个方向一起滚:
| 方向 | 怎么滚 | 找到什么 |
|---|---|---|
| ⬅️ Backward(参考文献) | 提取一篇文献引用了谁 | 理论源头、奠基之作、概念的出处 |
| ➡️ Forward(被引文献) | 查谁引用了这篇 | 最新进展、近五年更新、领域当下的争论 |
一篇 1990 年的奠基理论,backward 带你回到它的思想根脉,forward 把引用它的 2025 新研究一并捞上来。综述既要有源头也要有前沿,单向滚不出完整图景。
数据来自 OpenAlex → Semantic Scholar → Crossref 三级自动兜底,免费、无需 API Key。
滚完一轮必停下,等你确认方向再滚下一轮——你是主持人,不是旁观者,绝不会自顾自滚偏。每轮汇报固定五件事:
| # | 内容 | 说明 |
|---|---|---|
| 1 | 本轮新增强相关 | 引用 + 中文贡献理由 + 章节映射 + 证据等级 + 引自哪篇 |
| 2 | 池子总览 | 强 / 中 / 弱 / 已排除各多少,框架每个板块覆盖到没有 |
| 3 | 缺口诊断 | 具体可执行,如「缺中国语境实证」「缺概念桥接文献」,不说空话 |
| 4 | 下一轮建议 + 检索词 | 每个缺口配一组可直接复制的中英文关键词,并指明从哪几篇继续滚 |
| 5 | 推荐下载清单 | 强相关但还没全文的,按优先级排序 |
判断核心文献的权重:与你主题/章节的贴合度 > 理论奠基性 > 被多篇种子反复引用。名气和被引数本身不构成入选理由。
如果你已经有综述框架(如「概念界定 / 影响因素 / 机制解释」或自定义的 P1–P4),每篇强相关文献会被标注到段落功能粒度,而不只是丢进某一章:
适合 P2 开头立论 | 概念界定 | 理论基础 | 政策背景 | 批判与边界
| 过渡到 P3 | 影响因素-家庭 | 机制解释-理论路径 | 经验证据锚点 | 争论的一方
没有框架时,它会先按理论路径把强相关文献聚类,归纳出一个候选框架(每条路径配代表文献)供你确认,再做映射。
前置要求: Python 3.10+、pdftotext(读本地 PDF 用,brew install poppler 即可)。
Claude Code:
git clone https://github.com/hututu-ai/literature-snowball.git
mkdir -p ~/.claude/skills
cp -R literature-snowball ~/.claude/skills/literature-snowballCodex:
mkdir -p ~/.codex/skills
cp -R literature-snowball ~/.codex/skills/literature-snowball然后直接说:
用 literature-snowball,从这几篇 PDF 出发,帮我建一个关于社交媒体与青少年心理健康的文献综述阅读池。
地图笔记存到 ~/Obsidian/文献地图-社交媒体与青少年.md
已经有框架,直接贴出来让它对着滚:
主题:社交媒体使用与青少年心理健康。
框架:
P1:使用时长与暴露效应
P2:社会比较与自我呈现
P3:平台可供性与算法环境
P4:个体易感性与边界条件
先判断种子文献强中弱相关,再把候选文献映射到这四个板块。
下次想接着滚,只要给出同一个地图笔记路径,它会读取进度继续滚——已排除的不重查,已评级的不重判。
「脚本保下限,AI 做判断」。两个脚本都只依赖 Python 标准库,零安装。
# 批量解析 DOI / 题名 → 元数据 + 摘要
python3 scripts/snowball_api.py lookup "10.2307/2092789" "Cultural capital and school success"
python3 scripts/snowball_api.py lookup --file candidates.txt
# backward:这篇引了谁(含各自摘要与被引数)
python3 scripts/snowball_api.py refs "10.2307/2092789" --max 60
# forward:谁引用了这篇(默认被引最高优先;--sort recent 看最新)
python3 scripts/snowball_api.py cited-by "10.2307/2092789" --max 25 --sort recent从 PDF / DOCX / TXT / Markdown 粗略提取题名、摘要、参考文献段(JSON 输出)。
python3 scripts/reference_slice.py paper1.pdf paper2.pdf| 角色 | 负责什么 |
|---|---|
| 脚本 | 切片本地文件;批量拉元数据、摘要、双向引用关系 |
| AI | 判相关性、识别理论路径、映射综述章节、诊断缺口、生成检索关键词 |
| 你 | 确认每轮方向、决定精读顺序、核对最终引用 |
literature-snowball/
├── SKILL.md # Skill 定义,AI 编程助手读取这里
├── README.md # 你正在看的这份
├── LICENSE # MIT
├── agents/
│ └── openai.yaml # Codex UI 元数据
├── scripts/
│ ├── snowball_api.py # OpenAlex/S2/Crossref 双向滚雪球
│ └── reference_slice.py # 本地 PDF/DOCX 摘要与参考文献切片
└── templates/
└── literature-map.md # Obsidian 文献地图笔记模板
本项目基于 MIT License 开源。
本 Skill 只用于前期筛选与阅读规划。文献池是初筛层,正式写作引用前请核对原文、出版信息与引用格式;不把"仅见题名"当已读,不把摘要扩写成全文结论,不把 AI 的相关性判断当作最终学术判断。
把散落的文献清单,滚成一张能动笔的文献地图。