Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

1 Commit
 
 
 
 
 
 
 
 

Repository files navigation

小宇宙播客文字稿抽取与总结 Skill

给一个小宇宙(xiaoyuzhoufm.com)单集链接,输出一份可阅读的完整文字稿,加上一份基于完整文字稿生成的、不超过 6 条的要点总结。

一句话

示例提示词:

对这个小宇宙播客 https://www.xiaoyuzhoufm.com/episode/xxx 进行要点提取

结果输出 transcripts/full_transcript.txtsummary.md,可直接进入阅读、引用、转发或二次加工流程。

解决的问题

手工整理小宇宙播客需要做:找音频、下载、切片、转写、合并、再读稿总结。流程里常见的几个痛点:

  • 单集 1 小时左右的长音频,主流转写工具要么贵,要么限速,要么要先上传第三方。
  • 不同切片之间的转写结果需要按时间顺序合并,错位就会产生"上下文断裂"。
  • 总结环节容易混入转写错误、口头禅和未确认的猜测;缺少可被复用的提示词约束。
  • 一次性输出没有统一目录结构,下次想再跑同一集或对比两集时找不到文件。

把这个流程收敛成一条命令可执行的稳定工作流:固定目录结构、并行转写、强制按 prompts/summarize_takeaways.md 总结、产物全部落到 output/{timestamp}_{episode_id}/ 下。

产物清单

每次运行 python scripts/run.py "<url>" 会在 output/{timestamp}_{episode_id}/ 下生成:

  • metadata.json:单集元信息
  • pipeline.log:流水线日志
  • audio/original.*:原始音频
  • audio/chunks/chunk_000.*:30 分钟一片的切片
  • transcripts/chunk_000.txt:每片文字稿(带时间戳头)
  • transcripts/full_transcript.txt:按 chunk_index 升序合并的完整文字稿
  • summary.md:基于完整文字稿、遵循 prompts/summarize_takeaways.md 生成的要点总结(最多 6 条)

工作流(7 步)

  1. 校验输入:必须是 https://www.xiaoyuzhoufm.com/episode/... 或同域名 http 链接。
  2. 抽取音频 URL:从公开可访问的小宇宙单集页面解析,不绕过登录、付费墙、地区限制。
  3. 下载音频:写入 audio/original.*
  4. 切片:使用 ffmpeg 按 30 分钟一片切分。
  5. 并行转写:默认 faster-whisper + medium 模型 + 中文,多切片并行。
  6. 合并文字稿:按 chunk_index 升序拼接,写入 full_transcript.txt
  7. 生成总结:读取 prompts/summarize_takeaways.md,基于完整文字稿生成 summary.md

仓库结构

.
├── skills/
│   └── xiaoyuzhou-transcript-summarizer/
│       ├── SKILL.md
│       ├── config.example.yaml
│       ├── pyproject.toml
│       ├── requirements.txt
│       ├── prompts/
│       │   └── summarize_takeaways.md
│       ├── scripts/
│       │   ├── run.py
│       │   ├── validate_url.py
│       │   ├── extract_audio_url.py
│       │   ├── download_audio.py
│       │   ├── split_audio.py
│       │   ├── transcribe_audio.py
│       │   ├── merge_transcripts.py
│       │   └── summarize_transcript.py
│       ├── src/xyz_skill/
│       │   ├── audio_downloader.py
│       │   ├── audio_splitter.py
│       │   ├── page_parser.py
│       │   ├── transcription.py
│       │   ├── summarizer.py
│       │   ├── pipeline.py
│       │   └── ...
│       └── tests/
├── .claude-plugin/
│   └── marketplace.json
└── README.md

安装方式

1. 一条命令同时安装到 Codex + Claude Code:

npx skills add WoodyXu/PodcastSummary --skill xiaoyuzhou-transcript-summarizer -a codex -a claude-code -y

加上 -g 装到全局(当前用户所有项目)而不是当前项目。

2. 仅安装到 Codex:

按 GitHub 仓库路径 skills/xiaoyuzhou-transcript-summarizer 安装,然后重启 Codex。

3. 通过 Claude Code Marketplace 安装:

/plugin marketplace add WoodyXu/PodcastSummary
/plugin install xiaoyuzhou-transcript-summarizer@xiaoyuzhou-transcript-summarizer-skills

About

小宇宙播客的文字稿提取及要点精华总结

Resources

Stars

7 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages