一个世界顶级的学术研究助手,自动完成PDF论文解析、图表提取、期刊等级检索与结构化研读笔记生成。
- 克隆仓库
git clone https://github.com/Hongyuan-Lu/paper-reader.git
cd paper-reader
- 安装依赖
pip install pypdf pdfplumber pypdfium2 matplotlib Pillow
- 使用示例
# 基本使用
python scripts/extract_pdf.py your_paper.pdf
将 paper-reader 文件夹复制到您的 Codex 技能目录中。
一个世界顶级的学术研究助手,自动完成PDF论文解析、图表提取、期刊评级与结构化研读笔记生成。
| 功能 | 说明 |
|---|---|
| PDF文本提取 | 无损提取论文正文及目录结构 |
| 图片智能提取 | 自动识别并提取论文中的图片 |
| 期刊等级检索 | 联网查询中科院分区、JCR分区、CCF等级 |
| 五维雷达评级 | 从5个维度量化评价论文质量 |
| 结构化笔记生成 | 输出全景缩写版 + 深度结构化阅读笔记 |
- 📖 文献调研 - 快速筛选和理解大量论文
- 🔬 论文复现 - 获取方法论详细拆解
- 🎓 研究背景调研 - 构建领域知识体系
- 📝 学术写作 - 获取高质量论文摘要素材
| 参数 | 类型 | 说明 |
|---|---|---|
PDF文件 |
必填 | 本地PDF格式的学术论文 |
期刊/会议信息 |
选填 | 如 CVPR 2023, Nature, Q1 |
阅读深度 |
选填 | Brief / Standard / Deep,默认Standard |
| 深度 | 特点 |
|---|---|
| 简略版 (Brief) | 聚焦核心结论,高层次架构概括,字数精简 |
| 标准版 (Standard) | 平衡背景、方法与实验,适合常规阅读 |
| 深度精读版 (Deep) | 详尽拆解方法论,深挖公式、网络层级、超参数 |
┌─────────────────────────────────────────────────────────────┐
│ Step 1: 预处理 │
├─────────────────────────────────────────────────────────────┤
│ • 调用 extract_pdf.py 提取文本和图表 │
│ • 自动联网查询期刊等级(如用户未提供) │
│ • 建立输出目录 {论文名}_extracted/ │
└─────────────────────────────────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────────┐
│ Step 2: 多维评级 │
├─────────────────────────────────────────────────────────────┤
│ • 期刊/会议等级 (Journal Level) │
│ • 创新性 (Innovativeness) │
│ • 实验充分性 (Experimental Rigor) │
│ • 方法严谨性 (Methodological Rigor) │
│ • 复现友好度 (Reproducibility) │
│ • 生成 radar_score.png 五维雷达图 │
└─────────────────────────────────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────────┐
│ Step 3: 双引擎文档生成 │
├─────────────────────────────────────────────────────────────┤
│ 📄 论文全景缩写版.md - 1:1复刻原论文结构 │
│ 📄 深度结构化阅读笔记.md - 6模块逻辑重组 │
└─────────────────────────────────────────────────────────────┘
1. 研究背景 (Background)
- 论文研究的背景是什么?为什么该研究是重要的?
2. 拟解决的问题 (Problem)
- 论文试图解决什么问题?这个问题的难点在哪?
3. 贡献与创新点 (Contributions)
- 论文有哪些贡献?作者提出了哪些新方法、模型或理论?
4. 方法论 (Methodology)
- 原理简述:该方法/模型的核心机制
- 论文使用什么方法或模型来解决问题?
5. 实验与验证 (Experiments)
- 进行了哪些实验?结果如何?验证了哪些观点?
6. 结论与展望 (Conclusion & Future Work)
- 论文得出了哪些结论?存在哪些不足之处?{论文名称}_extracted/
├── 论文全景缩写版.md # 全景缩写版(含智能图表引用)
├── 深度结构化阅读笔记.md # 深度笔记版(含智能图表引用)
├── radar_score.png # 雷达评分图(中文标签)
└── extracted_figures/ # 提取的图片
└── fig_Fig2_System_architecture.png
# 论文标题
---
**综合评级:** ★★★☆☆ **3.2/5**

### 五维评分详情
| 维度 | 评分 | 评分理由 |
|------|------|----------|
| 期刊/会议等级 | 5/10 | Applied Intelligence为中科院三区期刊... |
| 创新性 | 7/10 | 提出了数据+模型驱动的融合方法... |
| 实验充分性 | 7/10 | 使用真实城市数据,多模型对比验证... |
| 方法严谨性 | 7/10 | 数学框架完整,考虑多实际因素... |
| 复现友好度 | 5/10 | 未提供开源代码... |
---| 类型 | 标记方式 | 示例 |
|---|---|---|
| 🔥 核心突破成果 | **[🔥核心突破]** |
**[🔥核心突破]** 在ImageNet上达到SOTA |
| 📊 专业术语与数据 | 行内代码块 | `Transformer`、`[B,C,H,W]` |
| ⚫ 逻辑骨架 | 粗体 | **该方法**通过XX技术实现 |
排版原则:
- 拒绝大段不分行的文本
- 充分使用无序列表
-和有序列表1.拆解复杂长句 - 使用
1. 1.1 1.1.1 1.1.1.1标号层级格式
pip install pypdf pdfplumber pypdfium2 matplotlib Pillow# Ubuntu/Debian
sudo apt-get install poppler-utils
# macOS
brew install popplerpaper-reader/
├── SKILL.md # 技能核心配置文件
├── evals/
│ └── evals.json # 评估测试用例
├── references/
│ ├── pdf_reference.md # PDF解析参考文档
│ └── rating_criteria.md # 评分标准详细参考
└── scripts/
├── extract_pdf.py # PDF文本与图表提取脚本
└── generate_radar.py # 雷达评分图生成脚本
- 联网搜索结果仅供参考 - 期刊等级检索结果不能保证100%准确
- 全部输出使用中文 - 所有文档内容均为中文
- 不保存全文txt - 只保留用于分析的文本,不输出到文件
- 图表引用精准 - 图片和表格仅引用与当前章节密切相关的
如有任何问题、建议或合作意向,请通过以下方式联系:
- 邮箱: hongyuanlu9@gmail.com
- GitHub Issues: 项目 Issues 页面
欢迎提交 Issue 或 Pull Request!
本项目遵循原创者版权声明,详见具体论文的版权协议。