Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

10 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Paper Reader - 学术论文精读与提炼技能

License: MIT GitHub stars

一个世界顶级的学术研究助手,自动完成PDF论文解析、图表提取、期刊等级检索与结构化研读笔记生成。

快速开始

安装

  1. 克隆仓库
git clone https://github.com/Hongyuan-Lu/paper-reader.git
cd paper-reader
  1. 安装依赖
pip install pypdf pdfplumber pypdfium2 matplotlib Pillow
  1. 使用示例
# 基本使用
python scripts/extract_pdf.py your_paper.pdf

作为 Codex 技能使用

将 paper-reader 文件夹复制到您的 Codex 技能目录中。

📚 Paper Reader - 学术论文精读与提炼技能

一个世界顶级的学术研究助手,自动完成PDF论文解析、图表提取、期刊评级与结构化研读笔记生成。

✨ 核心功能

功能 说明
PDF文本提取 无损提取论文正文及目录结构
图片智能提取 自动识别并提取论文中的图片
期刊等级检索 联网查询中科院分区、JCR分区、CCF等级
五维雷达评级 从5个维度量化评价论文质量
结构化笔记生成 输出全景缩写版 + 深度结构化阅读笔记

🎯 适用场景

  • 📖 文献调研 - 快速筛选和理解大量论文
  • 🔬 论文复现 - 获取方法论详细拆解
  • 🎓 研究背景调研 - 构建领域知识体系
  • 📝 学术写作 - 获取高质量论文摘要素材

📥 输入参数

参数 类型 说明
PDF文件 必填 本地PDF格式的学术论文
期刊/会议信息 选填 如 CVPR 2023, Nature, Q1
阅读深度 选填 Brief / Standard / Deep,默认Standard

阅读深度说明

深度 特点
简略版 (Brief) 聚焦核心结论,高层次架构概括,字数精简
标准版 (Standard) 平衡背景、方法与实验,适合常规阅读
深度精读版 (Deep) 详尽拆解方法论,深挖公式、网络层级、超参数

⚙️ 工作流程

┌─────────────────────────────────────────────────────────────┐
│                        Step 1: 预处理                        │
├─────────────────────────────────────────────────────────────┤
│  • 调用 extract_pdf.py 提取文本和图表                        │
│  • 自动联网查询期刊等级(如用户未提供)                       │
│  • 建立输出目录 {论文名}_extracted/                          │
└─────────────────────────────────────────────────────────────┘
                              ↓
┌─────────────────────────────────────────────────────────────┐
│                        Step 2: 多维评级                      │
├─────────────────────────────────────────────────────────────┤
│  • 期刊/会议等级 (Journal Level)                             │
│  • 创新性 (Innovativeness)                                  │
│  • 实验充分性 (Experimental Rigor)                          │
│  • 方法严谨性 (Methodological Rigor)                         │
│  • 复现友好度 (Reproducibility)                              │
│  • 生成 radar_score.png 五维雷达图                           │
└─────────────────────────────────────────────────────────────┘
                              ↓
┌─────────────────────────────────────────────────────────────┐
│                    Step 3: 双引擎文档生成                     │
├─────────────────────────────────────────────────────────────┤
│  📄 论文全景缩写版.md - 1:1复刻原论文结构                      │
│  📄 深度结构化阅读笔记.md - 6模块逻辑重组                      │
└─────────────────────────────────────────────────────────────┘

📊 深度结构化笔记的6模块结构

1. 研究背景 (Background)
   - 论文研究的背景是什么?为什么该研究是重要的?

2. 拟解决的问题 (Problem)
   - 论文试图解决什么问题?这个问题的难点在哪?

3. 贡献与创新点 (Contributions)
   - 论文有哪些贡献?作者提出了哪些新方法、模型或理论?

4. 方法论 (Methodology)
   - 原理简述:该方法/模型的核心机制
   - 论文使用什么方法或模型来解决问题?

5. 实验与验证 (Experiments)
   - 进行了哪些实验?结果如何?验证了哪些观点?

6. 结论与展望 (Conclusion & Future Work)
   - 论文得出了哪些结论?存在哪些不足之处?

📁 输出文件结构

{论文名称}_extracted/
├── 论文全景缩写版.md            # 全景缩写版(含智能图表引用)
├── 深度结构化阅读笔记.md        # 深度笔记版(含智能图表引用)
├── radar_score.png             # 雷达评分图(中文标签)
└── extracted_figures/          # 提取的图片
    └── fig_Fig2_System_architecture.png

📋 文档头部示例

# 论文标题

---

**综合评级:** ★★★☆☆ **3.2/5**

![论文综合评级雷达图](radar_score.png)

### 五维评分详情

| 维度 | 评分 | 评分理由 |
|------|------|----------|
| 期刊/会议等级 | 5/10 | Applied Intelligence为中科院三区期刊... |
| 创新性 | 7/10 | 提出了数据+模型驱动的融合方法... |
| 实验充分性 | 7/10 | 使用真实城市数据,多模型对比验证... |
| 方法严谨性 | 7/10 | 数学框架完整,考虑多实际因素... |
| 复现友好度 | 5/10 | 未提供开源代码... |

---

🎨 视觉规范

类型 标记方式 示例
🔥 核心突破成果 **[🔥核心突破]** **[🔥核心突破]** 在ImageNet上达到SOTA
📊 专业术语与数据 行内代码块 `Transformer``[B,C,H,W]`
逻辑骨架 粗体 **该方法**通过XX技术实现

排版原则:

  • 拒绝大段不分行的文本
  • 充分使用无序列表 - 和有序列表 1. 拆解复杂长句
  • 使用 1. 1.1 1.1.1 1.1.1.1 标号层级格式

🔧 依赖环境

Python 库

pip install pypdf pdfplumber pypdfium2 matplotlib Pillow

可选工具

# Ubuntu/Debian
sudo apt-get install poppler-utils

# macOS
brew install poppler

📂 项目结构

paper-reader/
├── SKILL.md                     # 技能核心配置文件
├── evals/
│   └── evals.json              # 评估测试用例
├── references/
│   ├── pdf_reference.md        # PDF解析参考文档
│   └── rating_criteria.md      # 评分标准详细参考
└── scripts/
    ├── extract_pdf.py          # PDF文本与图表提取脚本
    └── generate_radar.py       # 雷达评分图生成脚本

⚠️ 注意事项

  1. 联网搜索结果仅供参考 - 期刊等级检索结果不能保证100%准确
  2. 全部输出使用中文 - 所有文档内容均为中文
  3. 不保存全文txt - 只保留用于分析的文本,不输出到文件
  4. 图表引用精准 - 图片和表格仅引用与当前章节密切相关的

📬 联系方式

如有任何问题、建议或合作意向,请通过以下方式联系:

欢迎提交 Issue 或 Pull Request!

📜 License

本项目遵循原创者版权声明,详见具体论文的版权协议。

About

Agent Skill,学术论文精读与提炼技能。一个世界顶级的学术研究助手,支持用户自定义阅读笔记深度,自动完成PDF论文解析、图表提取、期刊等级检索,五大维度论文评级评分,最终生成论文全景缩写版与深度结构化研读笔记。

Topics

Resources

Contributing

Stars

5 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages