# 金融研究报告采矿引擎 · 定期更新运营手册（日常运营活动 SOP）

> 这是一项**可反复执行的日常运营活动**：每次运行，都从"当下时点往前推约 3 个月"重新采一批当前最有影响力的大型投行/金融机构专题报告，先扩成 100 候选，再筛出 50 份最重要的，逐条核到质量分，落进可排序表格。旧于 3 个月的自然淘汰，不必强留。

## 一、口径（每次运行都遵守）

- **时间窗口**：运行日往前推 **90 天**。例如 2026-07-10 运行 → 窗口 = 2026-04-11 ~ 2026-07-10。窗口外（更早）的报告没有承重意义，不采。
- **机构层级**：全球大投行卖方研究、头部资管的投资研究院、央行与官方国际机构、顶级咨询/评级/宏观研究机构。
- **主题优先**：宏观展望、资产配置、利率、AI 与算力资本开支、能源、私募信贷、数字资产、黄金、防务、长寿、机器人、新兴市场等对投资有真实影响力的专题。

## 二、质量分（tier 1-5，1 最高 = 直接原始报告）

| tier | 含义 | 判定标准 |
|---|---|---|
| **1** | 原始报告全文 | 找到官方原始报告全文 / 官方 PDF，可直接打开 |
| **2** | 官方报告页/摘要 | 官方报告页或官方摘要页（一手发布，但全文可能有登录墙或仅摘要） |
| **3** | 官方新闻稿/博客 | 官方新闻稿、官方博客、官方发布说明（一手但非完整报告） |
| **4** | 权威媒体报道 | Reuters/Bloomberg/FT/CNBC 等权威第三方对该报告的报道 |
| **5** | 零散拼凑 | 只能从零散新闻/二手提及拼凑，无官方原文 |

## 三、执行步骤（每次运行）

1. **定窗口**：算出运行日往前 90 天的日期区间。
2. **扩候选 100**：按 6 组机构/主题并行搜（美国大投行 / 欧亚全球银行 / 资管投资研究院 / 咨询智库评级 / 央行官方 / 热门主题专题），只收真实、有可点 URL、日期落窗口内的报告，去重后凑 ≥100 候选。**只收真的搜到的，绝不凭记忆编造报告名/日期/URL（GIGO 铁律）。**
3. **筛 50**：按"机构层级 × 主题影响力 × 是否旗舰 × 质量分可达性"给候选排序，选出前 50 份最重要的。
4. **核质量分**：逐条尽量找到原始报告（tier1），找不到就退而求其次到官方页/新闻稿/媒体报道/拼凑，据实标 tier1-5。
5. **落表**：写进 `manifest-50.tsv`（50 份精选）与 `manifest-100.tsv`（100 候选全量），列含：排名、机构、标题、报告日期、tier、主题、采集批次日期、URL。
6. **出可排序表格网页** `index.html`（可按报告日期/机构/质量分/主题排序 + 关键词搜索）。
7. **上线**：push 到 main → GitHub Pages 自动重建 → 核验 URL 真能打开新内容。

## 四、增量补充（往后每次运行）

- 每次运行都新建一个批次目录 `docs/mining/raw/<运行日>-topN.../`，**采集批次日期 = 运行日**，写进表格"采集批次"列，便于按批次追溯"哪一批搜到的"。
- 后续批次可以**继承前一批**里仍在 90 天窗口内的报告（避免重复劳动），只新增/替换过期的、补上一批漏网的。
- 每条报告的三个时间彼此独立、都要列：① **报告发布日期**（可排序）② **机构名**（可排序）③ **本条采集/搜索批次日期**（哪一批入库）。

## 五、防错铁律

- 数据入口守 GIGO：任何报告名/日期/URL 必须真的搜到，宁缺毋滥；旧报告（>90 天）不冒充最新。
- 质量分据实标：找不到原文就标 tier≥2，绝不把候选包装成"已拿到原始报告"。
