Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
6 changes: 6 additions & 0 deletions CHANGELOG.md
Original file line number Diff line number Diff line change
Expand Up @@ -4,6 +4,12 @@

## [Unreleased]

### Added

- **自进化系列三集科普视频内容升级与本人音色克隆配音**:三集([《AI 如何自己变强?》](media/self-improving-agents-video/README.md) v3 / [《上线之后,AI 才开始上学》](media/experience-era-agents-video/README.md) v2 / [《会写代码的 AI,开始给自己写代码》](media/self-evolving-coding-agents-video/README.md) v3)统一换用本人音色克隆配音(IndexTTS-2.5 `passionate` 激情风格,me-1.wav 样本经 RMS 预筛裁剪);源论文第二遍重读校准(三集全部断言零事实漂移)+ 官方工程站点信源补充(ep1 312 条收录统计/九篇敲门砖→P5 活地图+卡片墙镜;ep2 经验编译器闭环/Gen3 适应面语义/SIP-Bench 四指标/111 篇×9 章→6-B2 闭环复盘+6-F 清单卡镜;ep3 无站点,SICA 三选择信号+Table 2 斜线规律两句锚定);每集新增 `research/upgrade-2026-08.md` 审计文档(校准审计表+句级 delta+双重校验 delta RISKY/REWRITE=0+G2 验证记录);动画增强(计数器滚动/环形图合拢/双色分拣重排/青紫双速差流光/斜线光带扫掠/检查点卡+四仪表/数值轨迹雷达/流光巡游,全部 skill-06 四红线合规)。
- **科普视频管线新增「激情」配音风格预设与官方工程站点信源补充规范**:`media/pipeline/scripts/tts.py` 的 IndexTTS 风格预设表新增 `passionate`(充满激情与轻快:happy 0.70 主载高唤醒正价 + surprised 0.20 跳跃感 + calm 0.10 锚定咬字,有效和 1.00×0.7=0.70 ≤ 0.8 上限,语速 0.97 护密集技术句清晰度),`--list-styles` 与 [VOICE-CLONING.md](media/pipeline/VOICE-CLONING.md) §四 同步收录并给出科普长视频推荐位;[skills/01-paper-extraction.md](media/pipeline/skills/01-paper-extraction.md) 扩展「官方工程站点信源补充」纪律——只收事实性内容、逐字引用+URL+访问日期、落 `paper-notes.md` 末尾独立「信源补充」大节并与论文正文物理隔离、严禁下载/嵌入站点图片(概念转文字规格供 Remotion 代码动画重建)、站点信源单集专属不跨集。
- **IndexTTS 推理束搜索宽度旋钮(`--num-beams`,长跑提速主开关)**:服务端 `tts_server.py` 请求模型与推理透传 num_beams(1–5),客户端 `tts.py` 新增 `--num-beams`(默认 1);根因为 MPS fp32 实测每句墙钟 RTF 40–58(上游库内部 num_beams=3 使 GPT 段耗时按束宽线性放大),降为 1 束后 RTF≈12–15(采样生成下听感差异可忽略);[VOICE-CLONING.md](media/pipeline/VOICE-CLONING.md) §4.3b 沉淀实测数据并修正原「每句 5–30 秒」的失实估计(整集实际数小时,需 nohup 后台+断点续跑)。

### Fixed

- **`cli.sh restart` Phase 3 报 `PostgreSQL 未运行` 直接中止**:`postgresql@16` 非正常退出后数据目录残留 `postmaster.pid`(其 PID 被 OS 回收复用为他进程,本例为 WebKit),brew launchd 反复重试撞 `FATAL: lock file "postmaster.pid" already exists` → 服务进入 `error` 态,而 Phase 3(`cli.sh`)原先仅 `pg_isready -h localhost -p 5432` 探测一次、未运行即 `exit 1`,无自愈、不区分 PG 版本。根因实证:残留 pid 记录 PID `4174` 实为 `com.apple.WebKit.WebContent`(非 postgres),`/opt/homebrew/var/log/postgresql@16.log` 尾部 60+ 条同款 FATAL。修复:新增 `_ensure_postgres` 自愈链——解析 Homebrew formula(默认 `postgresql@16` 对齐 CI `pgvector:pg16`,按 `@16→@17→@18→postgresql` 探测,可 `NEGENTROPY_PG_FORMULA` 覆盖)→ `_clean_stale_pg_pid` 仅当 PID 已死或存活但非 postgres 进程时清理残留锁 → `brew services restart`(覆盖 error/已加载态,start 兜底)→ `_wait_pg_ready` 壁钟轮询就绪(默认 30s,`NEGENTROPY_PG_READY_TIMEOUT` 覆盖);全失败才报错并附诊断(`brew services list` / 日志路径 / 版本核对)。无 `pg_isready` 时保留原「不探测、退由 alembic 校验」行为(最小干预)。新增 `scripts/tests/test_pg_selfheal.sh` 函数级回归测试(9 用例全通过)。本次即时清理 `@16` 残留锁并 restart 恢复,`SELECT version()` 核对为 16.14。防范:本机共存 PG@16/17/18,5432 易错位——残留 `postmaster.pid` 致 brew `error` 态是可复用判据,优先核 `ps comm` 而非 `kill -0`(后者对 OS 回收复用的 PID 误判存活)。
Expand Down
2 changes: 1 addition & 1 deletion docs/.agents/knowledge-map.md
Original file line number Diff line number Diff line change
Expand Up @@ -71,5 +71,5 @@
- [经验时代的自驱迭代进化智能体调研](../research/self-evolution/140-experience-era-self-improvement.md) — 精读 88 页综述提炼 Harness 经验基础设施框架,对照 negentropy Routine 闭环诊断出两处根本断点(Judge 无历史锚点 ±20 振荡 / `decay_override` 死配置致经验记忆 7-8 天全灭 + 反馈链断),落地双支柱改进:证据锚定纵向评估(trajectory + progress_evidence + 量化振荡 opt-in)与经验记忆闭环补强(衰减修复 E / 检索反馈闭环 B / 写入去重准入 A / 失败教训结构化与注入 C-D)
- [Skill 进化闭环 × 自我改进评测](../research/self-evolution/141-skills-evolution-and-si-measurement.md) — 综述 §3(Skills 三阶段 Evolution 缺口)/ §7(Meta-Evolving 三体制)/ §8(SI 六目标 + SIP-Bench + 反事实归因)映射到 negentropy:PR [#1038](https://github.com/ThreeFish-AI/negentropy/pull/1038) 落地 eval 四表 + held-out 双相门(decide_skill_shadow/canary)+ 反事实 Skill Influence Pattern + TargetHandler 抽象 + SkillTemplateHandler 闭环(GEPA 变异 prompt_template + active_version 发布),补 140 号未覆盖的 Skills/Meta/SI 度量框架
- [arXiv §5 科普视频制作包](../../video-package/README.md) — 基于 [141 号调研同源综述](../research/self-evolution/141-skills-evolution-and-si-measurement.md)(arXiv:2607.13104 §5 基座模型自我改进)的完整视频制作包:13:42 逐字稿(N0–N6 段落 ID 主键体系,4.7 字/秒自洽)+ 46 镜头分镜表(md/csv 双格式,822s 与逐字稿/动画三表对齐)+ 单文件 Canvas 动画 demo(1920×1080、8 场景 3B1B 风格、←/→/空格/R/1-8/H 快捷键、file:// 零依赖直开)+ 71 条事实核查表(引文 100% grep 验证命中论文原文、RISKY/REWRITE 双零、ANALOGY 类比显式登记)
- [科普视频制作 Pipeline(公共基建)](../../media/pipeline/README.md) — 全仓可复用的论文→视频九阶段流水线(精读提取/策划/逐字稿 SSOT/双重校验/分镜/TTS/Remotion/抽帧 QA/终渲):中心脚本三件套(`--project` 参数化)+ 每 Stage 代理提示词规格(skills/01–06:01–05 内容层 + 06 生产层 Remotion 实现)+ 新集脚手架清单与复用边界(Python 脚本集中 SSOT、Remotion 原语复制适配);作品:[《AI 如何自己变强?》](../../media/self-improving-agents-video/README.md)(Schmidhuber 综述 · 蓝/橙契约 · 6 幕)、[《上线之后,AI 才开始上学》](../../media/experience-era-agents-video/README.md)([140 号调研](../research/self-evolution/140-experience-era-self-improvement.md)同源清华×Frontis 综述 · 金/青/紫契约 · 7 幕 13.6 分钟)与 [《会写代码的 AI,开始给自己写代码》](../../media/self-evolving-coding-agents-video/README.md)(arXiv:2608.03392 NJUST×NJU 综述 · 终端绿/洋红契约 · 7 幕 14.7 分钟,五对象×时机证据×可信进化,论文笔记由 8 并行代理逐章精读产出);配音支持用自己的声音克隆(轻快/自信/正能量风格,见 [VOICE-CLONING.md](../../media/pipeline/VOICE-CLONING.md))
- [科普视频制作 Pipeline(公共基建)](../../media/pipeline/README.md) — 全仓可复用的论文→视频九阶段流水线(精读提取含官方工程站点信源补充/策划/逐字稿 SSOT/双重校验/分镜/TTS/Remotion/抽帧 QA/终渲):中心脚本三件套(`--project` 参数化)+ 每 Stage 代理提示词规格(skills/01–06:01–05 内容层 + 06 生产层 Remotion 实现)+ 新集脚手架清单与复用边界(Python 脚本集中 SSOT、Remotion 原语复制适配);作品:[《AI 如何自己变强?》](../../media/self-improving-agents-video/README.md)(Schmidhuber 综述 · 蓝/橙契约 · 6 幕)、[《上线之后,AI 才开始上学》](../../media/experience-era-agents-video/README.md)([140 号调研](../research/self-evolution/140-experience-era-self-improvement.md)同源清华×Frontis 综述 · 金/青/紫契约 · 7 幕 13.6 分钟)与 [《会写代码的 AI,开始给自己写代码》](../../media/self-evolving-coding-agents-video/README.md)(arXiv:2608.03392 NJUST×NJU 综述 · 终端绿/洋红契约 · 7 幕 14.7 分钟,五对象×时机证据×可信进化,论文笔记由 8 并行代理逐章精读产出);配音支持用自己的声音克隆(激情/轻快/自信/正能量风格,见 [VOICE-CLONING.md](../../media/pipeline/VOICE-CLONING.md);2026-08 三集统一换用本人音色 passionate 风格 + 内容升级审计文档 [upgrade-2026-08.md](../../media/self-improving-agents-video/research/upgrade-2026-08.md) 各集一份,站点信源补充规范沉淀于 skills/01
- [自进化 Agents Team 方案(Phase 3 记忆检索面已落地)](../concepts/design/self-evolving-agents.md) — 四层自进化架构:本次落地 `engine/evolution/` 子系统(GEPA proposer + 状态机 + decision 护栏)并在记忆检索权重面接通 propose→shadow→canary→promote/rollback 全闭环(迁移 0081 + evolution_inspector),默认全关灰度;agent/skill/knowledge 面、Phase 1 tool_invocations 遥测、eval 四表留后续
11 changes: 7 additions & 4 deletions media/experience-era-agents-video/README.md
Original file line number Diff line number Diff line change
@@ -1,7 +1,8 @@
# 《上线之后,AI 才开始上学》科普视频工程

> 基于 Che Jiang, Jincheng Zhong, Yu Fu, *et al.*, "Self-Improving Agents in the Era of Experience: A Survey of Self- to Meta-Evolution," *Frontis.AI / Tsinghua University*, Jun. 2026(88 页综述,无公开 arXiv 号)的动效图解式科普视频(B 站/YouTube,约 13.6 分钟)。
> 形态:AI 配音(edge-tts)+ Remotion 代码动画,无真人出镜。
> 形态:**本人音色克隆配音**(IndexTTS-2.5,passionate 激情风格)+ Remotion 代码动画,无真人出镜。
> (v3 前为 edge-tts 预置音色,两种引擎 manifest 契约一致,可随时切回。)
> 与上一集《AI 如何自己变强?》([../self-improving-agents-video/](../self-improving-agents-video/README.md),Schmidhuber 团队综述)互补:上集讲「自我进化改什么」,本集讲「部署之后经验怎么攒」;片尾互相引用。

## 目录结构
Expand All @@ -23,8 +24,10 @@
# 1. 改稿后重建逐句 JSON
uv run --no-project scripts/build_narration.py

# 2. 合成配音(增量幂等;首跑约 3-5 分钟,需网络)
uv run --no-project --with edge-tts --with mutagen scripts/tts.py
# 2. 合成配音(本人音色克隆,增量幂等;需先启动 IndexTTS 服务,见 ../../pipeline/VOICE-CLONING.md)
uv run --no-project --with mutagen scripts/tts.py --engine indextts \
--ref <仓库绝对路径>/media/pipeline/voices/me-1.wav --style passionate
# (声音样本不入库:me-1.wav 需从本人录音经 prepare_ref.py 裁剪生成;整集约数小时,断点续跑)

# 3. 预览
cd video && pnpm install --ignore-workspace && pnpm dev
Expand Down Expand Up @@ -55,4 +58,4 @@ cd video && pnpm run render # -> ../out/final.mp4

## 许可注意

Remotion 对超过 3 人的公司需商业授权(个人/小团队免费);若本视频转为公司用途,请评估许可或迁移 MIT 协议的 Motion Canvas。配音来自 edge-tts(微软在线语音),发布前请自行确认平台对合成语音的标注要求。
Remotion 对超过 3 人的公司需商业授权(个人/小团队免费);若本视频转为公司用途,请评估许可或迁移 MIT 协议的 Motion Canvas。配音为**本人声音的自愿克隆**(IndexTTS-2.5,按 bilibili 模型使用许可:个人/研究用途可用,商用需联系 indexspeech@bilibili.com;克隆他人声音须获本人书面同意,详见 [../../pipeline/VOICE-CLONING.md](../../pipeline/VOICE-CLONING.md) §八)。发布前请自行确认平台对合成语音的标注要求。
55 changes: 55 additions & 0 deletions media/experience-era-agents-video/research/paper-notes.md
Original file line number Diff line number Diff line change
Expand Up @@ -881,3 +881,58 @@
- 【收束金句】"Verification underlies each, and it is the capacity that scales least well as agents become more capable." → 验证是九个问题共同的地基,却是随智能体变强而扩展得最差的能力。
- 【悬念】"the trajectory of improvement under repeated adaptation is not known to compound, saturate, or oscillate." → 反复适应之下,改进轨迹究竟会复利增长、饱和还是震荡——未知。画面:三条候选曲线(指数上扬、平台、正弦震荡)各打一个问号。
- 【收束】"Progress will likely come less from individually stronger agents than from an account of how experience becomes capability, and of when post-deployment adaptation can be measured, internalized, and trusted." → 进步更少来自单兵更强的智能体,更多来自一套关于“经验如何变成能力、部署后适应何时可被测量、内化与信任”的理论。

---

## 信源补充(2026-08 升级;来源:官方工程站点,非论文正文)

> 站点:https://frontisai.github.io/Awesome-Self-Improving-Agents/(访问日期 2026-08-18)。以下条目全部来自站点页面,与论文正文物理隔离;如与论文冲突以论文为准。

### trace-to-capability 闭环(站点 Overview 原文转述)

- 站点把论文主旨可视化为一条五段流水(逐字要点):
1. **Deployment Traces**:"Goals, actions, observations, feedback, corrections, tests."(部署轨迹:目标、动作、观察、反馈、纠正、测试)
2. **Experience Compiler**(经验编译器):"Selects evidence, abstracts reusable lessons, assigns provenance."(选证据、提抽象教训、记出处)
3. **Harness 侧(快/可逆)**:"Skills, memory, tools, environments, workflows."
4. **参数侧(慢/持久)**:"RL and continual learning absorb stable runtime priors."
5. **闸门**:"Measure longitudinal gain, retention, attribution, efficiency, and non-regression before treating change as improvement."(先量纵向增益/保持/归因/效率/不退化,才承认这是改进);终点标注 "Durable capability under control"(受控的持久能力)。
- 与论文对应关系:站点「经验编译器」即论文 §2.1 的 z_i = H(τ_i) 编译步(过滤/压缩/归因/验证),站点把它拟人化为一个具名组件——**可视化叙事时可直接采用「经验编译器」这个站点命名**(标注来源)。

### 三代演进(站点 Timeline 原文)

- 站点逐字:"From Gen 1 to Gen 3, the main object shifts from episodic tool-use loops, to cross-task reuse, to persistent harness-centered runtimes **whose adaptation surfaces can evolve after deployment**."(从片段式工具循环 → 跨任务复用 → 适应面本身可在部署后进化的持久运行时)。
- v1 口播 p1-25 已说「工位本身成了可以自动升级的产品」;站点加强版语义是「**适应面本身可进化**」——升级方向(v3 加一句点破)。

### SIP-Bench 协议(站点 Evaluation 原文)

- 站点逐字:"SIP-Bench evaluates one evolving agent across T0/T1/T2 checkpoints rather than reporting only a final score after adaptation."(对同一个进化中的智能体在 T0/T1/T2 三个检查点反复评测,而非只报适应后的最终分)。
- 四指标原文:held-out gain("does experience improve performance on tasks outside the adaptation stream?");backward retention("does the same evolving agent keep old capabilities after updating?");path attribution("did the gain come from skills, memory, tools, parameter updates, or their interaction?");efficiency/safety("was the gain worth its cost and risk?")。
- 站点动机句:"Without longitudinal evaluation, we cannot tell durable self-improvement from one-off elicitation, overfitting, drift, or unsafe mutation."

### 收录规模与从业者要点

- 【111 篇 × 9 章】站点计数器:"111 papers / 9 paper chapters"(章即技能/记忆/环境/工具/RL 参数侧/元进化/评测/安全/harness 定义)。
- 【三段式训练要点】站点 RL & Continual Learning 节给从业者的三句话(逐字):Pre-deployment Training for Vertical Agent Capabilities(上线前:垂直能力训练)/ Pre-deployment Training for Harness Functional Units(上线前:工具·记忆·技能·子智能体的使用训练)/ Post-deployment Training from Agent Traces(上线后:从运行轨迹训练)。

---

## 2026-08 升级复核(第二遍重读校准)

> 重读方式:本地 PDF(`assets/papers/source/Self-Improving Agents in the Era of Experience: A Survey of Self- to Meta-Evolution.pdf`,88 页)以既有精读笔记为底进行核对(笔记 2026-08-16 由 9 个并行代理从 PDF 全文产出,本轮重点复核 §1–2 harness 形式化、§8 SIP-Bench、§10 开放问题三处与 v1 口播的对应)+ 站点实时抓取(2026-08-18)。
> **结论**:narration v1 全部断言与论文一致,零事实漂移。+16.2pp / 16/84 负迁移 / ~1,200 恶意技能 / >90% 记忆操纵 / tau-bench 可靠性 / AI-45° Law 等关键数字锚点均维持。

### 审计发现与处置

| # | 发现 | 类别 | 处置 |
|---|---|---|---|
| 1 | 站点「经验编译器闭环」五段图把全片结构浓缩为一张图,v1 的 p6-06/07 金句(trace-to-capability)只有两句话、无画面展开 | 站点信源·结构复盘缺口 | 新增 P6 闭环复盘镜(4 句):五段环动画把金句升格为全片结构总图 |
| 2 | 站点 Gen3 精确语义「适应面本身可在部署后进化」比 v1 p1-25「可以自动升级的产品」更进一步 | 核心遗漏(轻) | 新增 p1-25a 一句点破 |
| 3 | v1 P4 已有六指标 + SIP-Bench 三时间点;站点四指标问句表述更利口播(新旧任务/归因/代价风险) | 已覆盖(强化) | 不加句,storyboard 4-F 动效升级为三检查点卡+四仪表 |
| 4 | 站点 111 篇×9 章规模数 | 站点信源 | 新增 p6-13a/b 两句(配套清单卡) |
| 5 | 考虑补 §10 九大开放问题中的多智能体涌现、多模态经验压缩 | — | **放弃**:v1 已选三问(激发 vs 习得/越吃越窄/多模态压缩),planning.md 取舍声明仍成立 |

### 本轮新增断言锚点(v2 新句用)

- 【站点闭环五段】见「信源补充」——「经验编译器」命名与三步(选证据/提抽象/记出处)引站点;两路去向与闸门语义与论文 §2.1/§8 一致(站点为论文可视化)。
- 【站点 Gen3】"whose adaptation surfaces can evolve after deployment"。
- 【站点规模】111 papers / 9 chapters(2026-08-18 访问)。
Loading