全栈工程师在真实业务场景中的 AI Agent、工具调用、企业工作流与自动化验证实践。
一个结合大模型对话、实时语音与 BLE 硬件控制的微信小程序。AI 助手“小E”通过自然语言引导用户完成标准化视力检测,并记录检测结果与变化趋势。
本仓库仅公开项目演示与脱敏后的工程证据,不包含业务源码、客户资料或第三方服务凭证。
传统视力检测需要检测人员持续提示遮眼方式、视标方向和检测步骤。E瞳视界尝试把这些操作编排成一套由 AI 驱动的交互流程:用户直接通过语音回答,Agent 根据当前检测阶段理解回答、调用工具、控制智能视力表并记录结果。
项目的难点并不只是“接入大模型”,而是让不稳定的自然语言交互服从可验证的业务流程,并能在出现回答错误、看不清、语音打断或外部服务异常时继续推进。
- 13 阶段检测流程:覆盖准备、左眼、右眼、双眼及红绿平衡检测。
- AI 工具调用:Agent 根据对话状态调用视标验证、阶段推进和屏幕控制等工具。
- BLE 硬件控制:通过 BLE GATT 连接智能视力表,控制屏幕、颜色与亮度。
- 实时语音交互:支持语音活动检测、语音识别、语音合成及对话打断。
- 检测结果可视化:保存检测记录,展示视力与红绿平衡变化趋势。
- 证据化 E2E:自动回放对话场景,采集页面状态、截图和模型调用日志,并生成判定报告。
从左到右:蓝牙设备连接提示、AI 语音检测交互、检测记录与趋势统计。
flowchart LR
U["用户语音"] --> V["VAD / ASR"]
V --> A["DeepSeek 检测 Agent<br/>13 阶段状态"]
A --> T["Function Tools"]
T --> B["BLE GATT<br/>智能视力表"]
T --> D["检测状态与结果"]
A --> S["流式 TTS"]
S --> U
项目早期主要依赖人工点击页面、复制日志和检查对话结果。随着检测流程扩展到 13 个阶段,单靠人工很难稳定复现边界场景,也无法把完整证据交给开发 Agent 继续修正。
因此项目增加了独立的 E2E 模块:用结构化旅程描述用户输入与预期行为,在真实小程序运行环境中执行,再把页面状态、截图和模型上下文交给多模态评估器判定。
flowchart LR
C["结构化测试旅程"] --> R["小程序自动化执行"]
R --> P["page.data / 状态"]
R --> I["运行截图"]
R --> L["模型 API 日志"]
P --> E["多模态评估器"]
I --> E
L --> E
E --> O["Pass / Fail<br/>证据报告"]
示例 Happy Path 覆盖完整检测流程,共执行 20 个步骤,历史成功运行结果为 20/20 通过:
报告不仅记录通过与否,还保留每一步的断言、内部状态、用户输入、Agent 工具调用、工具返回与判定理由。
我负责该项目的全栈开发与 Agent 工程设计,主要包括:
- 微信小程序页面、交互和状态管理;
- DeepSeek 对话循环、上下文结构及 Function Tools;
- 实时语音识别、语音合成和语音打断;
- BLE 设备连接与智能视力表控制;
- 检测流程、异常路径与结果可视化;
- 对话场景录制、回放及小程序 E2E 框架;
- 页面状态、截图、API 日志和测试报告的自动化采集。
| 领域 | 技术 |
|---|---|
| 客户端 | 微信小程序原生 JavaScript / WXML / WXSS |
| AI | DeepSeek API、Tool Calling、上下文与状态管理 |
| 语音 | 腾讯云 ASR / TTS、火山引擎流式 TTS、VAD |
| 硬件 | 微信 BLE API、GATT 协议 |
| 云端 | 微信云函数、云数据库 |
| 测试 | miniprogram-automator、场景回放、多模态评估、Markdown 报告 |
项目已完成主要产品流程和自动化测试框架。
这段经历进一步推动了我对“证据驱动多 Agent 开发系统”的探索:让 Planner、Worker、Verifier 和独立 Evaluator 围绕版本化验收标准协作,使 Agent 不只生成代码,还能在真实环境中测试、取证、判断并根据失败证据继续修正。
这是一个帮助企业员工直接在企业微信中使用 OpenClaw 完成业务工作流的客户交付项目。企业微信渠道插件基于社区开源版本进行二次开发,以满足客户在身份识别、群聊隔离和 Agent 路由方面的需求;两个业务 Agent 及其对应 Skill 由我设计和实现。
- 每日报工 Agent:通过文本或语音收集报工信息,完成项目消歧、身份绑定、业务规则校验,以及报工记录的查询、新建和修改。
- 工作汇报 Agent:把员工输入整理成结构化工作汇报,通过企微群机器人发送并 @ 本人,同时按日期和用户归档、统计汇报情况。
- 企微插件二次开发:在开源插件基础上增加群聊用户级会话隔离和企微 ID 映射,使不同员工拥有独立 Agent 上下文,并能把企业身份安全传递给业务 Skill。
上述项目让我逐步把关注点从“调用模型生成结果”转向“让 Agent 在真实环境中可靠地完成工作”:包括身份和权限边界、业务规则、上下文隔离、工具执行、证据采集及失败恢复。目前我正在探索一套证据驱动的多 Agent 代码开发系统,让 Planner、Worker、Verifier 和独立 Evaluator 围绕版本化验收标准协作,使 Agent 能够自主完成设计、开发、测试、验证、评估和修正。



