Skip to content

Latest commit

 

History

2 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 

Repository files navigation

AI Agent 工程项目集

全栈工程师在真实业务场景中的 AI Agent、工具调用、企业工作流与自动化验证实践。

代表项目一:E瞳视界|AI 对话驱动的智能视力筛查

一个结合大模型对话、实时语音与 BLE 硬件控制的微信小程序。AI 助手“小E”通过自然语言引导用户完成标准化视力检测,并记录检测结果与变化趋势。

本仓库仅公开项目演示与脱敏后的工程证据,不包含业务源码、客户资料或第三方服务凭证。

E瞳视界检测流程预览

▶ 查看完整流程演示

项目解决什么问题

传统视力检测需要检测人员持续提示遮眼方式、视标方向和检测步骤。E瞳视界尝试把这些操作编排成一套由 AI 驱动的交互流程:用户直接通过语音回答,Agent 根据当前检测阶段理解回答、调用工具、控制智能视力表并记录结果。

项目的难点并不只是“接入大模型”,而是让不稳定的自然语言交互服从可验证的业务流程,并能在出现回答错误、看不清、语音打断或外部服务异常时继续推进。

核心能力

  • 13 阶段检测流程:覆盖准备、左眼、右眼、双眼及红绿平衡检测。
  • AI 工具调用:Agent 根据对话状态调用视标验证、阶段推进和屏幕控制等工具。
  • BLE 硬件控制:通过 BLE GATT 连接智能视力表,控制屏幕、颜色与亮度。
  • 实时语音交互:支持语音活动检测、语音识别、语音合成及对话打断。
  • 检测结果可视化:保存检测记录,展示视力与红绿平衡变化趋势。
  • 证据化 E2E:自动回放对话场景,采集页面状态、截图和模型调用日志,并生成判定报告。

产品截图

蓝牙连接提示 语音交互检测 视力统计结果

从左到右:蓝牙设备连接提示、AI 语音检测交互、检测记录与趋势统计。

产品链路

flowchart LR
    U["用户语音"] --> V["VAD / ASR"]
    V --> A["DeepSeek 检测 Agent<br/>13 阶段状态"]
    A --> T["Function Tools"]
    T --> B["BLE GATT<br/>智能视力表"]
    T --> D["检测状态与结果"]
    A --> S["流式 TTS"]
    S --> U
Loading

为什么要做自动化验证

项目早期主要依赖人工点击页面、复制日志和检查对话结果。随着检测流程扩展到 13 个阶段,单靠人工很难稳定复现边界场景,也无法把完整证据交给开发 Agent 继续修正。

因此项目增加了独立的 E2E 模块:用结构化旅程描述用户输入与预期行为,在真实小程序运行环境中执行,再把页面状态、截图和模型上下文交给多模态评估器判定。

flowchart LR
    C["结构化测试旅程"] --> R["小程序自动化执行"]
    R --> P["page.data / 状态"]
    R --> I["运行截图"]
    R --> L["模型 API 日志"]
    P --> E["多模态评估器"]
    I --> E
    L --> E
    E --> O["Pass / Fail<br/>证据报告"]
Loading

示例 Happy Path 覆盖完整检测流程,共执行 20 个步骤,历史成功运行结果为 20/20 通过

报告不仅记录通过与否,还保留每一步的断言、内部状态、用户输入、Agent 工具调用、工具返回与判定理由。

我的工作

我负责该项目的全栈开发与 Agent 工程设计,主要包括:

  • 微信小程序页面、交互和状态管理;
  • DeepSeek 对话循环、上下文结构及 Function Tools;
  • 实时语音识别、语音合成和语音打断;
  • BLE 设备连接与智能视力表控制;
  • 检测流程、异常路径与结果可视化;
  • 对话场景录制、回放及小程序 E2E 框架;
  • 页面状态、截图、API 日志和测试报告的自动化采集。

技术栈

领域 技术
客户端 微信小程序原生 JavaScript / WXML / WXSS
AI DeepSeek API、Tool Calling、上下文与状态管理
语音 腾讯云 ASR / TTS、火山引擎流式 TTS、VAD
硬件 微信 BLE API、GATT 协议
云端 微信云函数、云数据库
测试 miniprogram-automator、场景回放、多模态评估、Markdown 报告

当前状态与下一步

项目已完成主要产品流程和自动化测试框架。

这段经历进一步推动了我对“证据驱动多 Agent 开发系统”的探索:让 Planner、Worker、Verifier 和独立 Evaluator 围绕版本化验收标准协作,使 Agent 不只生成代码,还能在真实环境中测试、取证、判断并根据失败证据继续修正。

代表项目二:OpenClaw 企业微信工作流

这是一个帮助企业员工直接在企业微信中使用 OpenClaw 完成业务工作流的客户交付项目。企业微信渠道插件基于社区开源版本进行二次开发,以满足客户在身份识别、群聊隔离和 Agent 路由方面的需求;两个业务 Agent 及其对应 Skill 由我设计和实现。

  • 每日报工 Agent:通过文本或语音收集报工信息,完成项目消歧、身份绑定、业务规则校验,以及报工记录的查询、新建和修改。
  • 工作汇报 Agent:把员工输入整理成结构化工作汇报,通过企微群机器人发送并 @ 本人,同时按日期和用户归档、统计汇报情况。
  • 企微插件二次开发:在开源插件基础上增加群聊用户级会话隔离和企微 ID 映射,使不同员工拥有独立 Agent 上下文,并能把企业身份安全传递给业务 Skill。

查看项目架构、工作流和个人贡献说明

当前探索

上述项目让我逐步把关注点从“调用模型生成结果”转向“让 Agent 在真实环境中可靠地完成工作”:包括身份和权限边界、业务规则、上下文隔离、工具执行、证据采集及失败恢复。目前我正在探索一套证据驱动的多 Agent 代码开发系统,让 Planner、Worker、Verifier 和独立 Evaluator 围绕版本化验收标准协作,使 Agent 能够自主完成设计、开发、测试、验证、评估和修正。

About

Config files for my GitHub profile.

Topics

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors