Projects
五个能当面启动的项目
每一个都能在本机一键启动、有真实页面、有可追溯指标。点卡片任意位置进入项目详情(背景 · 我的职责 · 指标与来源 · 取舍与放弃的方案 · 局限)。卡片下方的状态点在本地版会真实探测本机服务——没启动就直说,不做假成功。
Evidence
指标不是形容词,是可复核的数字
下面每个数字都来自仓库里的 eval 结果文件或验收记录。测试集表现不等于生产准确率——这一点我写在每一项的来源里。
0/37
电商后端自动化单测(0 失败)
来源:backend/target/surefire-reports(19+1+8+6+3)
0/28
自愈编排器:检测与正确处理(含盲评)
来源:self-healing-agent/eval/eval_report.json
0/25
客服 Agent:期望自动处理的样本全部成功
来源:customer-service-agent/eval/results.json
0/12
客服 Agent:留出集四项指标 100%
来源:留出集结果(未参与调优)
0/32
编排器:工具调用准确率 96.9%
来源:orchestrator-agent/eval/results.json
0/20
RAG:检索命中(回答 19/20、来源 18/20)
来源:rag-agent/eval/results.json
0
自愈编排器单元测试
来源:仓库单测
0
个可运行项目(本地一键启动)
来源:桌面启动器
How I work
我的工作流程(可复制成标准动作)
这套流程解决的是"AI 说完成了,但东西其实不对"。每一步都有它的产出物,不是口号。
01
需求变验收
先把目标翻译成"什么算通过",写下来再动手。
02
先摸清现状
读真实代码与运行状态,不靠猜;口径冲突先列事实。
03
分工实现
重复实现交给 AI 工具;业务规则、边界、安全由我定。
04
真实页面核对
打开页面亲手点,核对数据与文案;不看产物不算验证。
05
隔离环境测试
破坏性测试只打隔离库;体验数据只读并做指纹核对。
06
归因与留痕
失败样本逐条归因;结论写进提交与验收记录,可复核。
停止条件只有四类:跨模块方案分叉 · 业务规则冲突 · 超出授权 · 实际阻断。普通编码/测试/提交/汇报都不构成停下来等指令的理由。
Real replay
真实案例回放(非实时 AI)
下面每一条都是本机真实运行留下的记录。点问题,看它当时到底怎么走的:调了哪个工具、工具返回了什么、最后说了什么。 有成功的,也有没通过的 —— 我不删没通过的样本。
▷
编排器真实调用 trace点下面的问题,重放当时的执行链路
这些记录从哪来
- 编排器:本机 /gateway 的真实调用(含 supervisor 决策、工具调用与逐步耗时)
- 客服工单:评测集 + 一次实时工单调用(收货人/地址已掩码)
- RAG 政策问答:20 条评测记录(含跨文档那条没做好的)
- 自愈编排器:看板里 782 条真实 incident 中的一条
为什么不做成"实时试用"?
- 实时服务需要 24 小时在线的机器,而且每个访客的每次提问都会真实消耗 API 额度
- 放出去还要防陌生人刷 —— 这是我要先做限流和鉴权隔离的原因,不是偷懒
- 所以线上先给真实回放;面试现场可以直接开本机真实系统当场操作
Ask me
问一问(离线预置问答)
这一版是明确标注的离线预置答案,不是实时模型——不为演示造假。面试后接独立的本地导览(只读脱敏后的项目资料,不接入个人记忆与执行工具)。
AI
作品集导览(离线)预置答案 · 点击问题即回答
为什么用"离线问答"而不是直接上模型?
- 可信:给出的每条答案都写死在数据文件里,能被逐条核对,不会现场编。
- 可解释:它同时演示了"Agent 控制页面"的思路——回答里带跳转,把人带到证据所在页面。
- 不越界:不接入个人记忆、技能库与执行工具,避免把私有工作流和公司数据混进来。
它可以带你去哪
- 项目详情页:背景 / 我的职责 / AI 协作部分 / 结果 / 局限
- 每个指标的来源文件与样本口径
- 五个项目的本地演示入口(真实服务,不是截图)
Limits
这些项目现在还不是什么
写清楚边界,比写亮点更能说明我知道自己在做什么。
如实说明
- 都是本地可运行的演示原型,不是生产系统;支付为模拟,无真实资金。
- 指标来自评测集,样本量有限(客服 59 条 / 编排 32 条 / RAG 20 条 / 自愈 35 场景),不等于线上表现。
- 代码由 AI 协作实现:我负责需求拆解、方案取舍、验收判据与复验;这一点我从不含糊。
- 做不动的问题我会写"未解决",而不是用"基本可用"糊过去。
下一步计划
- 把详情页做得更细:每个项目补"我当时的取舍与放弃的方案"。
- 接入独立本地导览做实时问答,并用评测集验证它的回答质量。
- 补齐视觉与移动端体验;是否公开部署会先做安全与脱敏评估。