Portfolio · 2026

把模糊需求
做成能跑、能验、能交付
的 AI 应用

我的工作方式(示意)
# 需求进来,先把它变成可验收的东西
$ 定义   目标用户 / 输入输出 / 必须人工确认的环节
$ 拆解   哪些交给 AI 实现,哪些必须我定

# 实现交给工具,判断留给自己
$ AI      Claude Code / Codex 出实现与测试草稿
$ 核对    读实现、跑真实页面、在隔离库跑破坏性测试

# 结论必须有证据,否则不算完成
$ 验收    真实页面操作 + 针对性测试 + 失败样本归因
$ 留痕    指标 → 仓库 eval 结果文件(可逐条复核)
Projects

五个能当面启动的项目

每一个都能在本机一键启动、有真实页面、有可追溯指标。点卡片任意位置进入项目详情(背景 · 我的职责 · 指标与来源 · 取舍与放弃的方案 · 局限)。卡片下方的状态点在本地版会真实探测本机服务——没启动就直说,不做假成功。

Evidence

指标不是形容词,是可复核的数字

下面每个数字都来自仓库里的 eval 结果文件或验收记录。测试集表现不等于生产准确率——这一点我写在每一项的来源里。

0/37
电商后端自动化单测(0 失败)
来源:backend/target/surefire-reports(19+1+8+6+3)
0/28
自愈编排器:检测与正确处理(含盲评)
来源:self-healing-agent/eval/eval_report.json
0/25
客服 Agent:期望自动处理的样本全部成功
来源:customer-service-agent/eval/results.json
0/12
客服 Agent:留出集四项指标 100%
来源:留出集结果(未参与调优)
0/32
编排器:工具调用准确率 96.9%
来源:orchestrator-agent/eval/results.json
0/20
RAG:检索命中(回答 19/20、来源 18/20)
来源:rag-agent/eval/results.json
0
自愈编排器单元测试
来源:仓库单测
0
个可运行项目(本地一键启动)
来源:桌面启动器
How I work

我的工作流程(可复制成标准动作)

这套流程解决的是"AI 说完成了,但东西其实不对"。每一步都有它的产出物,不是口号。

01

需求变验收

先把目标翻译成"什么算通过",写下来再动手。

02

先摸清现状

读真实代码与运行状态,不靠猜;口径冲突先列事实。

03

分工实现

重复实现交给 AI 工具;业务规则、边界、安全由我定。

04

真实页面核对

打开页面亲手点,核对数据与文案;不看产物不算验证。

05

隔离环境测试

破坏性测试只打隔离库;体验数据只读并做指纹核对。

06

归因与留痕

失败样本逐条归因;结论写进提交与验收记录,可复核。

停止条件只有四类:跨模块方案分叉 · 业务规则冲突 · 超出授权 · 实际阻断。普通编码/测试/提交/汇报都不构成停下来等指令的理由。
Real replay

真实案例回放(非实时 AI)

下面每一条都是本机真实运行留下的记录。点问题,看它当时到底怎么走的:调了哪个工具、工具返回了什么、最后说了什么。 有成功的,也有没通过的 —— 我不删没通过的样本。

编排器真实调用 trace点下面的问题,重放当时的执行链路

这些记录从哪来

  • 编排器:本机 /gateway 的真实调用(含 supervisor 决策、工具调用与逐步耗时)
  • 客服工单:评测集 + 一次实时工单调用(收货人/地址已掩码)
  • RAG 政策问答:20 条评测记录(含跨文档那条没做好的)
  • 自愈编排器:看板里 782 条真实 incident 中的一条

为什么不做成"实时试用"?

  • 实时服务需要 24 小时在线的机器,而且每个访客的每次提问都会真实消耗 API 额度
  • 放出去还要防陌生人刷 —— 这是我要先做限流和鉴权隔离的原因,不是偷懒
  • 所以线上先给真实回放;面试现场可以直接开本机真实系统当场操作
Ask me

问一问(离线预置问答)

这一版是明确标注的离线预置答案,不是实时模型——不为演示造假。面试后接独立的本地导览(只读脱敏后的项目资料,不接入个人记忆与执行工具)。

AI
作品集导览(离线)预置答案 · 点击问题即回答

为什么用"离线问答"而不是直接上模型?

  • 可信:给出的每条答案都写死在数据文件里,能被逐条核对,不会现场编。
  • 可解释:它同时演示了"Agent 控制页面"的思路——回答里带跳转,把人带到证据所在页面。
  • 不越界:不接入个人记忆、技能库与执行工具,避免把私有工作流和公司数据混进来。

它可以带你去哪

  • 项目详情页:背景 / 我的职责 / AI 协作部分 / 结果 / 局限
  • 每个指标的来源文件与样本口径
  • 五个项目的本地演示入口(真实服务,不是截图)
Limits

这些项目现在还不是什么

写清楚边界,比写亮点更能说明我知道自己在做什么。

如实说明

  • 都是本地可运行的演示原型,不是生产系统;支付为模拟,无真实资金。
  • 指标来自评测集,样本量有限(客服 59 条 / 编排 32 条 / RAG 20 条 / 自愈 35 场景),不等于线上表现。
  • 代码由 AI 协作实现:我负责需求拆解、方案取舍、验收判据与复验;这一点我从不含糊。
  • 做不动的问题我会写"未解决",而不是用"基本可用"糊过去。

下一步计划

  • 把详情页做得更细:每个项目补"我当时的取舍与放弃的方案"。
  • 接入独立本地导览做实时问答,并用评测集验证它的回答质量。
  • 补齐视觉与移动端体验;是否公开部署会先做安全与脱敏评估。