开发工具
跨 LLM 开发工作流
任务路由、独立审查与可验证交付
将不同模型的规划、分析、实现与独立审查组织为可复用的开发流程,并封装本地 CLI,支持任务路由、隔离工作区与运行证据记录。已用于 JobSignal 修复试点和 LLM Interview Lab 交付,通过明确验收步骤区分模型执行结束与任务真正完成。
本地 CLI 预览 跨模型路由 独立审查
旗舰作品 — JobSignal
简历进,排好序的签证友好职位出。Claude 提取候选人画像,pgvector 在源自 美国劳工部公开备案的职位数据中检索,再由 LLM 重排器为每一条匹配写出书面理由。
线上运行 ingestion 修复已合并 · CI 通过 生产行为验收待完成
软件工程师
"高度匹配:pgvector + LLM 管线经验正对应你们的检索栈;劳工部备案中确认有 H-1B 记录。"
另外两项有完整案例的工作:一个我自己搭建并在用的开发工具,以及实习期间的工程贡献。
开发工具
任务路由、独立审查与可验证交付
将不同模型的规划、分析、实现与独立审查组织为可复用的开发流程,并封装本地 CLI,支持任务路由、隔离工作区与运行证据记录。已用于 JobSignal 修复试点和 LLM Interview Lab 交付,通过明确验收步骤区分模型执行结束与任务真正完成。
本地 CLI 预览 跨模型路由 独立审查
实习工程
为计算机视觉产品建立发布验证
在 TalkMeUp 实习期间为 FreshLens 贡献发布验证工具:确定性 gate 编排、统一的结果格式,以及可复现、可供审查与交接的证据。实习早期负责 YOLOv8 生鲜检测。
编排器已合并 部分材料仍在审查
一个评测案例、一个全栈 SaaS,以及我交付流程中公开的那一半。
一个保守的 LLM 检查:当商品身份对不上时否决价格匹配——错误型号、配件、套装或其他不应混用的商品。确定性规则处理清楚的条件;模型只负责语义判断,不生成价格。上线接入之前,分别测量误杀、漏杀、重复运行稳定性、延迟和费用。
离线评测未生产接入
团队系统 · 我的范围:否决层及其评测
有证据支撑的交付跟踪。把 GitHub 事件与工作项状态关联起来,让进度基于真实发生的事:确定性规则给出结论,AI 负责解释。围绕 OAuth、webhooks、原生工作项与后台处理搭建的全栈 SaaS。已部署预览版,但功能尚未完整;源码反映当前进度。
进行中预览已部署 · 功能未完整
实现与独立审查的角色模板、交付规则、CI 模板,以及运行 AI 辅助交付的经验总结。它是上面工作流公开的可复用模板;CLI 本身是另一个私有预览包。
公开仓库
github.com/RussCTGL/agent-harness-pack ↗把正在学的东西整理成可维护的工具。
自学 AI 基础的学习应用:150 道练习题、16 个模块下的 98 篇知识笔记、严格的多选判分,以及浏览器内进度保存与恢复。发布前经过内容校验和独立审查。内容随站点发布,不在运行时调用 LLM。
llm-interview-lab.vercel.app ↗南加州大学 CS544(应用 NLP)的中英双语笔记,按主题组织,把概念、例子、公式和来源联系起来。依据课程讲义整理并保留署名,不是原创课程。
商品目录匹配的团队课程项目:问题定义、拒识与人工复核、实验设计。暂无训练结果;baseline 与误差分析随后补充。
进行中团队项目
简版。完整版见简历。
FreshLens 用计算机视觉为生鲜打新鲜度分数。我从 YOLOv8 检测开始,最后负责团队的发布验证。
gate 编排器已合并部分材料仍在审查
案例(英文)→用 Django、React、MySQL 搭建全栈电商交易平台,包含认证、商品与交易;设计 REST API,并把系统从本地部署迁移到 AWS(EC2、RDS)并配置 CI/CD。
开发自动处理 Google Sheets 工作流的 AI 机器人,把约两周的人工客户分析压缩为几小时的无人值守批处理。
南加州大学计算机科学硕士,2025 年 8 月 – 2027 年 5 月。课程包括应用自然语言处理(CS544)。
威斯康星大学麦迪逊分校计算机科学学士、数学学士,2022 – 2025。
我近期的大部分工作都借助多个模型的 AI 编码工具完成,所以我的职责是定义需求、审查证据、决定什么可以发布。 最近有一次运行成功退出,但运行证据没有覆盖验收条件。它被标为待验证而不是完成,随后返工。成功退出不等于验收通过。
南加州大学计算机硕士在读,预计 2027 年毕业。求职方向:AI / LLM 工程与全栈开发,尤其是模型输出需要可解释、发布需要可验证的岗位。
0109yizhoulu@gmail.com