yc_YUMING CHEN
菜单
← 返回工程足迹浏览项目阅读工程笔记 ↗

ENGINEERING PRACTICE

Yuming Chen

算法工程、后端系统与开发者工具

9 年以上研发经验,做过流体仿真、工业监测、游戏强化学习与 AI 开发工具。我习惯沿着问题把系统做完整:验证算法,开发服务和使用界面,追踪上线后的表现,再根据反馈调整。独立完成过 AI 编程、代码审查和智能体技能分享平台首版的全部组件,并负责上线运营与维护交接。

把模型变成日常工具

AI 编程工具:打通编辑器到模型的整条链路

2023.05—2026.08

业务负责人,独立完成首版全部组件并上线

  • 开发推理服务、聊天界面、语言服务器、上下文引擎与遥测系统,接入 VS Code、IntelliJ 和 Visual Studio,支持补全、上下文问答、代码生成与修改以及 Agent 工作流。
  • 基于 vLLM AsyncEngine 改造推理服务,进行全量微调、LoRA 训练与 GPTQ 量化;搭建在线训练平台,支持 35B 以下模型的全量微调和 LoRA 训练。
  • 2023 年 10 月上线,日服务 700 多名程序员,日均请求超过 20 万次,代码采纳率为 16%~20%。主要以 RTX 3090/4090 运行 7B 级及以下代码模型,键盘输入至补全文本显示的端到端延迟 P99 约 490 ms。
  • 通过链路遥测定位随运行时间增长的补全延迟,找到请求依赖注入中的数据库写入耗时;通过分表、索引优化及调整 aiohttp 请求方式恢复响应速度。

代码审查流水线:让建议带着依据出现

2025.11—2026.08

业务负责人,独立完成首版全部组件并上线

  • 面向使用 SVN 的大型遗留代码库,结合质量分析、代码图谱、语义检索和运行时查证,支持变更总结、审查建议与增量审查,接入 SVN/Jenkins 流水线。
  • 在内部对照评测中,与 Agent 方案相比,在保持查证率的条件下,token 消耗约为六分之一,执行时间约为十分之一。
  • 2026 年 2 月起常态运营,平均每晚处理 5 千多次审查请求,用户采纳率约 9%。已收到的反馈中,正确反馈占比约 76%,计算方式为正确反馈数/反馈总数。
  • 开发反馈分析页面,收集用户操作与评论;独立部署 OpenTelemetry、Prometheus、Grafana、Jaeger,用服务指标和链路追踪定位问题。

智能体技能分享平台:把个人方法交到团队手里

2026.04—2026.08

业务负责人,独立完成首版 CLI、Web、API 与后台服务

  • 使用 Hono、React、PostgreSQL/pgvector 和 RustFS,提供技能注册、版本管理、检索、扫描、分发和实验功能。
  • 实现团队空间、内部 OAuth、跨网络权限、语义检索与链接分享,集成技能扫描器,把查找、检查和共享接进同一使用流程。
  • 2026 年 6 月上线,平台内公开技能超过 200 项,累计分发超过 2 千次;完成向 4 名工程师的运营维护交接。

让算法进入生产流程

游戏智能体与分布式训练

2021 年起

分布式训练系统设计、部署与维护

  • 早期基于 SEED RL,使用约 2 台高性能游戏服务器和 3 台各配备 8 张 RTX 3090 的 GPU 服务器,解决跨机器梯度聚合与数据广播问题。
  • 约 2023 年 5 月开始在代码模型训练平台上接入游戏环境,提供网页训练入口、状态监控、算法调整、统计分析及游戏数据交互。
  • 体育竞技游戏智能体正式上线,上线前依据 Elo、TrueSkill 提供 25 档难度,由运营人员调整使用;另一个回合制项目后续终止。

数值平衡与游戏生产工具

游戏算法与工具研发阶段

算法实现、早期 Demo,以及技术顾问与产品职责

  • 用强化学习监督遗传算法迭代,分析 SLG 武将与技能组合,并提供网页分析工具。使用约一年后终止:策划主要需要设计新资料,系统侧重优化现有组合。后端的数据交互与分析功能迁入智能体训练平台。
  • 负责游戏资源生成的早期模型训练方案、流程设计和编辑器 Demo;担任资源检索、布局生成与优化、横竖屏转换项目的技术顾问和产品负责人。
  • 布局工具支持从参考图生成可编辑 UI 并进行布局审查;横竖屏转换完成引擎内一键转换 Demo。这批工具中,资源相似性检索使用较多,生成功能使用较少。

GPU 资源与生产可观测系统

平台工程

参与资源平台研发,独立部署可观测系统

  • 参与 Kubernetes GPU 云及 GPU device 插件开发,用于接入和管理 GPU 资源。
  • 为 AI 编程与代码审查业务接入 OpenTelemetry、Prometheus、Grafana、Jaeger,结合日志分析请求链路、服务指标和用户行为。

用实验与数据检验判断

流体仿真、风洞实验与工业监测

2016.10—2021.05

工程研究与软件实现

  • 参与风力发电机样机研发与数值仿真,独立设计风洞实验,验证控制与仿真方法;以 SST-DDES 研究垂直轴风轮,检查计算域、网格与时间步长的无关性。
  • 独立完成齿轮箱磨损分类的数据处理、建模、实验与论文工作,署名第二作者、通讯作者。对比决策树、随机森林、k-NN 和 SVM,424 个样本上的分类器平均准确率为 96%。
  • 独立设计、训练和评测采用 DARNN 与 DTSM 的风光功率预测模型;两项相干结构大涡模拟方法及一项功率预测方法均为第一发明人。
  • 主持 1 项基础与应用基础研究项目,另参与 5 项已结题项目;在新能源创业实践中主导物联网管理平台与小程序开发,把设备数据接到监测与管理界面。

把经验写成可复用的接口

lspf:Rust LSP 框架

个人开源

协议生命周期、并发边界与资源释放

  • 针对内部 LSP 实现中的兼容性和并发问题,统一管理服务器与客户端的生命周期、请求和传输接口。按连接限制并发和资源,为入站请求、出站队列设置容量与超时。
  • 实现请求取消与统一关闭流程,回收未完成请求和后台任务。使用真实子进程与并发测试覆盖异常退出、关闭超时、取消与响应竞争、重复关闭及资源释放。
  • 已发布 1.0 系列。完整简历记录的 1.0.2 版本 CI 通过 Linux、Windows、macOS 子进程测试。

banshu-ai:Rust LLM SDK

个人开源

统一流式事件与明确的请求终态

  • 将多种模型服务的文本、推理与工具调用转换为统一流式事件,记录响应状态并处理错误终态;提供超时、有限重试、取消与输出预算配置。
  • 完整简历记录 SDK 已发布 1.1.0。Banshu 仍在开发,Agent core 处于设计阶段。

协作与技术基础

从首版开发到团队维护

2021.05—2026.08
  • 2023 年 11 月起担任游戏算法组组长,2024 年 11 月起兼任 AI 编程技术负责人。独立交付首版后扩充研发团队,离任时共 12 人。
  • 累计辅导 9 名新人,编写 2 门新人课程;自 2022 年起担任专业面试官,每年面试约 100 人。

按问题选择工具

理论与应用力学本科背景
  • Python 用于训练、推理、数据分析与科研建模;TypeScript/JavaScript 用于前后端平台和 IDE 插件;Rust 用于 LSP、LLM SDK 与异步协议接口。
  • 2012—2016 年学习理论与应用力学,使用 C/Fortran 做科学计算,并参与仿生力学实验与仿真。这段训练让我习惯先看假设、边界条件与验证方法。

业务数字来自完整简历中的运营记录;审查对照结果限于内部评测,96% 是论文数据集上的实验结果。详细定义见指标与参考。 指标与参考 ↗