2023.05—2026.08
AI 编程工具
从零打通上下文、推理服务与编辑器,再沿用户请求定位补全延迟。
业务负责人,独立完成首版全部组件并上线
- 开发推理服务、聊天界面、语言服务器、上下文引擎与遥测系统,接入 VS Code、IntelliJ 和 Visual Studio,支持补全、上下文问答、代码生成与修改以及 Agent 工作流。
- 基于 vLLM AsyncEngine 改造推理服务,进行全量微调、LoRA 训练与 GPTQ 量化;搭建在线训练平台,支持 35B 以下模型的全量微调和 LoRA 训练。
- 2023 年 10 月上线,日服务 700 多名程序员,日均请求超过 20 万次,代码采纳率为 16%~20%。主要以 RTX 3090/4090 运行 7B 级及以下代码模型,键盘输入至补全文本显示的端到端延迟 P99 约 490 ms。
- 通过链路遥测定位随运行时间增长的补全延迟,找到请求依赖注入中的数据库写入耗时;通过分表、索引优化及调整 aiohttp 请求方式恢复响应速度。