AI EVALUATION / TEST DEVELOPMENT
王鹤翔
大模型评测开发工程师
把复杂的 AI 表现拆成可度量的指标,把一次测试沉淀为可重复的工程能力。 聚焦智能语音全链路、评测数据构建、自动化执行与结果分析。
较早期提升
体系化覆盖
测试效率提升
高优缺陷闭环
01 / 关于我
让模型质量
成为工程结果。
测试的价值不只在发现 Bug,更在于把不确定的问题转化为可信证据,推动它被定位、修复并沉淀为长期能力。
目前在小鹏汽车负责智能座舱语音 NLU 模型测试与质量保障,工作横跨模型效果、测试工具、线上数据、自动化平台和版本质量决策。
我习惯从真实用户场景出发,用数据定位、用工具提效、用流程闭环。目标不是交付一份结论,而是交付一套下次仍然可靠的评测能力。
02 / 岗位匹配
面向大模型评测的
四类核心能力
围绕框架、数据、执行与报告建设完整评测链路,匹配大模型评测开发岗位的关键职责。
评测框架与平台
以 Python 为核心搭建测试框架、Mock 能力和持续执行流水线,把零散脚本变成可复用平台。
- FastAPI / Pytest / Allure
- Redis / MySQL / Jenkins
- 链路埋点与自动校验
评测数据构建
融合产品基线、线上回流、边界场景与模型泛化样本,形成能解释质量变化的数据集合。
- 500+ 语义交互场景
- LLM 辅助用例生成
- KL 散度一致性评估
任务执行与监控
串联语音生成、录音、上传、ASR、多轮上下文与评测执行,保障长链路任务稳定恢复。
- 异常补跑与 pending 扫描
- 并发控制与结果重建
- 批量任务恢复率 100%
分析与质量报告
区分业务失败与执行失败,通过 Root Cause 分析、指标看板和结构化报告支撑版本验收。
- Metabase 质量看板
- Excel / HTML / PDF 报告
- 算法与研发协同闭环
03 / 工作经历
在真实业务里
验证质量。
从 TTS 测试工具到车载语音 NLU 质量 Owner,持续将测试方法转化为工程资产。
小鹏汽车
测试工程师
独立负责智能座舱语音 NLU 模型测试与质量保障,搭建标准化语义测试流程、自动化工具链和质量看板。
- 27%推动模型多轮迭代,整体通过率较早期提升。
- 35%结合用户数据回流与 KL 散度一致性评估,提升隐性缺陷识别率。
- 3 → 1 天自主开发链路埋点、Mock 与自动校验工具,将测试周期缩短。
- 10+ 需求构建 Metabase 看板,持续展示通过率、失败分布与迭代趋势。
科大讯飞
AI 实习测试工程师
参与 TTS 自动化脚本重构、测试用例建设和核心模型版本集成验证,完善语音合成质量评估体系。
- 测试重构清理冗余逻辑,提升脚本复用率与执行稳定性。
- 完整覆盖覆盖边界、性能、功能和主观效果评估。
- 20%开发基于 Prompt 的用例生成模块,提升语义驱动覆盖率。
04 / 核心项目
评测能力,
必须能够重复运行。
NLU / 多轮交互 / 自动化平台
智能化场景下的 NLU 自动化测试
担任智能化需求云端测试 Owner,为自主思考、多轮确认和动作调整场景建立多车型、多终端的稳定质量保障体系。
框架建设
基于 Python、Allure、Redis、MySQL 与 Feishu SDK 构建自动化框架,支持 Mock 数据、链路监控、断点续跑和 Jenkins 持续执行。
质量推进
联合算法、研发、产品制定测试指标与场景基线,对语义失败和动作异常进行 Root Cause 分析,推动版本闭环。
项目结果
累计推动修复 200+ 高优缺陷;报告自动化减少 70%+ 重复工作量;长链路稳定运行接近 100%。
VOICE / EVAL / RESULT
端到端语音评测框架
围绕 voice → eval → result 搭建可重复执行的测试闭环,支撑语音助手场景的工程化评测与版本验收。
长链路治理
串联 TTS、录音、上传、ASR、多轮上下文与评测执行,并规范样本生成和落盘格式。
稳定性设计
拆分在线生成与离线评测,补齐 pending 扫描、并发控制、异常补跑和结果重建。
可信结论
区分业务失败与执行失败,结构化沉淀 Excel、中文测试报告与图表,避免统计口径污染。
HOW I WORK
从真实问题
到质量闭环
- 01定义问题
确认场景、边界、前置条件与预期结果。
- 02构建数据
组合基线、泛化、负例、线上回流与历史问题。
- 03自动执行
通过回放、参数匹配、监控与断言规模化验证。
- 04分析闭环
聚类 Failcase,区分根因并沉淀回归资产。
05 / 技术能力
技术栈服务于
评测交付。
工具不是孤立清单,而是从数据输入、任务执行到结论输出的一条完整链路。
语言与数据
面向大规模测试数据完成清洗、匹配、抽样、统计和结果回填。
- Python
- Pandas
- SQL
- JSON / JSONL
- OpenPyXL
接口与自动化
构建文本、多轮对话、Mock 与任务上报链路,支持端到端校验。
- HTTP / HTTPS
- WebSocket
- FastAPI
- Pytest
- Allure
平台工程
让脚本能力服务化、持久化,并接入持续执行与可视化平台。
- Linux
- Docker
- Jenkins
- MySQL
- Redis
- Metabase
AI 与语音评测
理解智能语音全链路和 LLM 应用模式,使用明确口径判断模型输出。
- ASR / NLU / NLG / TTS
- LLM Eval
- Prompt
- Agent / Workflow
- Failcase 分析
06 / 教育背景
工程研究训练,
形成验证思维。
对变量、边界、证据与验证的敏感度,是我拆解复杂系统、判断测试结论是否可信的基础。
上海大学
硕士研究生
上海应用技术大学
本科