AI EVALUATION / TEST DEVELOPMENT

王鹤翔

大模型评测开发工程师

把复杂的 AI 表现拆成可度量的指标,把一次测试沉淀为可重复的工程能力。 聚焦智能语音全链路、评测数据构建、自动化执行与结果分析。

  • 当前 小鹏汽车|测试工程师
  • 教育 上海大学|硕士研究生
  • 所在 上海|开放新机会
王鹤翔的职业照片
从数据到结论 DATA × ENGINEERING
27% NLU 模型整体通过率
较早期提升
500+ 语义交互场景
体系化覆盖
3 倍 自动化工具链
测试效率提升
200+ 线上与线下
高优缺陷闭环

01 / 关于我

让模型质量
成为工程结果。

测试的价值不只在发现 Bug,更在于把不确定的问题转化为可信证据,推动它被定位、修复并沉淀为长期能力。

目前在小鹏汽车负责智能座舱语音 NLU 模型测试与质量保障,工作横跨模型效果、测试工具、线上数据、自动化平台和版本质量决策。

我习惯从真实用户场景出发,用数据定位、用工具提效、用流程闭环。目标不是交付一份结论,而是交付一套下次仍然可靠的评测能力。

智能语音 LLM 评测 测试开发 数据工程 质量闭环

02 / 岗位匹配

面向大模型评测的
四类核心能力

围绕框架、数据、执行与报告建设完整评测链路,匹配大模型评测开发岗位的关键职责。

01

评测框架与平台

以 Python 为核心搭建测试框架、Mock 能力和持续执行流水线,把零散脚本变成可复用平台。

  • FastAPI / Pytest / Allure
  • Redis / MySQL / Jenkins
  • 链路埋点与自动校验
02

评测数据构建

融合产品基线、线上回流、边界场景与模型泛化样本,形成能解释质量变化的数据集合。

  • 500+ 语义交互场景
  • LLM 辅助用例生成
  • KL 散度一致性评估
03

任务执行与监控

串联语音生成、录音、上传、ASR、多轮上下文与评测执行,保障长链路任务稳定恢复。

  • 异常补跑与 pending 扫描
  • 并发控制与结果重建
  • 批量任务恢复率 100%
04

分析与质量报告

区分业务失败与执行失败,通过 Root Cause 分析、指标看板和结构化报告支撑版本验收。

  • Metabase 质量看板
  • Excel / HTML / PDF 报告
  • 算法与研发协同闭环

03 / 工作经历

在真实业务里
验证质量。

从 TTS 测试工具到车载语音 NLU 质量 Owner,持续将测试方法转化为工程资产。

上海

小鹏汽车

测试工程师

智能座舱 / 语音 NLU

独立负责智能座舱语音 NLU 模型测试与质量保障,搭建标准化语义测试流程、自动化工具链和质量看板。

  • 27%推动模型多轮迭代,整体通过率较早期提升。
  • 35%结合用户数据回流与 KL 散度一致性评估,提升隐性缺陷识别率。
  • 3 → 1 天自主开发链路埋点、Mock 与自动校验工具,将测试周期缩短。
  • 10+ 需求构建 Metabase 看板,持续展示通过率、失败分布与迭代趋势。
实习

科大讯飞

AI 实习测试工程师

TTS / 测试工具

参与 TTS 自动化脚本重构、测试用例建设和核心模型版本集成验证,完善语音合成质量评估体系。

  • 测试重构清理冗余逻辑,提升脚本复用率与执行稳定性。
  • 完整覆盖覆盖边界、性能、功能和主观效果评估。
  • 20%开发基于 Prompt 的用例生成模块,提升语义驱动覆盖率。

04 / 核心项目

评测能力,
必须能够重复运行。

PROJECT 01
10 倍+Mock 数据生产效率

NLU / 多轮交互 / 自动化平台

智能化场景下的 NLU 自动化测试

担任智能化需求云端测试 Owner,为自主思考、多轮确认和动作调整场景建立多车型、多终端的稳定质量保障体系。

框架建设

基于 Python、Allure、Redis、MySQL 与 Feishu SDK 构建自动化框架,支持 Mock 数据、链路监控、断点续跑和 Jenkins 持续执行。

质量推进

联合算法、研发、产品制定测试指标与场景基线,对语义失败和动作异常进行 Root Cause 分析,推动版本闭环。

项目结果

累计推动修复 200+ 高优缺陷;报告自动化减少 70%+ 重复工作量;长链路稳定运行接近 100%。

PythonRedisMySQLAllureJenkinsMock
PROJECT 02
一晚完成原本数天的结果交付

VOICE / EVAL / RESULT

端到端语音评测框架

围绕 voice → eval → result 搭建可重复执行的测试闭环,支撑语音助手场景的工程化评测与版本验收。

样本生成 语音链路 批量评测 结果重建 报告交付

长链路治理

串联 TTS、录音、上传、ASR、多轮上下文与评测执行,并规范样本生成和落盘格式。

稳定性设计

拆分在线生成与离线评测,补齐 pending 扫描、并发控制、异常补跑和结果重建。

可信结论

区分业务失败与执行失败,结构化沉淀 Excel、中文测试报告与图表,避免统计口径污染。

HOW I WORK

从真实问题
到质量闭环

  1. 01定义问题

    确认场景、边界、前置条件与预期结果。

  2. 02构建数据

    组合基线、泛化、负例、线上回流与历史问题。

  3. 03自动执行

    通过回放、参数匹配、监控与断言规模化验证。

  4. 04分析闭环

    聚类 Failcase,区分根因并沉淀回归资产。

05 / 技术能力

技术栈服务于
评测交付。

工具不是孤立清单,而是从数据输入、任务执行到结论输出的一条完整链路。

01

语言与数据

面向大规模测试数据完成清洗、匹配、抽样、统计和结果回填。

  • Python
  • Pandas
  • SQL
  • JSON / JSONL
  • OpenPyXL
02

接口与自动化

构建文本、多轮对话、Mock 与任务上报链路,支持端到端校验。

  • HTTP / HTTPS
  • WebSocket
  • FastAPI
  • Pytest
  • Allure
03

平台工程

让脚本能力服务化、持久化,并接入持续执行与可视化平台。

  • Linux
  • Docker
  • Jenkins
  • MySQL
  • Redis
  • Metabase
04

AI 与语音评测

理解智能语音全链路和 LLM 应用模式,使用明确口径判断模型输出。

  • ASR / NLU / NLG / TTS
  • LLM Eval
  • Prompt
  • Agent / Workflow
  • Failcase 分析

06 / 教育背景

工程研究训练,
形成验证思维。

对变量、边界、证据与验证的敏感度,是我拆解复杂系统、判断测试结论是否可信的基础。

上海大学

硕士研究生

上海应用技术大学

本科