IMMORTAL ← 回到首页

01 / 个人履历

让声音,稳定地抵达。

这不是一份在线简历,而是一张工作脉络图:我怎样从图像算法走进语音系统,又怎样把模型能力变成可以持续运行、持续迭代的基础设施。

NOW / STEPFUN

把语音模型,放进真实的交互里。

从 2025 年 8 月起,我在 StepFun 做 AI Infra,围绕 StepAudio 系列负责语音推理服务。我的工作介于模型和线上系统之间:让能力被正确接入、编排和观测,也让它能够稳定地面对真实请求。

TTSVOICE OUT

让文字变成声音

围绕 StepAudio 系列,承接文本到语音能力的服务化与持续迭代。

ASRVOICE IN

让流式识别进入在线链路

处理语音输入、会话状态和推理服务之间的真实工程约束。

VADBOUNDARY

让系统听懂何时开始

为识别、对话和实时交互提供清晰、可靠的语音活动边界。

REALTIMESESSION

让能力进入持续交互

串联输入、推理与输出,把多个语音模块编排成一段完整会话。

CAREER TIMELINE

StepFun · AI Infra Engineer

围绕 StepAudio 系列负责 TTS、ASR、VAD 与 Realtime 等语音推理服务,从模型接入、服务编排到性能与稳定性,让语音能力进入可持续迭代的线上系统。

IFLYTEK (Shanghai) · Research Algorithm Engineer

围绕多语种 TTS、音色转换和语音大模型,把算法工作延伸到流式推理、并发调度、低时延部署与端侧适配。也是在这里,我开始真正理解一项语音能力要经过多少工程环节才能抵达用户。

Deptrum · Image Algorithm Engineer

从训练数据采集处理工具到人脸算法 SDK,参与图像流水线集成、性能分析和自动化验证。第一段职业经历让我看到,工具和流程本身也会决定算法团队迭代的速度。

UESTC · Software Engineering

以软件工程为起点,从 C/C++、Python 和系统基础出发,后来一路走到模型部署、推理服务与 AI Infra。

PATENT / INTELLECTUAL PROPERTY

一种发音预测方法及相关装置

第一发明人独立完成方案设计、代码实现与专利文本撰写。查看公开专利记录 ↗

PROJECT SIGNAL × CORE STACK

技术不是清单,
是做过的事留下的路径。

项目先讲问题与系统,技术随后出现。这里只连接已经确认的核心关系;其他能力留在跨项目工程底座,不为画面完整而猜测归属。

ENGINEERING LENS

在模型和系统之间工作。

01END TO END

模型只是起点

真正的交付还包括协议、资源、调度、观测以及每一个失败边界。

02REALTIME

延迟是一整条链路

一次实时交互的体感,来自输入、分片、推理、编排和输出的总和。

03RELIABILITY

让失败可以被看见

比起隐藏错误,我更关心让边界、状态和异常变得可观测、可解释。

04EVOLUTION

给下一版模型留空间

好的基础设施不只服务今天,也要让明天的模型接入更快、迭代更轻。