发起并主导 四阶段路线图,使 embedding 模型成为 mlc-ai/mlc-llm 端侧推理引擎的一等公民:OpenAI 兼容 /v1/embeddings serving、TVM-native 运行时与 C++ encoder/decoder 批量 prefill — Apple M1 Pro 上 embedding p50 延迟降低 14×(36s → 2.5s)。共 9 个 PR(6 个已合并)。
王熙景 (Thomas)
Apple Machine Learning Engineer Intern · MLE / MLSys · AI Agent
卡内基梅隆大学 计算机科学学院
卡内基梅隆大学计算机科学学院自动化科学硕士在读。
本科毕业于圣塔克拉拉大学计算机科学专业(算法方向),师从 Dr. Lang Chen,学术导师为 Dr. Nicholas Q. Tran。
研究兴趣:agentic ML workflow、端侧 LLM 推理、ML 系统、全栈智能应用。
Looking for opportunities in On-device ML, MLSys, AI Infrastructure, and AI Agents. Please reach out at xthomaswang@gmail.com.
最新动态
最后更新:2026年8月参与贡献或构建的代表项目:
动态消息
Core ML Tools — LightGBM 到 Core ML 的转换器,支持 Booster、LGBMClassifier 与 LGBMRegressor 模型。
2026 Summer 在 Apple 担任 Machine Learning Engineer Intern(2026.05.11 — 2026.08.21),构建 cellular ML 模型的 agentic end-to-end training workflow,并参与开发 WWDC26 发布的 Call Context,使用端侧 LLM 推理。
论文发表于 Communications Biology — E/I imbalance and internal noise cause weak neural representations and face recognition challenges in ASD。
开源贡献者 apache/tvm — 上游贡献 KV-cache attention kernel 的 masked sequence prefill(encoder valid lengths 与 causal left-padding)及编译器/运行时修复,支撑 MLC-LLM 端侧后端。
正在构建 Localized Agent Harness — 本地优先的智能体 harness,构建渐进式长期记忆系统,并通过 Sleep Model 微调 Embedding 模型。模块化架构(Melo 核心 / Support 支撑 / Test 测试),支持 Ollama、MLC 与 OpenAI 兼容接口。
海报发表于 GenAI4Health @NeurIPS 2025 — The Second Workshop on GenAI for Health: Potential, Trust, and Policy Compliance。San Diego, CA。
在 CMU 担任研究工程师 — 构建基于 RAG 管道和嵌入语义搜索的 AI 生物医学文献分析平台。在多 GPU 上微调 Qwen3 0.6B 嵌入模型,在 PMC-Patients PPR 任务上取得优秀 benchmark。
开始在卡内基梅隆大学计算机科学学院攻读自动化科学硕士学位。获系级 Director's Scholarship。
在圣塔克拉拉大学 LCCN 实验室担任机器学习研究实习生。微调 CNN 和 Vision Transformer 用于神经科学假设验证。构建 fMRI 数据处理和表征分析管道。
上下滚动查看更多动态
工作经历
Machine Learning Engineer Intern @ Apple
2026年5月 — 2026年8月Cupertino, CA
构建 cellular ML 模型训练、评估、Core ML 打包与 iPhone 性能验证的 agentic developer workflow。参与开发 WWDC26 发布的 Call Context,使用端侧 LLM 推理;对比不同推理策略并评估 iPhone 侧的性能权衡。
开源贡献者 @ MLC-LLM & Apache TVM
2026年2月 — 至今远程
发起并主导四阶段路线图,使 embedding 模型成为 MLC-LLM 端侧推理引擎的一等公民:Qwen3-Embedding 转换/量化、OpenAI 兼容 /v1/embeddings serving、TVM-native 运行时与 C++ encoder/decoder 批量 prefill。Apple M1 Pro 上 embedding p50 延迟降低 14×(36s → 2.5s);向 Apache TVM 上游贡献 KV-cache masked prefill 与编译器/运行时修复。
研究工程师(AI Agent) @ 卡内基梅隆大学
2025年7月 — 2025年12月Pittsburgh, PA
构建了 AI 驱动的生物医学文献分析平台,支持快速(<30s)和深度(<=3min)模式,使用 RAG 管道从 PubMed 和 MedRxiv 并行检索。在多 GPU 上微调 Qwen3 0.6B 嵌入模型,在 PMC-Patients PPR 任务上取得优秀 benchmark。海报发表于 NeurIPS 2025 GenAI for Health Workshop。
机器学习工程师实习生 @ LCCN 实验室,圣塔克拉拉大学
2024年6月 — 2024年9月Santa Clara, CA
开发 CNN 模型用于神经科学研究,并为 HPC 工作流预处理 fMRI 数据。论文发表于 Communications Biology;海报被 CogSci 2025 接收。
教育
卡内基梅隆大学
2025年8月 — 2027年5月自动化科学硕士
计算机科学学院 · Pittsburgh, PA
Director's Scholarship圣塔克拉拉大学
2021年9月 — 2025年3月计算机科学理学学士,经济学辅修
文理学院 · Santa Clara, CA
REAL Program Scholar技能
项目
Clinical Copilot — 医学文献分析器
研究基于 RAG 管道的 AI 文献分析系统,从 PubMed 和 MedRxiv 检索。在多 GPU 上微调 Qwen3 0.6B 嵌入模型,在 PMC-Patients PPR 任务上取得优秀 benchmark。海报发表于 NeurIPS 2025 GenAI for Health Workshop。
apache/tvm — 深度学习编译框架
开源贡献Apache TVM 开源贡献者 — 端到端深度学习编译框架。上游贡献 KV-cache attention kernel 的 masked sequence prefill(encoder valid-length masking 与 causal left-padding)及编译器/运行时修复,支撑 MLC-LLM 端侧后端的批量 embedding 推理(3 个 PR 已合并)。
Localized Agent Harness — 本地优先智能体运行框架
开源贡献本地优先的智能体 harness,面向可持续运行、自动化重复工作并理解用户习惯的智能体。模块化架构(Melo 核心层 / Support 支撑层 / Test 测试层),构建渐进式长期个性化记忆系统,并通过 Sleep Model 离线微调 Embedding 模型。本地与 API 双路径执行,支持 Ollama、MLC 与 OpenAI 兼容接口。
mlc-ai/mlc-llm — 端侧大模型部署框架
开源贡献发起并主导四阶段路线图(issue #3451),使 embedding 模型成为 MLC-LLM 端侧推理引擎的一等公民:Qwen3-Embedding 转换/量化、OpenAI 兼容 /v1/embeddings serving、TVM-native 运行时与 C++ encoder/decoder 批量 prefill — 共 9 个 PR(6 个已合并)。Apple M1 Pro 上 embedding p50 延迟降低 14×(36s → 2.5s),并修复 Metal/CPU fallback 路径的 attention scaling 正确性问题。另在 Headache Note iOS 应用中使用该框架实现量化 LLaMA 3 端侧推理。
OpenOT2 — 开源实验室自动化
开源贡献OpenOT2 开源贡献 — 面向 OT-2 液体处理机器人的实验室自动化框架。通过可编程协议实现可重复的科学工作流程。
Headache Note — 离线 iOS AI 助手
软件通过 MLC-LLM 量化 LLaMA 3 1.6B 构建的全离线 iOS AI 助手,针对 iPhone 优化。基于 Swift 的健康助手,使用 prompt engineering 和 SwiftData 实现私密的端侧推理和个性化生活建议。
ASD 面部识别的神经计算基础
研究使用 CNN、ResNet50 和 Vision Transformer 作为计算框架研究 ASD 中的面部识别挑战。构建 fMRI 数据处理管道和 Pearson 相关分析。论文发表于 Communications Biology(Nature Portfolio, 2026);海报被 CogSci 2025 接收。
MasumiRanker — AI Agent 平台(黑客松)
软件AI Agent 发现平台,使用 Sentence Transformers 和 Faiss 实现自然语言语义搜索和高效相似度匹配。FastAPI + SQLAlchemy 后端支持用户评分、推荐日志和 SHA-256 数据完整性验证。
食物识别 iOS 应用
软件基于 MVVM 架构的 SwiftUI iOS 应用,集成 TensorFlow 训练的 CoreML 模型,在 100+ 类别上实现 85% 准确率的食物分类。推理速度提升 4 倍,内存占用减少 40%。
EmojiAndEmotion — 健康追踪应用
软件基于 React Native 和 SQLite 的全栈 iOS 应用。数据查询优化 75%(200ms 降至 50ms)。集成 Apple HealthKit 实时 HRV 指标,准确率 98%。测试覆盖率 90%。
社交网络网站
软件基于 Go Gin 框架的全栈 Web 服务器,RESTful API,JSON 数据库实现高效数据管理,以及可扩展的评论系统。
简历
下载最适合你的版本。