面向大模型数据准备的可组合数据流水线与工作流系统,覆盖数据生成、清洗、评估与编排。
项目负责人及核心贡献者,协调 10 余名同学推进系统设计、开发、代码审查、集成与发布;工程工作覆盖流水线编译与执行、Operator 与 Registry 设计、存储、服务、CLI 工具及 RayOrch 集成。
马晓晨,香港科技大学计算机科学与工程学系博士生,师从袁彬航教授和张文涛教授。主要研究大语言模型数据基础设施(Data Infra)与高性能分布式系统,关注面向大规模 LLM 数据准备的系统设计与性能优化,包括构建易使用、易分发、易复现的数据算子管理系统,以及基于 Ray 和 Apache Spark 的高性能数据处理。此前的研究还包括 Data-centric AI 数据准备系统、图像取证,主要涉及图像篡改检测与定位。
攻读博士学位前,曾于 2025 年 1 月至 2026 年 1 月在北京大学任研究助理,师从张文涛教授,从事大语言模型数据准备系统;2023 年 7 月至 2024 年 6 月在四川大学任全职研究助理,师从周吉喆教授,研究图像篡改检测技术。
2023 年 6 月本科毕业于四川大学计算机学院,获得计算机科学与技术工学学士学位。本科毕业论文获评优秀本科毕业论文。
面向大模型数据准备的可组合数据流水线与工作流系统,覆盖数据生成、清洗、评估与编排。
项目负责人及核心贡献者,协调 10 余名同学推进系统设计、开发、代码审查、集成与发布;工程工作覆盖流水线编译与执行、Operator 与 Registry 设计、存储、服务、CLI 工具及 RayOrch 集成。
面向图像篡改检测与定位的模块化训练评测代码库与综合基准。
共同第一作者、代码库设计者与主要开发者;负责模块化训练评测框架设计,并持续维护指标、模型库、CLI、打包发布与测试。
基于 Ray 的 MinerU 加速层,将 PDF-to-Markdown 解析升级为可扩展的多 GPU、多节点数据流水线。
项目发起与核心开发;完成初始工程与发布流程,并将串行阶段重构为支持跨阶段重叠的异步流水线,同时维护性能基准与兼容性。
面向异步 Ray 流水线的轻量编排库,提供 RayModule、微批重叠执行与 DAG 调度能力。
项目发起与核心开发;搭建编排抽象与多模型示例,持续完善 RayModule 和流水线执行器,并将 RayOrch 集成至 DataFlow 的并行算子执行路径。
会议审稿:AAAI'27、ICLR'27、NeurIPS'26、BMVC'26、ECCV'26、CVPR'26、ICLR'26、AISTATS'26、AAAI'25、NeurIPS'25、ICCV'25、ICML'25、CVPR'25、ICLR'25、AISTATS'25、NeurIPS'24、ACM MM'24。
计算机科学与工程博士, 预计 2028 年
香港科技大学
计算机科学与技术工学学士, 2023 年
四川大学