Skip to content
View zzudongxiang's full-sized avatar
🌐
Focusing
🌐
Focusing

Highlights

  • Pro

Block or report zzudongxiang

Block user

Prevent this user from interacting with your repositories and sending you notifications. Learn more about blocking users.

You must be logged in to block users.

Content in all repositories owned by your account will be closed.
Maximum 250 characters. Please don’t include any personal information such as legal names or email addresses. Markdown is supported. This note will only be visible to you.
Report abuse

Contact GitHub support about this user’s behavior. Learn more about reporting abuse.

Report abuse
zzudongxiang/README.md

张栋祥 · 个人简历

研究方向

  • 面向国产 NPU 万卡集群的大模型训练与推理系统级协同优化,以及面向“鹏城云脑 III”智算中心的软硬件协同设计与工程落地。
  • 高性能集合通信:围绕昇腾 910C SIO/HCCS 分层互联与 Die-to-Die 直连架构,设计高带宽、可扩展的集合通信算法与通信优化方案。
  • 功耗建模与能效优化:面向大模型训练/推理负载的细粒度功耗建模、能效度量体系构建与集群级能效协同优化。
  • 资源受限下的推理质量控制:大模型量化部署、访存友好的数据布局优化,以及能效约束下的词元级多模型协同推理。
  • 大规模训练仿真与性能工程:万卡级并行策略分析、性能预测工具链建设与国产集群性能摸底方法学。

工作经历

云脑博士后 | 鹏城实验室

2026.08 ~ 至今

  • 入职“鹏城云脑”网络智能重大科技基础设施团队,继续围绕国产 NPU 万卡集群开展大模型训练与推理的系统级优化研究,重点推进高性能集合通信、功耗建模与能效优化等已有成果的工程化落地与规模验证。

多媒体研发工程师 | 展讯半导体(南京)有限公司

2021.07 ~ 2022.07

  • 负责 Android 平台 Camera IP 的软件设计、功能开发、系统集成与技术支持工作,专项负责 Camera 相关的功耗、性能与深度优化,并积极参与技术难题攻关,分析并处理复杂系统问题。独立承担多媒体领域的需求分析、架构分析和方案设计,确保软件方案满足产品规格与性能目标。因在新项目中表现出色,荣获 2021 年度《优秀新人》称号。

教育背景

华南理工大学 | 博士研究生 未来技术学院

2022.08 ~ 2026.06

  • 华南理工大学与鹏城国家实验室联合培养博士生。
  • 鹏城国家实验室智能计算研究部,主要研究方向为 AI 大模型训练并行加速算法、高性能网络通信、软硬件协同设计。

南京大学 | 项目合作 现代工程与应用科学学院

2020.07 ~ 2021.01

  • 参与袁洪涛教授组内多个科研项目,并提供支持,并参与部分实验项目设计。

郑州大学 | 本科 & 硕士

2014.09 ~ 2021.06

  • 本科(电子科学与技术专业):C/C++、MATLAB、数字信号系统、模拟电子技术基础、数字电子技术基础、单片机原理、微机原理等。
  • 硕士(仪器仪表工程专业):数字图像处理、现代数字信号处理、现代传感技术、数值分析、机器视觉、现代光电测试技术等。
  • 学习成绩优异,多次获得校一等奖学金、优秀学生干部等荣誉称号,综合学习成绩排名前 10% 左右。

科研成果

论文发表

  1. Dongxiang Zhang, et al. “Synchronized Dual-Ring: A Synergistic Algorithm for Bandwidth-Efficient Collective Communication Leveraging Die-to-Die Direct Interconnects.” In IEEE International Parallel and Distributed Processing Symposium (IPDPS), 2026.
  2. Dongxiang Zhang, et al. “A DUAL-PATH APPROACH TO OPTIMIZING LLMS: ENTROPY CONSTRAINT FOR EXPLOITATION AND NEURAL PERTURBATION FOR EXPLORATION.” In IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026.
  3. Dongxiang Zhang, et al. “NPUPower: A Fine-Grained Power Modeling and Optimization Framework for Large-Language Model Training on Ascend NPUs.” In IEEE Transactions on Parallel and Distributed Systems (TPDS), 2026.
  4. Yijia Zhang, Dongxiang Zhang, et al. “TOKCOINFER: TOKEN-LEVEL MULTI-MODEL COLLABORATION FOR ENERGY-EFFICIENT LLM INFERENCE.” In IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026.
  5. Yijia Zhang, Dongxiang Zhang, et al. “Improving the Energy Efficiency of AI Clusters Through Variability-Aware Frequency Scaling and Task Allocation.” In Proceedings of the 25th International Conference on Algorithms and Architectures for Parallel Processing (ICA3PP 2025), Zhengzhou, China, October 30 - November 02, 2025.
  6. Yijia Zhang, Dongxiang Zhang, et al. “AUE: A Normalized Energy Efficiency Metric for AI Servers under LLM Workloads.” In 2025 IEEE 31st International Conference on Parallel and Distributed Systems (ICPADS 2025), Hefei, China, December 14 - 17, 2025.

发明专利

  1. 张栋祥, 张士勋, 李雪宁 等. 双环路芯片结构、集合通信方法、装置、设备和存储介质. CN120780647A[P]. 2025-08-28.
  2. 张栋祥, 张士勋, 张尔焜 等. 针对大模型参数的数据处理方法、装置、设备以及介质. CN120806000A[P]. 2025-09-12.
  3. 章弋嘉, 张栋祥, 王丙强 等. 大模型并行训练场景下的功耗预测方法以及相关设备. CN120822038A[P]. 2025-10-21.
  4. 章弋嘉, 张栋祥, 王丙强 等. 通信能效优化方法、装置、设备和存储介质. CN121151301A[P]. 2025-12-16.
  5. 田永鸿, 张士勋, 王丙强, 张栋祥 等. 数据传输方法、装置、存储介质及计算机设备. CN119011512A[P]. 2025-01-07.
  6. 田永鸿, 张士勋, 王丙强, 张栋祥 等. 一种智能计算系统架构. CN119204130A[P]. 2025-02-18.

科研经历

“鹏城云脑”网络智能重大科技基础设施项目(国家重大科技基础设施)

2022-09 ~ 2025-05

  • 核心职责:负责国产“鹏城云脑 III”大规模 NPU 集群的系统优化与通信算法设计,围绕昇腾 910C 芯片的 SIO/HCCS 分层互联架构开展高性能集合通信研究。
  • 设计面向 Die-to-Die 直连互联的同步双环/双环类集合通信算法,协同利用 SIO 与 HCCS 链路,在 4 到 128 NPU 规模下较官方 HCCL 平均通信带宽提升 9.15% 到 15.81%;在万亿参数模型训练评估中的暴露通信占比由 51.05% 降至 34.19%,端到端性能提升最高达 34.35%。
  • 主导昇腾 910B/910C 集群性能摸底与瓶颈定位,围绕矩阵计算、NPU-CPU 通信、统一编址、跨超节点扩展等关键路径,为硬件和驱动团队提供底层测试数据与优化依据。
  • 开发大规模训练仿真工具原型,并完成 NS3-RDMA 插件迁移,为万卡级并行策略分析与性能预测提供工具支撑。

万亿级大模型高效训练与推理平台研发(广东省重点领域研发计划)

2024-12 ~ 2026-06

  • 核心职责:负责国产算力平台上的大模型训练与推理全栈优化,聚焦显存墙、推理吞吐、部署精度与系统能效的协同设计。
  • 研究并落地 Llama2、DeepSeek-V3、Qwen3 等模型在昇腾 910C 上的混合并行与量化部署方案,完成 DeepSeek 的 INT4/INT8 量化实现与精度评测,将 INT4 量化精度损失控制在 5.6% 以内。
  • 围绕推理能效与质量约束开展系统优化研究,设计词元级多模型协同推理 TokCoInfer,在生成 2k 长文本时实现系统级能耗下降 31%,显存峰值增幅不足 10%,体现出较强的工程应用价值。
  • 设计“量化数据元数据原子块(QDMAB)”数据结构,针对分块量化矩阵推理过程中的访存瓶颈优化数据布局,减少非合并访存并提升带宽利用率,相关成果已申请发明专利。

Pinned Loading

  1. DeepSeek-V3-for-Ascend DeepSeek-V3-for-Ascend Public

    DeepSeek-V3 for Ascend

    Python 1

  2. astrasim astrasim Public

    ASTRA-sim 是一个分布式机器学习系统模拟器。它可以系统地研究现代深度学习系统所面临的挑战,探索瓶颈问题,并为未来不同平台上开发大型 DNN 模型提供高效的方法。

    8 3

  3. Introduction_to_Parallel_Computing Introduction_to_Parallel_Computing Public

    Introduction to Parallel Computing翻译及学习笔记

    6

  4. ns3-rdma ns3-rdma Public

    Forked from nsnam/ns-3-dev-git

    GitHub read-only mirror of ns-3-dev repository, will be kept in sync with main GitLab.com repository. Please DO NOT file pull requests here; instead, file issues and merge requests at https://gitla…

    C++

  5. ascend.cl ascend.cl Public

    华为集合通信性能测试

    C++ 16 1

  6. SerialPort.Image SerialPort.Image Public

    自定义串口通信协议实现STM32采集的图像串口显示

    C 8