NewYour coding agent can read the release notes before it upgrades.Set up the MCP server →
PyPI · #4103 most downloaded on PyPI
Parallel Distributed Deep Learning
Last release 6 months ago
24 Mar 2026
Ships fairly regularly
a new release about every 2 months
Most releases are documented
notes for 7 of 10 stable releases
Nothing withdrawn
no release was ever pulled
6 years old
13 releases · first in 2020
One column per quarter.
[Cherry Pick | Pipeline Parallel] Merge PaddleFleet Pipeline Parallel…
[Cherry Pick | Pipeline Parallel] Merge PaddleFleet Pipeline Parallel…
飞桨框架 3.3 版本在大模型训练效率、开发体验及国产硬件适配等关键领域持续突破创新,在计算显存高效利用、训推衔接转换、生态兼容性、调试效率、国产硬件适配等方面带来多项重要升级,全面提升大模型训推能力。
飞桨框架 3.3 版本在大模型训练效率、开发体验及国产硬件适配等关键领域持续突破创新,在计算显存高效利用、训推衔接转换、生态兼容性、调试效率、国产硬件适配等方面带来多项重要升级,全面提升大模型训推能力。
针对大模型预训练、后训练与推理阶段中,因分布式策略及组网差异导致的权重转换困难,飞桨FlexCheckpoint机制创新提出高效的权重重组方法与灵活的模型编辑原语AOA,为模型研发到生产全流程提供高效、统一的分布式参数转换与重组支持。该机制全面适配训推衔接、跨策略断点续训、生态兼容格式加载导出、强化学习参数同步等多种场景下的权重转换需求,并在大参数规模场景下实现超越Megatron-LM 1.2倍以上的转换性能,从根本上解决了分布式参数转换成本高、效率低的难题。
在显存管理方面,针对MoE模型因专家路由动态性导致的显存碎片率高、资源浪费严重等问题,本版本推出了基于虚拟内存管理技术的高性能VMM Allocator。该分配器可在模型运行期间根据系统显存使用情况,动态自适应执行碎片整理,显著提升显存利用效率。
飞桨3.3版本持续深耕自动并行与AI编译器技术。在自动并行架构中新增对FSDP等策略的支持,并增强了动态Shape流水线并行功能;面向科学计算场景,实现了对高阶导数的支持,并拓展了相关算子切分推导规则的覆盖范围,进一步提升了自动并行架构的通用性与易用性。此外,围绕推理场景,优化了AI编译器CINN及动转静SOT功能,显著提升易用性与执行调度性能。
新特性
功能增强
性能优化
Bug 修复
为突破大模型注意力掩码计算复杂度高、存储占用大导致的训练效率瓶颈,飞桨持续优化并打磨自主创新的列式稀疏注意力掩码计算技术FlashMask。Paddle 3.3新升级的FlashMask V3版本首次提出前向持久化抢占式Tile调度器(Persistent Preemptive Tile Scheduler,PPT),实现 GPU 流式多处理器(SM)间的计算负载均衡,并原生支持长文本上下文并行下的复杂掩码注意力计算,全面强化长文训练能力,在多种掩码模式下实现训练性能质的飞跃:相比上一版本性能最高提升超过 1.4 倍,全面超越FlexAttention,单卡性能最高领先FlexAttention 达 2.1 倍,分布式性能最高领先Megatron-LM 分布式实现版本 80%。除FlashMask外,Paddle 3.3版本对主流MoE模型的高频算子kernel进行了专项精度优化,并增强stride、超大Tensor等场景的支持能力,大幅改进框架算子在超大规模模型训练场景的数值精度、稳定性和健壮性。
新特性
功能增强
性能优化
Bug 修复
全面提升生态兼容性,支持在paddle框架中无缝衔接和使用外部生态算子,并推出paddle.compat系列API,包含paddle.compat.nn.Linear、paddle.compat.nn.MultiheadAttention等近10个功能模块,降低飞桨模型接入外部生态模块的成本。优化动态图调试体验,新增前反向计算图可视化功能,构建了API、Tensor与GradNode的统一命名关联体系并支持导出调用栈与MD5校验信息,同时对关键路径日志进行治理并新增局部日志打印功能,特别针对PyLayer嵌套场景显著提升报错信息精准度与日志层级可读性,实现调试信息的丰富度和获取便捷性的提升。新增显存观测功能,直观展示显存池中各个内存块的分布情况,并支持追踪特定代码段的显存申请/释放与全局状态,实现对大模型显存异常的精准定位与高效治理。
新特性
Note truncated.
飞桨框架3.2.2版本在分布式并行、算子机制、硬件适配三个方面完成多项优化与升级,进一步提升框架性能与稳定性。
飞桨框架3.2.2版本在分布式并行、算子机制、硬件适配三个方面完成多项优化与升级,进一步提升框架性能与稳定性。
qw86972190, xingmingyyj, zhangbo9674, zhangyuqin1998
PaddlePaddle Framework version 3.2.2 features multiple optimizations and upgrades across Distributed Parallelism, Operator Mechanism, and Hardware Adaptation to further enhance the framework's performance and stability.
qw86972190, xingmingyyj, zhangbo9674, zhangyuqin1998
Nothing published for this version
飞桨框架3.2版本在大模型训练推理性能、硬件适配、主流大模型及高性能加速库的支持上进一步提升。
飞桨框架3.2版本在大模型训练推理性能、硬件适配、主流大模型及高性能加速库的支持上进一步提升。
paddle.msort、paddle.ravel、paddle.nn.functional.dropout1d、paddle.Tensor.type_as、paddle.Tensor.requires_grad、paddle.view_as_complex、paddle.view_as_real、paddle.nn.Parameter、paddle.broadcast_shapes、paddle.range、paddle.as_tensor、paddle.scatter_reduce/scatter_reduce_、paddle.scatter_add、paddle.tensor、paddle.softmax、paddle.Tensor.softmax、paddle.rand_like、paddle.is_autocast_enabled、paddle.get_autocast_gpu_dtype、paddle.Tensor.repeat、paddle.permute。#74421,#74439,#74444,#74454,#74459,#74491、#74466,#74438,#74594,#74542,#74694,#74564,#74540,#74586,#74651,#74807,#74632,#74834,#74952,#74772,#74441,#74561,#74525paddle.compat.*一系列API,支持业界的通用用法,便于迁移代码,包括 paddle.compat.median、paddle.compat.nanmedian、paddle.compat.softmax、paddle.compat.sort、paddle.compat.split、paddle.compat.min/max、paddle.compat.Unfold。#74865,#74874paddle.nn.init.kaiming_uniform_、paddle.nn.init.xavier_uniform_、paddle.nn.init.uniform_、paddle.nn.init.kaiming_normal_、paddle.nn.init.xavier_normal_、paddle.nn.init.normal_、paddle.nn.init.calculate_gain、paddle.nn.init.constant_、paddle.nn.init.dirac_、paddle.nn.init.eye_、paddle.nn.init.ones_、paddle.nn.init.orthogonal_、paddle.nn.init.trunc_normal_、paddle.nn.init.zeros_。#74478x,也可以输入input,用法更为灵活。包括 paddle.maximum、paddle.minimum、paddle.sqrt、paddle.topk、paddle.polar、paddle.stack、paddle.cos、paddle.floor、paddle.log、paddle.pow、paddle.rsqrt、paddle.sign、paddle.sin、paddle.multiply、paddle.where等。#74683,#74795,#74887,#74592paddle.Tensor新增支持多种初始化方式,支持灵活的创建Tensor。#74619,#75022,#75065paddle.nn.functional.gelu、paddle.divide/div/div_、paddle.add、paddle.Tensor.copy_、paddle.norm、paddle.linalg.norm、paddle.nn.functional.silu、paddle.repeat_interleave。#74485,#74562,#74420,#74768,#74855,#74903,#74788,#74631,#74947out、device、dtype、requires_grad、pin_memory、bias,增强原有功能。包括 paddle.zeros、paddle.zeros_like、paddle.ones、paddle.ones_like、paddle.arange、paddle.eye、paddle.empty、paddle.empty_like、paddle.full、paddle.full_like、paddle.randn、paddle.Tensor.new_full、paddle.Tensor.new_empty、paddle.Tensor.new_ones、paddle.Tensor.new_zeros、paddle.tril/triu、paddle.bmm、paddle.nn.Conv1D/Conv2D/Conv3D/Embedding、paddle.diff、paddle.cumsum、paddle.var、paddle.multinomial、paddle.mean等。#74477,#74526,#74711,#74582,#74624,#74849,#74612,#74875,#74641,#74949,#74918,#74914,#74934,#74920,#74955,#74226,#74946paddle.Tensor.mul_/mul、paddle.autograd.Function、paddle.argwhere、paddle.cat、paddle.clamp、paddle.ger、paddle.take_along_dim、paddle.linalg.matmul、paddle.special.logsumexp、paddle.concatenate、paddle.eq/gt、paddle.Tensor.take_along_dim、paddle.nn.Conv1d/Conv2d/Conv3d`等。#74493,#74569,#74870paddle.nanmedian 精度问题。#74263paddle.distributed.fleet.utils.hybrid_parallel_util.fused_allreduce_gradients 在0-D下的问题。#74957paddle.matmul 在分布式下的问题。#74989在3.2版本中,我们对流水线并行功能进行了多项增强,包括实现了字典参数传递的支持,并扩展了Pipeline Layer和SharedLayerDesc对非流水线并行的兼容性;同时修复了多个关键问题,包括大尺寸张量的IPC API异常、流水线并行中的评估批次和非计算损失问题、MoE模型的梯度释放错误、PP场景下NCCL通信重建导致的hang问题,以及双流水线并行的event管理错误;此外还进行了多项性能优化,改进了双流水线并行的计算重叠效率以提升训练性能,并升级了clear_param_storage方法使其支持sharding模式下多color集合的清除和重置操作。
reshape 算子的切分推导规则,以支持分布式张量的同一维度被多个mesh维度切分的场景。#74352,#74579, #74565ProcessMesh 的 get_group 方法时重复创建通信组的bug。#73099get_local_slices 方法的bug。#74705stop_gradient参数的bug。#73459moe_combine和moe_gate_dispatch在MoE场景下跑不通的bug。#74645在3.2版本中,我们修复了DeepEP支持sm90编译的一个报错,同时对DeepEP申请的显存分配添加了预分配功能,并升级了其intranode和internode计算kernel,进一步优化了性能和稳定性。
Note truncated.
飞桨框架3.1.1版本围绕大模型训练全流程进行了系统性强化,通过体系化修复大模型场景下算子数值精度和功能等底层稳定性问题,结合API的日志系统规范化与单元测试全覆盖,显著提升大模型训练的正确性和稳定性;性能层面,在提高部分关键框架API和FP8场景下的量化计算效率的同时增强分布式训练场景下FP8量化
飞桨框架3.1.1版本围绕大模型训练全流程进行了系统性强化,通过体系化修复大模型场景下算子数值精度和功能等底层稳定性问题,结合API的日志系统规范化与单元测试全覆盖,显著提升大模型训练的正确性和稳定性;性能层面,在提高部分关键框架API和FP8场景下的量化计算效率的同时增强分布式训练场景下FP8量化和流水线并行效率,大幅提升训练吞吐。扩展自动并行架构的切分推导覆盖范围;推理部署提高兼容性的同时进一步增强EP并行推理能力;整体上在保持API兼容性的基础上构建出更稳健、高效的大模型研发技术底座。
算子与执行体系正确性、稳定性增强:系统化修复0-size、大shape Tensor、CPU/GPU 精度一致性问题,保障大模型训练正确性、稳定性。
FP8相关算子优化: 进一步提升FP8相关量化和计算融合算子的性能,并调整了部分算子的sm使用量,提升FP8混合精度训练效率
大模型训练更稳更快:系统性优化了Slice相关场景的执行效率,大幅提升Slice相关操作性能;修复流水线场景下的参数同步问题、新增Sharding场景的FP8参数量化能力和DualPipe下的极致通信计算重叠能力,保障并行训练稳定高效。同时增强自动并行架构下的切分推导能力增强自动并行切分效率。
推理部署:新增支持safetensors加载功能,EP并行方面对internode_ll_two_stage进行了功能增强助力进一步提升推理效率。
在3.1版本中,主要对大模型场景下常用的的多个API进行了补充,并且系统化修复了API日志以及部分代码实现问题。
paddle.device.device_guard,动态图的设备切换上下文管理器。#73964paddle.Tensor.bool、paddle.Tensor.float16、paddle.Tensor.half、paddle.Tensor.bfloat16、paddle.Tensor.float32、paddle.Tensor.float、paddle.Tensor.float64、paddle.Tensor.double、paddle.Tensor.int8、paddle.Tensor.char、paddle.Tensor.uint8、paddle.Tensor.byte、paddle.Tensor.int16、paddle.Tensor.short、paddle.Tensor.int32、paddle.Tensor.int、paddle.Tensor.int64、paddle.Tensor.long、paddle.Tensor.complex64、paddle.Tensor.complex128、paddle.Tensor.cfloat、paddle.Tensor.cdouble,支持灵活的数据类型切换。#74416paddle.msort,支持多维数组的排序。#74421paddle.ravel、paddle.Tensor.ravel,支持对Tensor进行拉平。#74439,#74454F.dropout1d,支持对Tensor沿指定维度进行随机丢弃。#74444paddle.Tensor.type_as。#74459paddle.Tensor.mul_、paddle.autograd.Function、paddle.argwhere。#74493paddle.nn.MultiLabelMarginLoss。#73538paddle.is_autocast_enabled、paddle.get_autocast_gpu_dtype。#74441paddle.Tensor.requires_grad。#74491Tensor.place 之间比较的问题。#73532F.adaptive_log_softmax_with_loss 的问题。#73554Tensor.__radd__、Tensor.__rmul__ 相关问题。#73833_DataLoaderIterMultiProcess、_DataLoaderIterSingleProcess的问题。#73931paddle.nanmedian 的问题。#74263paddle.eigh 的问题。#73349paddle.arange 的问题。#74159paddle.cumprod 支持设置dim为None。#74106paddle.zeros/zeros_like/ones/ones_like/eye/empty/empty_like/full/full_like 支持device、dtype、requires_grad等更多参数。#74477paddle.ones 支持shape为可变参数的用法。#74494F.gelu 的approximate参数支持字符串格式。#74485F.scaled_dot_product_attention 支持输入为3D。#73804代码风格相关的优化。#73659,#73661,#73660,#74001,#74145,#73863,#73655,#73724,#73764,#73849
代码实现相关的优化,文件命名优化,typo修复,MKLDNN相关的优化。#74132,#73626,#73641,#73587,#73801,#73812,#73827,#73845,#73841,#73859,#73858,#73840,#73826,#73825,#73824,#73887,#73949,#73823,#73218,#73948,#74479,#74233,#74513,#74518,#74516,#74178,#74166,#74165,#74163,#74174,#74164,#74162,#74208,#74180,#74205,#74288,#74232,#74299,#74244,#74230,#74314,#74392,#74424,#74417,#74536,#74473,#74135,#74245,#74327,#74325,#74326,#74315,#74385,#74395,#74398,#74393,#74367,#74391,#74436,#74410,#74475,#74517
单测相关的优化,单测问题修复。#73664,#73723,#73725,#73728,#73731,#73726,#73786,#73727,#73721,#73798,#73791,#73784,#73788,#73794,#73822,#73839,#73843,#73790,#73905,#73903,#73902,#73900,#73909,#73917,#73906,#73904,#73947,#73944,#73945,#73969,#74068,#74082,#74399,#74423,#74458,#74501,#74487,#74502,#74507,#74504,#74505,#74509,#74535,#74503,#74142,#74287
优化调试与打印信息,优化报错信息。#73783,#73886,#74188,#73720,#73857,#74519,#74520,#74384,#74386,#74387,#74383,#74381,#73830,#74128,#74203
增加pybind层的接口get_event_handle_from_custom_stream。#73918
执行机制相关。#74015
在3.1版本中,对并行策略进行了多项优化,包括新增VPP流水线的前向状态标注和空泡hook支持,修复了流水线并行的共享参数未同步问题、Sharding通信的维度冲突导致的训练hang问题以及DualPipe的event管理错误,同时提升了Sharding策略下的FP8量化支持和DualPipe的通信计算overlap能力,显著提升了并行训练的稳定性和性能。
在3.1版本中,我们对通信库进行了功能增强和性能优化,新增了stream接口支持,修复了初始化后额外comm context导致的显存浪费问题,并通过新增通信库初始化配置开关、为DeepEP算子支持multicast=2功能以及实现TMA优化的internode能力,显著提升了通信效率和计算性能。
在3.1版本中,推理新增支持safetensors加载功能,修复了一些算子问题,对internode_ll_two_stage实现了一些功能增强,支持通过环境变量启动stream_k,支持使用wint8算法加载int8权重等。
3.1版本中,我们主要针对Slice相关的算子和操作进行了系统化的升级,大幅提升了Slice操作的效率。同时针对一些大模型训练中遇到的问题进行了修复。
在3.1版本中,我们主要针对自动并行架构的切分推导规则进一步进行了完善,增强了自动并行的切分推导效率,同时修复了之前功能中一些易用性和正确性问题。
新增以下算子的切分推导规则
take_along_axis #72063index_put, index_put_grad #73486conv3d, conv3d_grad #72882depthwise_conv2d, depthwise_conv2d_grad #73134conv2d_transpose, conv2d_transpose_grad #73188einsum #73753moe_combine, moe_combine_grad, moe_gate_dispatch, moe_gate_dispatch_grad #74215group_norm 和 layer_norm 算子切分推导bug。#74139ProcessMesh 的 get_group 方法时重复创建通信组的bug。#73099在3.1版本中,我们重点针对大模型训练中遇到的大shape tensor、0 size tensor、以及一些关键kernel的精度问题进行了系统化修复,为大模型训练的稳定性和正确性提供了更好的保障。
修复算子 0-size 相关问题。 #73680,#73715,#73702,#73550,#73736,#72986,#73740,#73821,#73889,#73882,#73962,#73998,#73040,#73853,#74046,#74006,#73848,#73806,#74022,#73933,#74057,#74042,#73832,#73844,#73854,#74153,#74131,#74129,#74119,#74143,#74152,#74175,#74112,#74185,#74184,#74200,#74150,#74157,#74229,#73986,#74261,#74259,#74295,#74305,#74323,#74354
修复算子大 tensor 相关问题。 #73380,#73635,#73706,#73712,#73745,#73738,#73802,#73899,#73895,#74019,#73996,#73979,#74063,#74213,#74061,#74070,#74155,#74062,#74089,#74134,#74058,#74183,#74196,#74223,#74252,#74060,#74273,#74211,#74055,#74242,#74058,#74293,#74289,#74172,#74330,#74329,#74342,#74369,#74279,#74370,#74404,#74451,#74537,#74324,#74254,#74360
Paddle CPU/GPU Kernel 精度问题推全。 #73562,#73739,#74009,#74081,#74160,#74077,#74102,#74219,#74257,#74198,#74182
其他重要修复。 #73670,#73774,#73877,#73993,#74032,#74034,#74073,#74096,#74065,#74002,#74282,#74313,#74303,#74306,#74298,#74044,#74149,#74290,#74348,#74364,#74332,#74224,#74382,#74406,#74434,#74448,#74457,#74322,#74530,#74442,#74123,#73892,#74025
修复各类场景下的一些处理逻辑 Bug。 (#73940, #74050, #73929, #74040, #74240, #74316, #74328, #74412, #74432, #74450, #74461, #74462)
Note truncated.
飞桨框架 3.1 版本,针对核心功能自动并行进一步优化打磨,提升易用性和性能表现;同时提供FP8低精度训练支持,提升大模型训练速度提升10-20%;完善硬件扩展机制,降低类 cuda 类硬件适配成本,用户仅需注册kernel;同时对于框架基础能力进行增强,提升框架稳定性。重点更新功能如下:
飞桨框架 3.1 版本,针对核心功能自动并行进一步优化打磨,提升易用性和性能表现;同时提供FP8低精度训练支持,提升大模型训练速度提升10-20%;完善硬件扩展机制,降低类 cuda 类硬件适配成本,用户仅需注册kernel;同时对于框架基础能力进行增强,提升框架稳定性。重点更新功能如下:
API功能增强、Bug修复与改进,旨在提升用户体验和API的易用性。新增了paddle.randn_like API,修复了多个API的功能缺陷,并增强了对复数类型和0-Size Tensor的支持。文档和代码也进行了相应的更新和优化,以提升整体的准确性和专业性。
paddle.randn_like API。#72492tensordot API 输入输出类型不一致问题。#72139atleast API输出是Tensor列表时的问题。#73102nonzer API问题。#72003dualpipev中的内存泄漏问题。#72070softmax计算溢出问题。#71935take_along_axis中在broadcast=False时的形状检查问题。#72436maximum、minimum对Nan输入的不正确问题。#71933visit_type 问题。#72782gather_scatter_functor中的int32越界问题。#72905Bernoulli的inplace实现。#73271moe_permute、moe_unpermute问题。#73365ast.parse对pyi文件语法检查问题。#71872支持FP8矩阵运算,提升模型训练效率,同时对多个模型进行增强,提升稳定性; 提供是C_ops的方式调用反向接口,方便显存优化和功能实验。
Paddle API 0-size 机制建设。 #72721, #72756, #72790, #72806, #72764, #72786, #72853, #72826, #72851, #72928, #72912, #72922, #72924, #72887, #72921, #72906, #72895, #72821, #72914, #72936, #72943, #72694, #72919, #72940, #72820, #72934, #72975, #72872, #72984, #72988, #72972, #72977, #72937, #73086, #73042, #73017, #73044, #73077, #73108, #73027, #72970, #73008, #72996, #73165, #73166, #73170, #73122, #73204, #73207, #73186, #73197, #73168, #73172, #73125, #73181, #73270, #73028, #73094, #73180, #73276, #73333, #73341, #73299, #73346, #73361, #73375, #73152, #73377, #73355, #73382, #73385, #73386, #73352, #73387, #73401, #73384, #73450, #73437, #73503, #73507, #73477, #73513, #73525, #73528, #73517, #72898, #72880, #72864, #72993, #72954, #72866, #72878, #72889, #72861, #72837
SOT相关提升:增强了功能(如NumPy互操作性和super支持)、改进训练稳定性,修复多个问题以提升代码健壮性。 #71763, #71666, #71858, #71865, #72474, #72154, #72784, #72956, #73038, #73066, #73287, #73278, #73332, #73372, #73412, #73407, #73506
代码风格重构:通过代码重构及跨平台内核行为统一,提升代码质量与可维护性,并新增了YAML格式预提交检查工具。 #72216, #72360, #72816, #72969, #73106, #72825, #73150, #73151, #73158, #73101, #73326, #72580, #72424
Paddle CPU/GPU Kernel 精度问题推全。 #72879, #72894, #73012, #72973, #73018, #72965, #73128, #73229, #72992, #73344, #73274, #73295, #73293, #73317, #73320, #73454, #73492, #73535
slice 问题修复:修复了slice相关问题,包括索引逻辑、性能优化等。#72644, #72676, #72838, #72966, #73095, #72840, #73112, #73367, #73390, #73307, #73465, #73362, #72733, #72886
其他重要提升:包括动态shape支持、修复 meshgrid 并增加单元测试、升级 CUB 至 2.1.0 版本、改进 FP8 数值处理、优化 CUDA 图共享池机制、移除 ShadowFeedOp 以简化数据流、增强 PIR 模型保存/加载的版本兼容性、修复 flip 和 reverse 内核问题、改进 paddle.angle 的 NaN 传播逻辑、引入异步 GC 检查机制、优化 Dy2St 的 Scope 无锁接口、清理未使用的第三方依赖(absl),并进一步推进 PHI 与 Fluid 的解耦,提升框架的稳定性、性能和扩展性。 #72356, #72380, #72633, #72794, #72917, #72920, #72945, #72620, #73011, #73051, #73052, #73075, #73176, #73191, #73337, #73311, #73173, #73239, #73448, #73478, #73522, #73369
优化编译器性能和增加稳定性
修复各类场景下的一些处理逻辑 Bug。#71813, #71886, #71927, #71915, #71946, #71949, #71955, #71942, #71939, #71973, #72001, #72020, #72014, #72021, #72027, #72061, #72025, #72095, #72108, #72132, #71985, #72106, #72140, #72167, #72037, #72178, #72143, #72175, #72191, #72213, #72189, #72214, #72166, #72180, #72284, #72267, #72348, #72332, #72307, #72353, #72204, #72457, #72426, #72536, #72541, #72365, #72621, #72630, #72669, #72682, #72732, #72811, #72941, #72795, #73536
在3.1 版本中,我们对自动并行架构进一步打磨,以提高自动并行易用性和动态图性能。具体地,我们完善了自动并行核心机制,包括新增了多个算子的切分推导规则,支持分布式张量的同一维度被多个mesh维度切分,支持动态图并行策略(PP,CP,SEP,TP-CONV)等。同时,对动态图自动并行系统地做了性能优化,在Llama等系列模型上性能基本持平手动并行的性能。
支持分布式张量的同一维度被多个mesh维度切分。 #73233
支持自动并行通信拓扑描述ProcessMesh转换为手动并行通信组。 #72052
支持任意可序列化python object的send/recv。 #72098
动态图并行策略补齐
新增以下算子的切分推导规则
min, min_grad #72269bitwise_or,atan2,fmax,fmin,reciprocal #72310argmin, abs, cosh #72264mean_all, mean_all_grad #72479topk, topk_grad #72499argsort #72388round, mish, elu, selu, celu, stanh, softplus, softshrink, thresholded_relu, logit, nonzero #72312unique ops #72824put_along_axis #72766round_grad, trunc_grad, ceil_grad, floor_grad, poisson_grad #72677log_softmax, cummax, cummin #72720unary #72177unary_grad #72260index_select, index_select_grad #72727roll, roll_grad #72740empty_like #73169roi_align, roi_align_grad #72925expand_as, expand_as_grad #73107fused_gemm_epilogur #73126label_smooth, label_smooth #72845group_norm, group_norm_grad #72946instance_norm, instance_norm_grad #72938batch_norm, sync_batch_norm #72918reduce_any #73175fused_gemm_epilogue_rule #73494-统一动态图与静态图模式下量化API的使用方式,简化量化模型开发流程, #73100
支持sharding_overlap的acc_steps可配置。 #72395
c_softmax_with_cross_entropy_grad的inplace问题。 #72366功能增强与修复:- 优化算子索引和内核调度逻辑。 #72625, #72741, #73082, #73501
优化硬件机制,提供类cuda硬件kernel复用方案。
以customdevice接入方案为基础,增加低成本支持类cuda后端硬件的支持方案。类cuda后端可以以插件式方式接入paddle,低成本复用paddle中多数nv生态中的cuda kernel,且可以与paddle框架中的特性feature升级解耦,大大降低硬件后端接入与迭代成本,提升用户接入意愿,形成paddle与硬件厂商共建生态的良好合作关系。 #72604, #72668, #72758, #72865, #72910, #73033, #73145, #73281, #73079
补充XPU 基础能力:XPU 环境下增加kernel ,扩展数据类型,补充分支 #71424, #71809, #71594, #71779, #71756, #71573, #71883, #71954, #71931, #72280, #72361, #72406, #72528, #72752, #72852, #72982, #73357, #73414, #73464, #73234, #71776
DCU kernel 扩展数据类型 #73129
修复xpu执行问题 #71852, #71966, #72005, #71908, #72431, #72519, #72734, #72763, #72762, #72890, #72867, #73071, #73004, #72726, #73113, #73127, #73025, #73301, #73292, #73272, #73305, #73356, #73438, #72041, #72275, #72787, #73504, #73290
优化了框架的稳定性和跨平台兼容性,修复了不同平台上的编译安装失败问题;升级CUDA等关键依赖,进一步优化CI/CD流程,提升构建速度并增强系统整体稳定性;停止对Python3.8环境下的编译安装维护。
0x3878f, A-nnonymous, AndSonder, ApricityXX, aquagull, author, baoqiwen, BeingGod, blacksheep-Aristotle, BoShen5, bukejiyu, cangtianhuang, carryyu, chang-wenbin, changeyoung98, chen2016013, ckl117, co63oc, cqulilujia, crashbussy, cszdrg, Cutelemon6, cyy536, DanielSun11, danleifeng, datutu-L, deepllz, Dmovic, DrRyanHuang, dynamicheart, Eddie-Wang1120, eggman-1024, emmanuel-ferdman, Enigmatisms, enkilee, fangfangssj, feixi21, FeixLiu, ForFishes, Function-Samuel, ggggxm, GITD245, Glencsa, GoldenStain, gongshaotian, gouzil, gzy19990617, hanlintang, Hongqing-work, houj04, huangjiyi, hxzd5568, HydrogenSulfate, jzhang533, LCStayingdullCircuit, leon062112, lifulll, linkk08, LittleHeroZZZX, liufengwei0103, Liujie0926, liuruyan, lixinqi, LiYuRio, lizexu123, lizhenyun01, lj970926, lshpku, megemini, mikethegoblin, ming1753, mzj104, NKNaN, ooooo-create, pesionzhao, phlrain, pkuzyc, PolaKuma, Qin-sx, RichardWooSJTU, risemeup1, runzhech, RuohengMa, sasaya123, shanjiang7, SigureMo, sneaxiy, swgu98, SylarTiaNII, tianhaodongbd, tianshuo78520a, timminator, tizhou86, umiswing, waliwali777, wanghuancoder, Waynezee, Wennie396, xiaoguoguo626807, XieYunshen, Xing-lil, xkkkkkk23, Xreki, xuxinyi389, Yeenyeong, yongqiangma, YqGe585, yuanlehome, YuanRisheng, yulangz, yuwu46, zeroRains, zhangbo9674, zhanghonggeng, zhangting2020, ZhangX-21, zhangyk0314, zhangyuqin1998, zhink, zhiqiu, zhouquan32, zhoutianzi666, zhupengyang, zrr1999, zty-king, zyfncg
Your coding agent can read these notes before it upgrades. Set up the MCP server →