PokerStars扑克官网

万卡国产训推之后,科大讯飞起头让AI反哺算力

编纂|Clio

最近几个月,国产 AI 算力起头密集凌驾一个新的数量级。

7 月,全国产十万卡 AI 超集群落成 ;9 月初,三门峡国产万卡级智算中心一期 2000 张摩尔线程 MTT S5000 GPU 智算卡已全数投入运行,集群算力需要根基达到满载 ;国产卡在进一步向万卡甚至十万卡级训练基础设施迈进。

三门峡(惠山)国产智算中心理房内

集群规模越来越大,新的问题也随之而来:这些芯片到底能阐扬出几多现实训练能力?

大模型训练里,卡数增长的同时,系统复杂度也会随着上升。一块芯片上的算子效能差距,放到数万块芯片上会不休被放大 ;幼规模训练里不太显眼的通讯期待,到了万卡集群会变得很可观 ;节点数量增长、训练周期拉长之后,软硬件故障也会更频仍地进入日常运维。

因而,评价一套算力系统,除了看芯片数量和单卡机能,还要看算子、通讯、并行调度、故障复原以及软件栈之间能不能共同起来。

最近一个新颁布的模型引起了PokerStars扑克官网把稳。

9 月 7 日,科大讯飞正式颁布星火 X2.5。该模型选取 MoE 架构,参数规模为 293B-A30B,沉点提升代码和智能体能力,同时覆盖 200 余种说话,在说话理解、答题、推理等通用工作上维持优异成效。

其中,万卡规模国产 910B 集群承担了模型的预训练和后训练,线上推理基于国产平台,并共同多步投契解码提升推理效能。值得一提的是,随着代码和工具挪用能力加强,星火 X2.5 也起头参加 NPU 算子优化,AI 起头反过来参加底层算力的优化。

通过这次真实的大模型训练,也能够进一步探求万卡国产算力面对的几个具体工程问题:算子效能、长高低文处置、万卡通讯和长周期训练不变性,以及模型与底层算力之间在形成怎么的反馈关系。

这次星火 X2.5 的训练优化,也根基萦绕这些问题发展。

万卡国产芯片,怎么真正干活?

能够把大模型训练设想成一座超大型工厂。

万卡集群里的芯片,是成千上万名「工人」 ;显存是存放模型参数、高低文和中央数据的「仓库」 ;通讯网络则是芯片之间互换数据的「运输通路」。当规模扩大到万卡级,推算速度、显存容量、通讯效能和系统不变性,城市直接影响整座「工厂」的效能。

而推理和训练,对这座「工厂」的要求并不一样,这也是「推理适配」和「全国产训推」的关键区别。

推理适配重要解决模型能否在国产芯片上高效部署运行 ;齐全训练还涉及参数持续更新、跨卡同步、数值不变和长周期故障复原,因而对整套系统协同提出了更高要求。

科大讯飞技术人员把万卡训练的主题挑战概括为:算得快、装得下、传得顺,以及跑得稳。

先看「算得快」。

对这座工厂来说,芯片数量决定了有几多「工人」,算子效能则影响每个「工人」现实能干几多活。模型训练中的 Attention 等主题推算,最终都要通过算子落到芯片上执行。算子效能高不高,会直接影响芯片真正可能阐扬出几多推算能力。

针对星火 X2.5,团队萦绕国产关键算子进行了定向优化?拼笱斗捎泄丶际跞嗽卑凳,其中 Attention 推算算子效能相比基础实现提升 2 倍以上。

单颗芯片算得快还不够。到了万卡规模,另一个问题是「怎么分工」。

训练工作会被拆分到大量推算单元上,若是分歧芯片承担的工作量不平衡,就可能出现一部门已经算完、另一部门还在持续运行的情况。规模越大,这种期待越容易被放大,最终拖慢整个训练过程。

针对长序列训练,星火 X2.5 选取结合动态负载平衡的长序列并行规划,让分歧推算单元承担的工作越发平衡?拼笱斗捎泄丶际跞嗽卑凳,该规划使长文本训练效能相对提升 30% 以上。

第二个问题是「装得下」。

模型越大、高低文越长,无论训练还是推理,必要处置和暂存的数据城市增长,「仓库」压力也会随之上升。这里比拼的并不只是显存容量,还蕴含若何削减长高低文带来的推算和资源开销。

在模型结构层面,为提高长程工作的推理效能,星火 X2.5 引入稀少把稳力机造和跨层共享稀少把稳力索引,进一步削减资源开销。

稀少把稳力的思路,是把更多推算集中到真正必要关注的信息上,削减不用要的推算 ;跨层共享索引,则让分歧推算层复用已经成立的索引,削减沉复开销。单一说,就是尽量少做无效推算,也少做沉复工作。

第三个问题是「传得顺」。

到了万卡规模,「运输」也会成为瓶颈。大模型训练不是每张卡各算各的,分歧芯片之间必要持续互换训练数据和状态。集群越大,通讯关系越复杂,一旦数据传输跟不上,前面的推算能力就会被期待功夫吃掉。

尤其在超长序列训练中,序列被拆分到更多推算单元之后,跨卡通讯还会进一步增长。

针对这一问题,星火 X2.5 在通用通讯优化之表,还针对超长序列带来的通讯开销,引入通讯压缩、分层通讯和推算并行等方式?拼笱斗捎泄丶际跞嗽卑凳,有关训练效能提升 10%。

其中,通讯压缩能够削减必要互换的数据,分层通讯则凭据分歧层级的互联关系组织数据互换 ;再结合通讯掩藏等机造,主张都是尽量降低超长序列训练中的通讯开销和期待功夫。

最后是「跑得稳」。

工厂规模越大、运行功夫越长,设备故障越难齐全预防。对于万卡训练来说,真正沉要的是能不能尽快发现问题、隔离问题,并把受影响的训练工作复原起来。

科大讯飞有关技术人员暗示,在训练不变性保险方面,星火 X2.5 结合国产芯片提供的全域异常检测能力,基于对数十万训练工作的问题分析,实现了工作配置训前校验、训中卡死自动检测、失败工作自动沉提、汗青固定报错节点自动剔除,以及故障时过程级急剧复原和取缔工作时的临终 checkpoint 保留,机械有效训练时长超过 97%。

checkpoint 即训练过程中的「存档」。训练运行到肯定阶段后保留当前状态,一旦后续出现故障,就能够从较近的状态持续复原,而不用沉新起头。

所以,万卡集群的价值并不只由芯片数量决定,还必要整套训练系统能否持久不变运行并高效协同。

模型训出来之后,还能做什么?

星火 X2.5 这次沉点提升的,是代码和智能体能力。

训练阶段,模型萦绕数学、编程、智能体工具挪用和指令遵循等工作发展大规模强化进建,并训练分歧领域的老师模型,再通过多老师在线战术蒸馏(MOPD),利用学生模型在线天生的轨迹构建针对分歧能力的训练信号,将多个老师模型的优势有效整合到统一的颁布模型中。

单一说,就是让各有千秋的「教员」别离领导,再把这些能力汇总到一个模型中。这些能力在代码工作上的体现比力直观。

这次披露的测试覆盖 Terminal Bench、SWE Pro、SWE Verified、SWE Multilingual、NL2Repo 和 SciCode 等工作。它们关注的内容已经延长到终端操作、真实代码仓库批改、多说话软件工程和科学编程等场景。

我们来看几个现实演示。

在 Web 前端天生案例中,用户只必要给出天然说话需要,模型就能够结合图像天生等工具实现一个齐全网页,从页面布局、视觉设计到滚动动画和交互成效,都蕴含在统一个工作里。

视频链接:https://mp.weixin.qq.com/s/2azmEAjY-RQdbbBt-eJHUw

视频链接:https://mp.weixin.qq.com/s/2azmEAjY-RQdbbBt-eJHUw

而在人机交互案例中,模型还必要将视觉鉴别与角色反馈结合起来。好比,用户要求造作一个能够通过矢】潆像素风猫咪互动的网页,模型必要实现摄像头挪用、视频流处置、手势鉴别,并将分歧作为映射为猫咪的相应反馈,如靠近、击掌、安抚等,同时实现角色动画、交互逻辑和页面调试,最平天生一个能够直接运行的趣味互动 Web 利用。

视频链接:https://mp.weixin.qq.com/s/2azmEAjY-RQdbbBt-eJHUw

这些案例的意思不仅在于模型能否天生一个网页,更在于代码能力和智能体能力在合流:模型先理解工作及约束,再把复杂指标拆解为多个步骤,挪用工具执行代码,并凭据谬误信息或运行了局持续建改。

倒剽一关环从网页开发迁徙到底层软件领域,模型处置的问题也会从「代码能否正确运杏坠,延长到「在保障正确性的前提下,代码能否在真实硬件上跑得更快、更高效」。算子优化正是这类工作的代表。

那么,当模型具备这种「理解—拆解—执杏转反馈—建改」的关环能力后,它能否进一步参加自己所依赖的底层算子和软件栈优化?

这就涉及 NPU 算子优化。

算子优化自身是一项门槛很高的工作。工程师必要理解硬件架构、编程接口、访存方式和机能分析工具。代码可能正确运行之后,还要持续做机能剖测,判断功夫重要花在推算、访存还是数据搬运上,哪些实现没有充分利用芯片能力,又应该怎么调整。

为了让星火 X2.5 具备这类能力,科大讯飞在无监督训练阶段,基于 GitCode 上的优质昇腾算子仓库,构建蕴含 CANN 编程规范和典型高机能实现模式的训练语料,让模型进建昇腾硬件系统下的编程知识 ;进入后训练阶段,又萦绕真实开发场景构建大规模、可验证的算子效能优化工作,让模型直接在真实 NPU 环境中进行开发设计、机能剖测和迭代优化。

能够把这个过程理解成给模型增长了一间「尝试室」。

模型先写出一版代码,在真实芯片上运行,拿到机能了局,再凭据了局持续批改。下一轮沉新编译、沉新测试,直到找到更相宜的实现方式。不外,这并不料味着模型能够在没有任何前提的情况下独立实现底层系统开发。在当前实际中,工作指标、初始代码、硬件环境和评估剧本依然必要预先设置。模型的作用,是在这些前提下进行多轮工具挪用和规划索求,提高部门算子开发与优化环节的自动化水平。

DSA 细粒度稀少把稳力算子,是这次披露的一个具体制子。

DSA 面向长高低文场景,通过集中推算关键部门来削减推算量。不外,稀少推算也会带来更零散的数据接见,数据搬运效能会成为新的影响成分。

在仅提供基础版 Ascend C 实现、工作描述和评估剧本的情况下,星火 X2.5 在昇腾 910B 设备上进行了多轮自主优化?拼笱斗捎泄丶际跞嗽卑凳,模型通过约 1600 次工具挪用索求分歧机能规划,最终相比 torch_npu 实现获得 3.5 倍加快。

一次万卡训练,能留下什么?

大模型训练实现后,最直观的产品是一组模型参数。

但从星火 X2.5 这次训练能够看到,国产训推的价值在向多个层面延长:训练经验能够进一步沉淀为平台能力,寂仔优化步骤在向分歧国产硬件环境迁徙,模型自身也起头参加底层算子调优。这些变动共同影响着万卡集群能否从基础设施投入,转化为持续产出模型能力的训练系统。

大模型持续更新,Attention、MoE、长高低文和智能体强化进建不休对算子机能、显存带宽、集群通讯、并行调度和故障复原提出新要求。每一次齐全训练,现实上也是对底层软硬件系统的一次压力测试。

若是优化后的算子、通讯战术和复原机造可能被固化进训练平台,后续模型就不用沉复实现一样的适配工作。工程团队也能够把更多资源投入新的模型结构、训练步骤和利用工作。

这种堆集的价值会随着训练次数增长而放大:一次项目中的一时优化,有机遇逐步转化为可能被后续模型复用的平台能力。

进一步的问题,是这些能力能否从单一硬件环境迁徙到更多国产平台。

分歧国产 AI 芯片在推算架构、编程接口、通讯方式和机能分析工具上存在差距,迁徙时仍必要沉新处置算子实现、并行战术和工具链衔接?拼笱斗砂凳,除昇腾表,团队也在寒武纪 MLU590、中科海光 BW1000 等国产芯片上发展大模型训练效能的适配和优化。

因而,能够进一步关注更换硬件后必要调整几多代码、寂仔并行战术可能保留到什么水平,以及迁徙后的机能阐发。迁徙成本越低,寂仔训练能力覆盖更多国产平台的难度就越幼,针对单个项目形成的优化经验也更容易沉淀为可复用的通用步骤。

与此同时,模型自身也起头进入这套工程循环。

星火 X2.5 已具备在真实 NPU 环境中进行开发设计、机能剖测和迭代优化的能力。前文提到的 DSA 案例,也体现了这种「天生—运杏转反馈—优化」关环在算子机能调优中的现实成效。

这注明,模型已经可能在真实 NPU 环境中通过多轮工具挪用持续索求更优实现,能力天堑也由代码天生进一步延长到了现实机能调优。随着这一过程逐步成熟,模型在底层软硬件优化中的参加水平在进一步加深。

因而,一条反馈链逐步清澈:国产算力训练大模型 → 模型获得代码和工具挪用能力 → 模型参加 NPU 算子优化 → 优化经验进一步沉淀为工程能力 → 反哺后续模型训推。

这套循环寂装响当前训练效能,也影清脆续迭代速度。算子、通讯和调杜着化能够削减推算与期待功夫,故障复原机造能够提高有效训练时长 ;经过验证的代码、机能数据和优化步骤,也能够进一步沉淀为后续训练可复用的工程资产。

回到科大讯飞这家公司,星火 X2.5 展示的不只是一次模型训练,而是训练、推理和底层算力适配之间在形成更缜密的技术联系。实现国产算力万卡训练是其中一个沉要节点,而这些环节在逐步形成一套彼此衔接的技术系统。

随着这些优化不休被验证和固化,这套系统也有望沉淀出一套可复用的工程能力。算子优化、散布式训练、故障复原、软硬件适配和工具链建设,都能够持续服务后续模型迭代。随着工程系统逐步成熟,新模型的训练、迁徙和部署成本,也有望进一步降落。

科大讯飞的另一个特点,在于教育、医疗、企业服务等持久堆集的行业场景可能持续提供真实需要和反馈。业务提出新的问题,模型随之迭代,底层系统再凭据训练和推理了局持续优化,由此形成从利用需要到模型升级、再回到业务落地的循环。

倒剽一循环不变运行时,全国产训推对科大讯飞而言,就不只是一次技术路线选择,而会逐步沉淀为持久的工程优势。

免责申明:本内容来自腾讯平台创作者,不代表腾讯新闻或腾讯网的概想和态度。

有关推荐

热点利用推荐

腾讯新闻·电脑版
全网热点早知路

精选视频

2026年全国粮食和物资储蓄科技活动周启动

作者其他文章

?
顶部
【网站地图】