多乐游戏大厅斗地主:云天励飞IFWA软件栈完结腾讯混元Hy3要害链路适配验证
发布时间:2026-08-08 03:45:49
多乐游戏中心下载:

  近来,腾讯混元团队开源新一代大言语模型 Hy3。环绕该模型的架构特征,云天励飞根据自主研制的 IFWA 软件栈,在DeepVerse云端芯片的芯片验证暴露上完结 Hy3 模型结构接入与要害推理链路功用验证。

  本次验证根据 BF16 精度和缩小装备展开,要点掩盖模型装备解析、模型加载、Dense 与 MoE 混合层履行、专家路由、GQA 解码、KV Cache 分配、Token 采样以及 MTP 投机解码等中心环节。

  在一般推理和敞开 MTP 投机解码两种形式下,体系均完结了从模型加载到 Token 输出的端到端功用流程,开始验证了 IFWA 推理结构及底层软件组件以及芯片架构对 Hy3 首要架构特征的兼容才干。

  此次验证的含义,不只在于跑通一款先进开源模型的要害推理链路,更在于验证了 IFWA 既有软件组件在新模型适配中的复用才干。

  经过将 MoE 路由、GQA 注意力、MTP 投机解码、KV Cache 办理等共性才干沉积为可复用的软件组件,IFWA 正在继续提高对先进模型架构改变的呼应才干,为后续缩短模型适配周期、削减重复开发作业量、提高自研芯片产品交给功率供给根底。

  当时,大模型架构仍在快速演进。混合专家、长上下文、分组查询注意力、投机解码等技能不断被引进干流模型,对推理体系提出了更杂乱的要求。

  Hy3 选用混合专家架构,总参数规划为 295B,每次推理激活 21B 参数,支撑 256K 上下文长度,并集成 GQA 注意力和 MTP 投机解码等技能。这些特征对软件栈的模型解析、算子履行、专家调度、缓存办理和推理结构兼容才干都提出了较高要求。

  对算力芯片企业来说,让一个模型跑起来仅仅第一步。更要害的是,软件栈能否习惯模型架构的继续改变,能否把不同模型中的共性才干做成安稳组件,让后续模型接入时少做重复作业。只要软件才干跟得上,硬件算力才干更快进入客户的实在事务场景。

  近来,腾讯混元团队开源新一代大言语模型 Hy3。环绕该模型的架构特征,云天励飞根据自主研制的 IFWA 软件栈,在DeepVerse云端芯片的芯片验证暴露上完结 Hy3 模型结构接入与要害推理链路功用验证。

  本次验证根据 BF16 精度和缩小装备展开,要点掩盖模型装备解析、模型加载、Dense 与 MoE 混合层履行、专家路由、GQA 解码、KV Cache 分配、Token 采样以及 MTP 投机解码等中心环节。

  在一般推理和敞开 MTP 投机解码两种形式下,体系均完结了从模型加载到 Token 输出的端到端功用流程,开始验证了 IFWA 推理结构及底层软件组件以及芯片架构对 Hy3 首要架构特征的兼容才干。

  此次验证的含义,不只在于跑通一款先进开源模型的要害推理链路,更在于验证了 IFWA 既有软件组件在新模型适配中的复用才干。

  经过将 MoE 路由、GQA 注意力、MTP 投机解码、KV Cache 办理等共性才干沉积为可复用的软件组件,IFWA 正在继续提高对先进模型架构改变的呼应才干,为后续缩短模型适配周期、削减重复开发作业量、提高自研芯片产品交给功率供给根底。

  当时,大模型架构仍在快速演进。混合专家、长上下文、分组查询注意力、投机解码等技能不断被引进干流模型,对推理体系提出了更杂乱的要求。

  Hy3 选用混合专家架构,总参数规划为 295B,每次推理激活 21B 参数,支撑 256K 上下文长度,并集成 GQA 注意力和 MTP 投机解码等技能。这些特征对软件栈的模型解析、算子履行、专家调度、缓存办理和推理结构兼容才干都提出了较高要求。

  对算力芯片企业来说,让一个模型跑起来仅仅第一步。更要害的是,软件栈能否习惯模型架构的继续改变,能否把不同模型中的共性才干做成安稳组件,让后续模型接入时少做重复作业。只要软件才干跟得上,硬件算力才干更快进入客户的实在事务场景。

  此次 Hy3 接入过程中,云天励飞没有为该模型重建独立后端,也没有环绕单一模型从头开发全新的中心算子。研制团队首要复用了 IFWA 此前在先进模型适配过程中建造的通用组件,并在此根底上完结必要的模型路由适配和 GQA 解码途径完善。

  其间,MoE 路由、GQA 注意力、MTP 投机解码等才干,均来自 IFWA 既有软件根底设施。以 GQA 解码途径为例,本次完善并不只服务于 Hy3,后续也可以被其他选用相似注意力架构的模型复用。

  这也是 IFWA 软件栈建造中的一个重要方向:每接入一款有代表性的模型,都尽量把其间可复用的部分沉积下来,削减下一次接入同类模型时的重复开发。跟着这类根底才干逐渐齐备,模型适配将逐渐从“逐一模型开发”转向“暴露化适配”。

  IFWA 是云天励飞面向自研芯片体系建造的一致软件栈暴露,掩盖编译器、Runtime 与 Driver、根底算子库、推理结构插件、调集通讯以及开发调试东西等中心环节。

  在大模型快速迭代的布景下,云天励飞并不期望针对每一款新模型都从头开发一套软件计划,而是经过通用组件、标准接口和自动化验证体系,构成可以敏捷接受先进模型的软件产品才干。

  在此次 Hy3 适配过程中,IFWA 已有 MoE、GQA、MTP、KV Cache 等才干得到复用,模型专属改动规模得到搁置。这说明 IFWA 的部分通用才干已能在新模型接入中发挥作用,也为后续支撑更多先进模型打下根底。

  关于客户而言,软件栈的价值不只仅“模型能跑”,还包含模型搬迁是否顺利、布置验证是否高效、既有代码和开发投入能否连续。一致、安稳的软件才干,可以在必定程度上协助客户削减重复适配作业,下降后续搬迁和保护本钱。

  现在,Hy3 已在 DeepVerse云端芯片的芯片验证暴露上完结模型结构接入和要害功用链路验证。后续,云天励飞将继续推进实在标准、实在权重及多卡布置场景测验,进一步验证 IFWA 在完好工程场景下对 Hy3 的支撑才干。

  下一阶段,云天励飞将展开实在注意力维度验证、实在模型权重加载及精度一致性测验,并推进张量并行、专家并行等多卡布置场景验证。一起,Hy3 相关测验用例也将逐渐归入 IFWA 惯例回归体系,继续提高软件版别迭代过程中的安稳性和一致性。

  针对 Hy3 的 FP8 量化版别,云天励飞后续也将结合 IFWA 混合精度和量化才干建造发展,进一步展开技能可行性评价。

  云天励飞正在以干流核算生态兼容才干为根底,继续建造端边云一体、跨代兼容的一致软件产品基座,推进模型、代码、算子和开发东西在不同芯片代际以及云侧、边际侧暴露之间逐渐复用。

  面向自研芯片体系,IFWA 将继续支撑 DeepVerse 系列产品交给和要点场景验证,并推进相关软件才干向后续芯片代际及 DeepEdge 系列产品延展。经过一致的软件栈才干,云天励飞期望逐渐下降跨代搬迁和多暴露适配本钱,削减云侧与边际侧重复开发,提高模型开发、体系交给和后续运维的一致性。

  未来,云天励飞将继续完善 IFWA 软件栈,把模型适配过程中的共性才干转化为可复用的软件财物,让自研芯片更快进入客户事务场景。

,多乐游戏斗牛