新闻

云天励飞连续适配 Hy4 preview、Qwen3.8-Flash-Next

牛华网
2026-09-11 18:27

继9月10日云天励飞IFWA 软件栈Day 0适配 DeepSeek-V4.1-Flash,近日,IFWA 连续完成腾讯 Hy4 preview 与 Qwen3.8-Flash-Next 的适配,并在后续持续补充关键推理链路与数值验证。相关工作在预硅仿真环境中开展,采用小规模真实权重切片作为验证载体。

两次适配不仅增加了 IFWA 对新模型架构的验证实践,也进一步检验了既有通用算子、编译器和推理框架的复用能力。通过在模型迭代中持续完善软件平台,云天励飞正在为后续软硬协同验证及模型部署优化积累软件基础。

面对架构快速演进,从“重新开发”走向“能力复用”

本次适配的腾讯Hy4 preview与Qwen3.8-Flash-Next两大模型,均采用了前沿的创新架构设计,对软件栈的计算实现、推理调度、状态管理、层间交互能力提出了全新挑战。其中,Hy4 preview融合门控稀疏注意力、稀疏索引、iHC层间连接、混合专家(MoE)等多元创新机制;Qwen3.8-Flash-Next则在混合注意力、稀疏计算、PLE嵌入、n-gram嵌入及层间信息交互维度完成架构升级,两大模型的机制革新对传统模型适配方案提出严苛考验。

此次 Hy4 preview 适配中,IFWA 复用了此前模型适配过程中积累的稀疏注意力、索引器及相关通用算子,并完成模型所需的框架接口适配。针对稀疏索引器对更大候选数量的需求,研发团队通过既有计算路径与通用逐行 Top-K 算子组合,使原有路径从支持 256 个候选项扩展至 1024、2048 配置,而无需重新开发专用计算内核。

11.png

在 Qwen3.8-Flash-Next 适配中,IFWA 完成了 GDN、PLE、QSA、HC 与 MoE 等机制的接入,并针对模型分支与现有推理框架之间的版本差异完成必要的接口对齐与实现同步。其中,模型执行路径实际需要的 12 个 Triton 计算内核均在已测配置下通过数值验证。对于其中一项原计划采用专用 C++ 实现完成的适配工作,由于现有编译器已经能够支持对应 Triton 内核,最终无需再进行专用重写。

22.png

两次适配体现出同一个趋势:模型在变,但底层软件能力不必每次推倒重来。

随着通用算子、编译器和推理框架能力持续积累,软件栈可以更多承接模型变化,将研发资源集中到真正发生变化的计算机制和执行路径上。

从“跑通”到“算对”,真实权重验证进一步深入

对于模型适配而言,完成端到端推理只是第一步。

此次两款模型适配均进一步使用真实权重切片开展关键计算环节的数值验证,以 NVGPU BF16 重算结果作为参考,对模型执行过程中的核心计算进行逐项比对。

在 Hy4 preview 验证中,团队围绕 iHC 残差流、稀疏注意力核心、MoE 专家计算及索引器等关键环节开展数值比对。已测结果显示,索引器逐值比对一致,其余相关计算环节的误差经报告判定处于 BF16 舍入水平。

在 Qwen3.8-Flash-Next 验证中,团队针对 HC 层间混合,以及 QSA 稀疏注意力、PLE 嵌入路径中的部分关键步骤开展数值比对,并验证了真实权重条件下的执行结果。

同时,在同一 Tiny 配置下,从测试权重切换至真实权重切片无需修改产品代码,已有执行路径能够继续承接真实权重输入。

这类验证让模型适配从“能不能跑起来”,进一步深入到“关键计算是否符合预期”,也为后续扩大模型规模和运行模式验证提供基础。

既有能力持续复用,让一次适配沉淀为长期能力

除了模型本身的计算路径,两次适配也进一步验证了 IFWA 已有推理能力的复用价值。

在 Hy4 preview 适配中,团队复用了既有的 MTP 投机解码机制,并进一步完成图捕获、分块预填充及前缀缓存等专项验证。在已测的分段图捕获、整图捕获及叠加 MTP 的四种配置中,生成结果均与 Eager 基线一致。

在 Qwen3.8-Flash-Next 适配中,同样复用了 IFWA 已有的 MTP 投机解码能力。使用包含 MTP 草稿层的真实权重切片进行测试时,在已测用例中观察到草稿 token 被接受,最终输出与非投机基线逐 token 一致。

与此同时,Hy4 preview 的 MTP Eager、分段图捕获等用例,以及 Qwen3.8-Flash-Next 的真实权重验证路径,也将进一步纳入持续集成体系。

从一次模型接入,到测试用例、公共执行路径和通用能力的持续沉淀,模型适配不再只是一次性的项目工作,而正在成为软件栈能力持续迭代的一部分。

面向更多模型,让推理软件栈成为持续演进的基础设施

大模型创新正在加速,模型架构的变化也正在从单点创新走向多种计算机制的组合。对于国产 GPGPU 平台而言,真正的竞争力不仅来自底层硬件,也来自能否持续、高效地承接快速演进的模型生态。

此次连续完成 Hy4 preview 与 Qwen3.8-Flash-Next 两款模型的适配,是 IFWA 在这一方向上的又一次实践。

目前相关验证仍主要集中于预硅仿真环境、Tiny 配置和已测功能路径,不代表完整模型的语言质量、整体性能或多卡部署验证已经完成。后续,IFWA 将继续推进完整模型规模、多卡并行、图捕获及更多推理运行模式的验证。

截至目前,云天励飞 IFWA 已完成 DeepSeek V4 ProHy3Kimi-k3DeepSeek V4DSpark TinyQwen3.6Hy4 previewQwen3.8-Flash-Next、DeepSeek-V4.1-Flash等主流模型的适配,持续覆盖不同架构与推理机制的新一代大模型。

33.png

从单个模型的快速接入,到通用算子、编译器、推理框架及验证体系的持续复用,IFWA 正在将一次次模型适配沉淀为可持续演进的软件能力,进一步夯实国产算力的软件基础,助力构建更加开放、繁荣的国产 AI 推理生态。


标签: