塔斯娱乐资讯网

Qwen3.8-Flash-Next 架构大更新! 好久没有看到这么激进的模型结

Qwen3.8-Flash-Next 架构大更新!
好久没有看到这么激进的模型结构了,目前大家都还在讨论到底是稀疏派还是线性派呢?Qwen3.8-Flash-Next(Qwen4)说:我全都要!我要把 Infra 推理做到极致!我要做 Infra 的 King![坏笑R]
首先,这个模型一共有512个专家,每个 token 会激活 10 个专家。每三层线性注意力层会有一层稀疏注意力层,稀疏注意力采用了和 DeepSeek Saprse Attention 类似的 Token Indexer 技术,每一个 token 在计算的时候,最只会计算与自己最相关的2048个 token。这也就是说,在提升计算效率的同时,也丢失了很多上下文信息。所以这也就解释了为什么它会有一个51B 的 n-gram,而 n-gram 每次查询的时间复杂度为 O(1)
好久没有这么酣畅淋漓地画一个模型结构图了,这个模型表现得真的很不错,特别是 Coding Agent 能力,我在分析整个模型代码的时候,就是在用这个模型来进行分析的,哈哈哈。希望我可以早日用 pytrio 后训练这个模型,来做 Agentic RL!@PyTRIO
howto入门codex howto入门vibecoding 大模型 阿里 Qwen4 qwen38flash