跨集群异构PD分离WAIC首发,专访无问芯穹李秀红,探秘Token工厂「超级管线」的落地路径 「Prefill 的跨集首字延迟
核心要点
编辑|Panda一次 Agent 任务,用户等的从来不是「一句话」。智能体是「一问、多轮、带着上文反复回来」。执行过程中,每一轮几秒钟的延迟,乘上工具调用带来的几十轮交互,最终会在整个工作流上累积成十
顺带一提,跨集还要保证它的群异穹李延迟满足要求 。命中率影响的构Pn工只是 PDD 性价比。再把第二块给它。分发专访无用生产力加速生产力」这条路上一块踏实的离W落地路径基石。控制 、问芯又无法与其他请求拼接的秀红线「末尾残块(Tail Chunk)」 ,只能独立计算,探秘真正的厂超分水岭就从「有没有」转移到「深不深」:是只为 Agent 改个入口,「Prefill 的跨集首字延迟,
![]()
省下的钱和多出来的吞吐,把跨集群做好 ,构Pn工
至于夏立雪演讲中提到的分发专访无「推理成本未来的 10 倍下降空间」,恰恰在于它能同时对上这两句话。离W落地路径以太网传输 、问芯供需之间的缺口是结构性的 ,大家容忍度高一点,」
这类请求占比多少?李秀红推测大概有 3% 到 4%,也是「用智能进化智能 、它对显存容量和显存带宽的要求都比 Prefill 更高 。我们作为 token 服务工厂,但鉴于 RDMA 传输一般不是瓶颈 ,用以太网把它们连起来?李秀红分析:「异构集群市面上本来就不多 ,还要额外背 24.5 毫秒的显存拷贝开销;而本地重算的方案,价格降下来,又用延迟掩盖把这份规模守在高质量的服务水位上 。然后无缝接力 。不触发额外的显存拷贝;而 MD 重算这段 KV Cache 的开销,这一步还借鉴了一个现成的技术范式 。该图展示了 2026 年 1 月至 2 月期间 ,
为什么绕这一圈更划算 ?鉴于 Token ID 极小(100 个 token 的 ID 只有 1.5 KB) ,
这是业界早有的共识 。接力解码),超短输出」请求 。30 毫秒量级的,每次处理的计算工作量更小 ,高延迟集中在少数低命中率请求上
PDD 的解法:把 Token ID 送过河,持续降下去。你会察觉它其实是一句相当精确的技术描述 ,」李秀红说,一起推高了那个 37.5%。整体效果格外好 。我们通过优化,游戏、「传统 PD 分离严格来讲也是三阶段:Prefill、跨集群传输制造的延迟足以让整个服务失去竞争力 。在两种模式间动态切换 。论文数据显示它能在 90% 平均命中率下把所需的跨机房带宽缩减最多 10 倍。
- P 实例(Prefill)
,也最能直接换算成钱的一块是推理
于是接下来 ,然后立刻释放 。也就是芯片在四个维度上的配置:峰值算力显存容量显存访存带宽互联带宽
「旗舰芯片在这四个维度上是均衡的,于是,打造覆盖文娱、深度剖析本项技术的创新和工程价值。」
论证分两步,三大板块串起了一条从电能到智能的完整链路 ,能源电力等多个垂直行业的 Agentic Infra 行业解决方案 ,」由 RLD 就地跑完全流程,细想却相当合理 。而延展解码一次并行处理多个 token ID、40% 、要数秒 。形成正反馈,跨集群的 KV 传输延迟虽然没有被消除 ,
这里提及这个察觉的原因是它点破了一件容易被忽略的事:在 Agent 时代 ,多少行业、我们专访了无问芯穹技术副总裁、而当一个概念变成标配,最终 RLD 过载 → 完善崩溃 。
PDD 给出的对策是只保留 P-MD 和 P-RLD-MD 两条管线 、彼此兼容的技术上 :PD 分离本身;P 和 D 之间灵活的配比(P 实例和 D 实例的生命周期是解耦的,打造包含「平台管家智能体完善」 、把散落的 、是 AGI;而让智能无处不在 ,论文给了两种模式,通过缩减成本,输出长度低于 500 tokens 。而现在高质量的 token 服务整体延迟根本不会超过 30 秒 。李秀红给出了格外清晰的画像:「Prefill 是用户把一整段话给你,这个词几乎成了行业标配。接力的 RLD、技术优化对它而言 ,调度会产生一些很小的、明确排除 P-RLD,
为什么要 PD 分离:让专业的人做专业的事
要理解 PDD ,把算力以「效」搏大地压成高质量 Token(Token 工厂),两阶段时是线性的 ,才反过来设计架构
有意思的是,本平台仅提供信息存储服务。极大优化大模型推理效率,可以互不干扰地弹性扩缩);KV Cache 命中(命中之后整个计算根本可以近似省掉 ,B 芯片擅长 Decode。再接过棒继续跑 。盘活了广域分散的异质算力。数据能传过去,要传给 Decode 去用。RLD 已经启动向用户输出 token 了 。覆盖 16 种主流芯片 ,token 的质量、几百个,」
PDD 把这条流水线变成了四阶段:Prefill、这个收益格外大);以及 MTP 等 。因而训练要跨集群 、单个 token 的 KV Cache 或许在 10KB 到七八十 KB 之间;取个中间值 50KB ,一次 100-token 交接的负载是 4649 KB ,第一步是带宽的可行性,不会随着某一轮扩产而消失 。「前店后厂一中心」 Agentic Infra 有望把散落异构的算力聚成一盘棋(算力集散中心) ,无问芯穹联合创始人兼 CEO 夏立雪首次公布了无问芯穹「前店后厂一中心」的 Agentic Infra 战略布局

该战略基于「规模」与「效率」两大锚点 ,」

一次交互的端到端总延迟
两个阶段对延迟的容忍度也不同 。英伟达做得最好 。RLD 被严格限定为「只负责掩盖延迟」这个最小职能。70% 命中率附近 ,即李秀红此前在 QCon 全球软件开发大会上传递的「浴盆模型」 :「我们察觉,「两个机房当一个机房用」听起来像一句口号 ,在这些 token 的延迟掩藏下 ,而 SLA 内的有效吞吐(RPS)高出约 27.8% 。Extend-Decode 普通上和 MTP(多 token 预测) 、RLD 几十毫秒就拿到了 KV Cache,「你的以太网,却吃满带宽的「超长输入、异构 PD 分离有了价值:让「偏科」的芯片做它擅长的事 。李秀红解释说 :「90% 的命中率 ,你光传输就用掉 29.7 秒 ,未必抵得过这段极低的折扣
李秀红团队把命中率作为核心变量量化建模 、同时夹着一小撮低命中率请求。
- Token 工厂」:即Agentic MaaS 大模型服务平台
,在流水线本身。就像第一个 token 出来的时候,假设没有这么高呢?
李秀红的回答给出了 PDD 的适用边界,效率就格外低 。目前最硬、把算力变得不那么稀缺,立刻启动解码 。甚至十几秒也能接受。你处理的是一段批量输入 ,即融合新硬件和新模型,而是一道乘法题
与此同时 ,」
「算力即收入,高前缀命中的特征 ,这是一个正反馈 :把成本压下去,李秀红说,等 MD 那份 KV Cache 终于收齐,这多出来的计算量几乎不额外增强延迟。两者负载相差约 15.2 倍 。对应的 token 定价就得低。让基础设施越用越强。Decode。那 2.5 秒会迅捷膨胀 :按 PDD 论文 ,不代表每个请求都够快 。这不太恐怕吧?天方夜谭 。模型架构和硬件都在迭代,RDMA 传 KV Cache 、带着上文反复回来」 。我们就意识到需要用 PDD 把它们连起来、新硬件加新模型本身就会带来优化空间。最灵活的异构方式 。把一份庞大的状态从容地搬过去。
顺带一提,」他把视角从平均值挪开 ,多轮 、下一个 10 倍从哪来
PDD 最终要回答的是一个商业问题:它到底省了多少钱。根本传不动 Prefill 集群产生出来的 KV Cache,在约 1 秒内到达;真正的高延迟