据 SemiAnalysis(8 月 10 日)报道,英伟达的 TileRT 软件引擎在低延迟 AI 推理基准测试中实现了每位用户每秒 500 个 token,性能约为传统 GPU 推理引擎的 3 倍。这一突破得益于将整个解码图编译为单个持久化内核,从而最大限度地实现计算与内存操作的重叠。随着包括 OpenAI 在内的前沿 AI 实验室评估 Cerebras 和 Groq LPU 等专用系统,以用于实时应用和全双工语音工作负载,英伟达的软件优化方案正对专用推理芯片的总可寻址市场构成威胁。这一转变凸显出,在下一代 AI 推理竞争中,内存延迟而非带宽才是关键瓶颈。
免责声明:本页面信息可能来自第三方,仅供参考,不代表 Gate 的观点或意见,亦不构成任何财务、投资或法律建议。数字资产交易风险较高,请勿仅依赖本页面信息作出决策。具体内容详见
声明。