
transcript
show notes
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention
Summary
传统大语言模型(LLM)在解码阶段需要将全部 KV 缓存(KV Cache)保持加载状态,这导致在超长上下文服务场景下面临严重的 GPU 显存瓶颈。在本报告中,我们提出了前瞻稀疏注意力(Lookahead Sparse Attention,简称 LSA),这是一种由基于 DeepSeek-V4 架构构建的神经记忆索引器(Neural Memory Indexer)驱动的全新推理范式。与被动地对所有历史 Token 进行注意力计算不同,LSA 能够主动预测未来的上下文需求,并仅在 GPU 显存中保留对查询至关重要的 KV 块(KV Chunks)。关键在于,我们通过脱离骨干模型的解耦训练(backbone-free decoupled training)策略实例化了该架构。通过将索引器构建为标准的双编码器(dual-encoder)架构,我们利用标准的检索训练框架对其进行独立训练,而无需将庞大的骨干模型加载到 GPU 显存中。
我们证明了这种“少即是多”的范式在大幅提升服务效率的同时,还能在依赖长期全局记忆的任务中充当有效的注意力去噪器(attention denoiser)。在主流的长上下文评估套件(例如 LongBench-v2、LongMemEval 和 RULER)中,FM-DS-V4 将平均物理 KV 缓存占用大幅压缩至全上下文基线(full-context baseline)的 13.5%,同时持续保持甚至略微提升了下游任务的准确率(平均绝对提升 +0.6%)。在 1M(百万)上下文长度下,每个解码 Token 的计算量降至基线的 0.30 倍,GPU KV 缓存体积缩减了 90%(从 3.73 GB 降至 0.37 GB),从而在 8× H20 GPU 上的首字/解码分离(PD-disaggregated)服务中,实现了2.8 倍的总吞吐量提升和 2.7 倍的并发量提升。
原文链接:https://arxiv.org/abs/2606.09079
前往小宇宙评论区与主播互动






