Skip to content
Artwork for 每日AI

每日AI

每日新闻

畅读AI学术论文,聚焦前沿趋势,普及人工智能

Play
  • 30 episodes
  • daily
  • Avg 19 min
  • Chinese
Counted on this page — what you have heard stays on this device, so it is not something the list can be paged by.
  • Yesterday · 15 min

    IFScale:评估大语言模型多重指令遵循能力的极限 最强AI也扛不住五百条指令

    这份名为 IFScale 的研究报告通过一个包含 500 个业务术语关键词的新型基准测试,探讨了大语言模型在高密度指令环境下的执行能力。研究发现,即使是顶尖模型在处理极多指令时,其准确率也会显著下降,并表现出阈值衰减、线性衰减或指数衰减三种不同的性能退化模式。推理模型在保持指令遵循的稳定性方面通常优于通用模型,但在处理任务时往往伴随着更高的延迟和生成连贯性的下降。此外,模型普遍存在首因效应,即更容易执行位于列表前端的指令,且主要的错误类型是从修改错误转向彻底的遗漏错误。该研究揭示了模型在认知负荷下的行为特征,为开发者在实际应用中优化复杂指令的设计提供了重要参考。

  • Thursday · 20 min

    SWE-1.7:高性价比的前沿软件工程智能模型 散装算力战平GPT-5

    Cognition 发布的最新报告介绍了名为 SWE-1.7 的软件工程模型,该模型通过优化强化学习流程实现了高性能与低成本的平衡。技术团队采用了多集群训练架构与高效的权重更新机制,克服了跨地域协作的延迟问题。通过引入自我压缩与交替长度惩罚技术,模型在处理长周期任务时表现出极高的效率。相比基础模型,它展现出更强的代码探索能力和更简洁的思维链逻辑,能更深入地挖掘软件漏洞的根源。在多项行业基准测试中,其智能水平已接近顶尖闭源模型,同时保持了显著的价格优势。

  • Wednesday · 16 min

    JD.com:JoyAI-VL 实时视觉交互与主动感知系统 实现边看边做

    京东 (JD.com) 开发的 JoyAI-VL-Interaction,这是一款突破传统“轮对对话”模式的开源实时愿景-语言交互模型。该系统不仅能持续监测实时视频流,还能自主决定何时说话、保持沉默或将复杂任务移交给后台模型处理。这种主动交互的设计使其在安全监控、实时解说和长程记忆等应用场景中,比 Doubao 或 Gemini 等现有产品更具优势。为了促进技术普及,开发团队向社区全面开源了 8B 规模的模型权重、独特的训练方案以及完整的可部署系统架构。通过引入 AdaCodec 视频编码技术,该系统能够在保证低延迟的同时处理数小时的连续视频,为未来的具身智能和实时 AI 助手奠定了基础。

  • Tuesday · 14 min

    阿里巴巴:LingBot-Vision 密集空间感知预训练 10亿参数AI看清物理空间

    LingBot-Vision 视觉预训练模型,其核心理念是通过边界引导的掩码建模来提升计算机对密集空间结构的感知能力。研究团队认为,传统的视觉大模型往往过于关注语义的一致性,而忽视了对物理世界至关重要的几何边界和形状细节。为了解决这一问题,该方法利用自监督学习从原始图像中自动提取子像素级的边界场,并强制模型重点重构这些包含丰富信息量的边界区域。实验证明,该模型在深度估计、物体分割及深度补全(LingBot-Depth 2.0)等任务中表现卓越,性能甚至超越了参数量大其数倍的现有顶尖模型。这种以边界为中心的预训练原则,为构建具备物理常识和行动能力的具身人工智能奠定了坚实基础。

  • Monday · 18 min

    MIRA:基于表示自动编码器的多玩家互动世界模型 AI自学重构多人对战

    MIRA,首个针对 Rocket League(火箭联盟)等高度动态、物理交互复杂的环境所设计的多代理交互式世界模型。该模型拥有 50 亿参数,通过在 10,000 小时的多人游戏数据上进行训练,能够根据多名玩家的实时操作指令,同步生成逻辑一致且视觉逼真的比赛画面。与以往将其他玩家视为环境一部分的单人模型不同,MIRA 能够准确捕捉并区分不同玩家行为对场景产生的物理影响。其核心架构基于潜在扩散模型和表征自编码器,实现了在单个 GPU 上以每秒 20 帧的速度进行实时推理。实验证明,该模型在长达数小时的生成过程中依然能保持极高的稳定性与物理真实性。此外,团队还开源了相关数据集、代码及在线演示,旨在推动多玩家协作与对抗环境下世界模型的研究。

  • August 21 · 23 min

    DeepSeek:DSpark 具有置信度调度与半自回归生成的投机采样框架 让AI生成快如闪电

    DSpark 是一种由 DeepSeek 团队研发的新型投机采样解码(Speculative Decoding)框架,旨在提升大语言模型的推理速度。该框架采用半自回归架构,结合了并行生成的高效率与自回归模型的高准确性,有效解决了传统并行草稿模型中后期预测质量下降的问题。为了进一步优化系统吞吐量,DSpark 引入了置信度调度验证机制,能够根据系统负载和预测准确概率动态调整验证长度。这种硬件感知的调度策略避免了在高并发场景下浪费计算资源。在 DeepSeek-V4 系统的实际部署中,DSpark 在保持相同吞吐能力的同时,将单用户生成速度提升了 60% 至 85%。总之,该技术通过“更优质的草稿”和“更智能的验证”,成功突破了大型模型在线推理的性能瓶颈。

  • August 20 · 20 min

    LingBot-Video:具身智能混合专家视频预训练模型 AI视频终于懂物理了

    这份技术文档介绍了 LingBot-Video,这是首个面向具身智能的大规模开源混合专家(MoE)视频生成模型。研究团队针对传统视频模型在物理真实性和计算效率上的不足,采用扩散转换器(DiT)架构结合稀疏 MoE 设计,实现了模型容量与推理成本的平衡。通过构建包含机器人操作和第一视角数据的增强型语料库,该模型能够更深刻地理解真实世界的动力学规律。此外,项目引入了多维奖励系统,在追求视觉美感的同时,重点强化了对物理合理性和任务达成度的对齐。实验证明,该架构在扩展至 1200亿参数时仍表现出优异的性能与效率,成功搭建了数字创作与物理动作执行之间的桥梁。

  • August 19 · 23 min

    OpenRath:以会话为中心的多智能体运行时状态架构 实现AI操作全程审计

    OpenRath 是一种为多智能体系统设计的以会话(Session)为中心的运行时框架,旨在解决智能体在执行任务时状态碎片化且难以审计的问题。它借鉴了 PyTorch 的编程模型,将 Session 视为一种可流动、可分支且可回溯的一等公民(First-class value),统一记录对话流、工具调用证据、沙箱环境及谱系元数据。通过这种设计,开发者可以将复杂的智能体协作解构为一系列会话转换操作,实现任务执行过程的透明化与可重现。该系统并不取代现有的调度或追踪工具,而是充当一种连接性协议,确保所有外部效应都能整合进统一的运行时状态中。这种架构为智能体行为的合规性审查和系统性评估提供了坚实的底层支撑。

  • August 18 · 22 min

    MemSlides:分层记忆驱动的个性化幻灯片生成框架 让AI改PPT更懂你

    MemSlides 是一种创新的层次化存储驱动代理框架,旨在实现个性化演示文稿的自动生成与精准修订。该系统突破了传统模型难以维持用户长期偏好的局限,通过长期记忆(包含用户画像与工具经验)与工作记忆(记录当前任务状态)的解耦,确保幻灯片风格与用户习惯高度对齐。与重复生成整份文稿的常规方法不同,它采用局部修订策略,能够针对反馈进行精确的“最小化更新”,从而避免无关内容的非预期偏移。实验证明,这种架构在初稿画像匹配度和多轮修改的可靠性方面均表现优异,显著提升了办公自动化中的交互效率。其核心贡献在于将个性化从简单的提示词工程转变为一种基于记忆的高效闭环服务。

  • August 17 · 18 min

    Princeton:小语言模型 剪枝与从头训练的抉择

    这篇文章探讨了小参数语言模型的最佳构建路径,即在给定相同资源的情况下,应当从头训练还是通过剪枝大型模型来获得。研究发现,当训练数据有限时,剪枝初始化由于继承了父模型的知识,性能显著优于随机初始化。然而,随着训练规模扩大,这种初始化优势会逐渐减弱。对于结构化剪枝(如减少层数或宽度),增加从头训练的样本量可以赶上甚至超越剪枝模型。相比之下,稀疏剪枝展现出更强的知识留存能力,即便在海量数据下,其表现依然领先于同规模的从头训练模型。总之,剪枝是节省算力的捷径,但在资源充沛且追求硬件效率时,从头训练依然具有竞争力。

  • August 14 · 13 min

    P2P网络中的分布式大模型推理方案 像BT一样跑大模型

    点对点网络的大语言模型(LLM)分布式推理方案,旨在通过去中心化路由优化前缀缓存效率。每个节点利用基数树维护自身的缓存状态,并依靠异步反熵机制与同行交换轻量级的元数据,以实现全局缓存感知的任务分配。这种设计规避了传统中心化调度器的瓶颈,且无需在网络中传输庞大的KV缓存张量。研究指出,即使在元数据弱一致性的情况下,系统仍能保证生成的正确性,因为过时的信息只会导致缓存失效而非错误输出。实验证明,该方案在偏斜负载和低延迟网络环境中能显著提升推理速度,但也可能引发特定的节点负载不均问题。

  • August 13 · 19 min

    ViQ:任意分辨率下的文本对齐视觉量化表示 将图像压成离散词元

    ViQ 是一种新型的视觉量化表示框架,旨在将图像转化为与文本类似的离散标记,从而统一多模态建模。该研究通过两阶段训练策略——文本对齐预训练和特征离散化,成功解决了传统离散表示在高层语义与低层细节之间难以平衡的问题。ViQ 的核心优势在于支持原生分辨率输入,并引入了近端表示学习与位置感知量化机制,显著降低了量化过程中的信息损失。实验证明,该模型在多模态理解任务上达到了与连续视觉编码器相当的水平,同时在图像重建质量上表现出色。此外,采用这种离散表示法可为多模态大模型的训练带来 20% 至 70% 的效率提升,实现了性能与速度的双重优化。

  • August 12 · 22 min

    DomainShuttle:全域灵活驱动的文字生成视频技术 破解视频跨域难题

    DomainShuttle 是由香港科技大学研究团队提出的一种新型开放域主体驱动视频生成框架,旨在解决现有技术在跨领域场景中编辑灵活性不足的问题。该研究通过引入 Domain-MoT 模块实现视频与参考图像特征的解耦,并利用领域感知 AdaLN 技术确保模型能精准捕捉主体特征,同时灵活适应各种艺术风格。此外,Video-Reference DualRoPE 机制优化了主体间的空间建模,而跨对一致性损失(CCL)则通过对齐多组参考图像,进一步提取不受环境干扰的核心属性。实验数据表明,该方法在跨领域一致性评分上较现有先进模型提升了 18.7%,实现了高保真度与生成灵活性的理想平衡。这种技术在广告创意、AI 电影制作及个性化视频定制等领域具有显著的应用潜力。

  • August 11 · 23 min

    Baidu Unlimited OCR:长文本解析的新时代 让OCR学会选择性遗忘

    百度开发的 Unlimited OCR 模型,旨在解决传统端到端 OCR 在处理长文档时产生的显存占用高和推理速度慢的问题。核心创新在于提出了 参考滑动窗口注意机制 (R-SWA),它模仿人类“工作记忆”模式,使解码器仅关注全部视觉参考和有限的近期输出上下文。这种设计实现了恒定的 KV 缓存,确保模型在单次前向传播中处理数十页文档时,推理延迟和显存需求不再随长度增长。实验结果显示,该模型在 OmniDocBench 基准测试中达到了行业领先水平,显著超越了其基础模型 DeepSeek OCR。此外,这种机制表现出极佳的泛化潜力,未来有望应用于语音识别和翻译等其他长序列任务。该研究为实现真正意义上的一键式长文本解析提供了高效且低成本的架构方案。

  • August 10 · 16 min

    Alibaba Qwen-AgentWorld:通向通用智能的多域语言世界模型 让AI三思而后行

    Qwen-AgentWorld 是由阿里 Qwen 团队开发的首个通用语言世界模型,旨在模拟包括操作系统、网页、安卓和软件工程在内的七大核心交互环境。该研究通过持续预训练 (CPT)、指令微调 (SFT) 和强化学习 (RL) 三阶段流水线,利用超过 1000 万条环境轨迹使模型具备预测动作反馈的能力。这种世界模型既可以作为解耦的模拟器,通过提供可控且可扩展的训练环境来增强智能体,也可以作为统一的基座模型,将预测未来状态的能力内化为智能体的思考模式。为了严谨评估模型性能,研究团队同步推出了 AgentWorldBench 基准测试,全面衡量模型在环境模拟上的真实性与保真度。实验证明,这种对外部世界运行规律的建模显著提升了通用智能体在复杂任务中的决策和规划水平。

  • August 7 · 18 min

    UC Berkeley:随动如我 看日常视频练出机器人灵巧手

    这项研究介绍了一种名为 DO AS I DO 的创新算法,旨在将普通人类动作视频转化为机器人可执行的多指灵巧操控数据。该算法通过计算机视觉基础模型重构三维手物交互过程,并利用物理模拟器中的重定位优化技术,解决人类与机器人形态差异及物理可行性问题。研究团队开发的物体追踪方法在处理遮挡和运动模糊方面超越了现有技术,能够广泛支持第一视角、第三视角甚至生成的视频素材。通过对互联网视频的自动化处理,该系统成功在真实机器人平台上实现了拾取、搅拌和书写等多种复杂任务。此外,作者还提出了一套数据过滤准则,量化了从海量网络视频中筛选高质量机器人学习数据的挑战。这项工作为利用海量人类视频数据实现机器人规模化学习开辟了新路径。

  • August 6 · 25 min

    FPRM:基于定点收敛的可自适应深度循环Transformer 700万参数AI逻辑反超大模型

    FPRM是一种基于递归Transformer架构的深度学习模型,专门用于解决需要复杂逻辑推理的任务。该研究针对循环架构中常见的信号传播不稳定问题,创新性地结合了层前归一化与残差缩放技术,确保模型在极深层级下仍能保持训练稳定。不同于传统依靠固定步数或额外预测模块的停机方式,该模型利用不动点收敛机制作为天然的停机信号,实现了计算量与任务难度的自动适配。实验证明,FPRM在Sudoku、迷宫及ARC-AGI等基准测试中表现卓越,且无需复杂的层级结构即可超越现有基准。通过在推理阶段动态调整计算深度,该模型在显著提升推理准确率的同时,也优化了计算效率。

  • August 5 · 18 min

    Microsoft:FastContext 训练高效的编程代理代码库探索器 解耦代码搜索与修复

    FastContext 是一种由微软与上海交通大学联合开发的轻量级代码仓探索子代理,旨在解决大型语言模型在软件工程任务中因定位代码而产生的资源浪费问题。它通过将仓库搜索与任务求解相分离,利用 4B 至 30B 参数的小型专门模型,通过并行调用工具来精确锁定相关的代码行。研究表明,该方案能为主要开发代理减少高达 60% 的 Token 消耗,同时将任务解决率提升约 5.5%。该系统采用了**监督微调(SFT)和强化学习(RL)**技术,使其具备从广度搜索到精准引用的高效转化能力。这种模块化的设计证明,将复杂的代码检索任务交给专用子代理,可以显著优化自动化软件开发的成本与性能。

  • August 4 · 22 min

    ErdosBench:数学评估基准文档 108KB文档里的AI冒烟测试

    ErdosBench详细列出了 GitHub 的各项功能,包括 AI 编程辅助、代码安全管理以及开发者工作流工具。目前该项目处于早期阶段,最近的提交记录显示其为 初始公开测试版本。通过这个页面,用户可以了解到该数学或算法相关基准测试工具的元数据与版本历史。

  • August 3 · 20 min

    Weibo:VibeThinker-3B 小规模模型的极限推理性能突破 3B模型逻辑碾压万亿大厂

    微博 AI 开发的 VibeThinker-3B 模型,旨在探索 30 亿参数 规模下小模型的极限推理边界。该研究基于 Spectrum-to-Signal 后训练范式,通过两阶段课程学习、多领域强化学习及离线自蒸馏等技术,使模型在数学和编程等验证性任务上取得了突破。实验结果显示,该模型在 AIME26 和 LiveCodeBench 等权威榜单上表现优异,性能可比肩规模大其百倍的 DeepSeek V3.2 和 Gemini 3 Pro 等旗舰级推理系统。研究团队据此提出了参数压缩-覆盖假设,认为复杂的逻辑推理能力可以被高度压缩进精简的模型核心中。这种推理与知识解耦的新范式证明,小模型不再仅仅是效率的妥协方案,更是通向尖端人工智能推理能力的独立演进路径。

Showing 1–20 of 30 episodes