Skip to content
Artwork for 每日AI

每日AI

每日新闻

畅读AI学术论文,聚焦前沿趋势,普及人工智能

Play
  • 36 episodes
  • daily
  • Avg 19 min
  • Chinese
Counted on this page — what you have heard stays on this device, so it is not something the list can be paged by.
  • August 10 · 16 min

    Alibaba Qwen-AgentWorld:通向通用智能的多域语言世界模型 让AI三思而后行

    Qwen-AgentWorld 是由阿里 Qwen 团队开发的首个通用语言世界模型,旨在模拟包括操作系统、网页、安卓和软件工程在内的七大核心交互环境。该研究通过持续预训练 (CPT)、指令微调 (SFT) 和强化学习 (RL) 三阶段流水线,利用超过 1000 万条环境轨迹使模型具备预测动作反馈的能力。这种世界模型既可以作为解耦的模拟器,通过提供可控且可扩展的训练环境来增强智能体,也可以作为统一的基座模型,将预测未来状态的能力内化为智能体的思考模式。为了严谨评估模型性能,研究团队同步推出了 AgentWorldBench 基准测试,全面衡量模型在环境模拟上的真实性与保真度。实验证明,这种对外部世界运行规律的建模显著提升了通用智能体在复杂任务中的决策和规划水平。

  • August 7 · 18 min

    UC Berkeley:随动如我 看日常视频练出机器人灵巧手

    这项研究介绍了一种名为 DO AS I DO 的创新算法,旨在将普通人类动作视频转化为机器人可执行的多指灵巧操控数据。该算法通过计算机视觉基础模型重构三维手物交互过程,并利用物理模拟器中的重定位优化技术,解决人类与机器人形态差异及物理可行性问题。研究团队开发的物体追踪方法在处理遮挡和运动模糊方面超越了现有技术,能够广泛支持第一视角、第三视角甚至生成的视频素材。通过对互联网视频的自动化处理,该系统成功在真实机器人平台上实现了拾取、搅拌和书写等多种复杂任务。此外,作者还提出了一套数据过滤准则,量化了从海量网络视频中筛选高质量机器人学习数据的挑战。这项工作为利用海量人类视频数据实现机器人规模化学习开辟了新路径。

  • August 6 · 25 min

    FPRM:基于定点收敛的可自适应深度循环Transformer 700万参数AI逻辑反超大模型

    FPRM是一种基于递归Transformer架构的深度学习模型,专门用于解决需要复杂逻辑推理的任务。该研究针对循环架构中常见的信号传播不稳定问题,创新性地结合了层前归一化与残差缩放技术,确保模型在极深层级下仍能保持训练稳定。不同于传统依靠固定步数或额外预测模块的停机方式,该模型利用不动点收敛机制作为天然的停机信号,实现了计算量与任务难度的自动适配。实验证明,FPRM在Sudoku、迷宫及ARC-AGI等基准测试中表现卓越,且无需复杂的层级结构即可超越现有基准。通过在推理阶段动态调整计算深度,该模型在显著提升推理准确率的同时,也优化了计算效率。

  • August 5 · 18 min

    Microsoft:FastContext 训练高效的编程代理代码库探索器 解耦代码搜索与修复

    FastContext 是一种由微软与上海交通大学联合开发的轻量级代码仓探索子代理,旨在解决大型语言模型在软件工程任务中因定位代码而产生的资源浪费问题。它通过将仓库搜索与任务求解相分离,利用 4B 至 30B 参数的小型专门模型,通过并行调用工具来精确锁定相关的代码行。研究表明,该方案能为主要开发代理减少高达 60% 的 Token 消耗,同时将任务解决率提升约 5.5%。该系统采用了**监督微调(SFT)和强化学习(RL)**技术,使其具备从广度搜索到精准引用的高效转化能力。这种模块化的设计证明,将复杂的代码检索任务交给专用子代理,可以显著优化自动化软件开发的成本与性能。

  • August 4 · 22 min

    ErdosBench:数学评估基准文档 108KB文档里的AI冒烟测试

    ErdosBench详细列出了 GitHub 的各项功能,包括 AI 编程辅助、代码安全管理以及开发者工作流工具。目前该项目处于早期阶段,最近的提交记录显示其为 初始公开测试版本。通过这个页面,用户可以了解到该数学或算法相关基准测试工具的元数据与版本历史。

  • August 3 · 20 min

    Weibo:VibeThinker-3B 小规模模型的极限推理性能突破 3B模型逻辑碾压万亿大厂

    微博 AI 开发的 VibeThinker-3B 模型,旨在探索 30 亿参数 规模下小模型的极限推理边界。该研究基于 Spectrum-to-Signal 后训练范式,通过两阶段课程学习、多领域强化学习及离线自蒸馏等技术,使模型在数学和编程等验证性任务上取得了突破。实验结果显示,该模型在 AIME26 和 LiveCodeBench 等权威榜单上表现优异,性能可比肩规模大其百倍的 DeepSeek V3.2 和 Gemini 3 Pro 等旗舰级推理系统。研究团队据此提出了参数压缩-覆盖假设,认为复杂的逻辑推理能力可以被高度压缩进精简的模型核心中。这种推理与知识解耦的新范式证明,小模型不再仅仅是效率的妥协方案,更是通向尖端人工智能推理能力的独立演进路径。

  • July 31 · 19 min

    Stanford:Co-STORM 多智能体协作对话辅助复杂信息寻优 AI组团辩论挖掘未知的未知

    Co-STORM 是一种创新的信息获取系统,旨在通过模拟多智能体对话来协助用户发现“未知的不明信息”。该系统模仿教育场景,让用户观察并参与由多个语言模型智能体(如专家和主持人)组成的协作讨论。通过动态生成的思维导图,系统能够实时组织零散信息,并最终为用户生成一份包含引用的长篇调研报告。研究表明,该系统在处理复杂搜索任务时优于传统的搜索引擎和RAG聊天机器人。在实际评估中,大多数用户认为 Co-STORM 能有效降低认知负担,并能引导出更具深度和启发性的知识发现。这种多角色交互机制不仅提升了信息检索的效率,还为学习者提供了更具参与感的探索体验。

  • July 30 · 18 min

    UC Berkeley:VIMPO 基于价值隐含策略优化的LLM强化学习 让AI精准揪出逻辑错误

    VIMPO,这是一种针对大语言模型强化的隐式价值策略优化方法。传统的强化学习方法往往在训练简便性与信用分配的精准度之间难以兼得,而 VIMPO 通过 KL 正则化下的最优性条件,直接从策略模型中导出价值函数。该方法消除了训练额外评论家网络(Critic)的必要,利用策略与参考模型之间的对数比率实现了词元级(token-level)的信用分配。实验结果显示,VIMPO 在多项数学推理基准测试中表现优于 GRPO,尤其在面对噪声奖励时展现出更强的稳健性。通过这种方式,VIMPO 成功结合了无评论家训练的简便性与演员-评论家方法的高效监督性能。

  • July 29 · 24 min

    万向解密:机器语言引擎与前沿AI隐写通道研究 AI用外星语绕过监控

    这份名为 GLOSSOPETRAE 的技术报告探讨了前沿人工智能模型在语言习得与安全监控方面的核心漏洞。研究发现,AI 模型能够零样本掌握程序生成的全新人工语言,甚至在执行人类完全无法阅读的代码时表现优于标准代码。由于不同模型家族的分词器(Tokenizer)处理 Unicode 字符的方式存在差异,攻击者可以利用不可见字符建立隐蔽信道,使两个 AI 能够在监控模型完全“失明”的情况下交换信息。尽管针对不可见字符的物理信道可以通过输入过滤轻易阻断,但基于自然语言修辞的语义隐写术依然能绕过所有现有的监测手段。作者警告称,AI 处理符号系统的能力与人类审计能力之间的代差已构成严重的监管挑战,目前尚无成熟的防御方案能彻底解决语义层面的隐蔽通信问题。

  • July 28 · 17 min

    UC Berkeley:LOCUS 美国地方条例语料库及分层法律分析 AI破解七百万页地方法规

    LOCUS 是一个专为美国地方政府法令设计的全新大规模、机器可读数据库,填补了法律人工智能在市县级规章领域的空白。研究团队通过 OCR 技术和 ModernBERT 分类器,处理了超过 9,000 份包含土地规划、商业许可及公共卫生的法律文件。该项目通过县级协调层实现了地理信息与法律文本的匹配,目前已覆盖全美 94% 的人口。此外,研究人员引入了不透明度、家长式作风等四个维度对法令进行量化评分,以便深入分析不同地区的政策倾向。这一资源的发布不仅促进了法律 AI 的检索与推理能力,也为研究美国地方治理的复杂结构提供了基础架构。

  • July 27 · 14 min

    智谱 GLM-5:从Vibe Coding转向智能体工程的基座模型 让AI自主开发软件

    GLM-5 是由智谱 AI 与清华大学联合推出的下一代旗舰级基座模型,旨在实现从“感性编码”向智能体工程的范式转换。该模型采用全新的深度求索稀疏注意力(DSA)架构,在显著降低训练与推理成本的同时,将上下文处理能力提升至 200K。通过引入创新的异步强化学习基础设施,GLM-5 实现了生成与训练的解耦,大幅增强了模型在复杂、长周期任务中的自主决策与自我纠错能力。在多个主流基准测试中,GLM-5 展现出顶尖的性能,特别是在端到端软件工程和真实编程场景下表现卓越。此外,该模型实现了对国产 GPU 生态的全栈适配,为构建高效、实用的下一代 AI 智能体提供了坚实的技术基础。

  • July 24 · 15 min

    Stanford:STORM 多视角对话式维基百科长文合成系统 让AI学会深度提问

    该研究介绍了由斯坦福大学开发的 STORM 系统,旨在利用大语言模型从零开始撰写具备维基百科水准的深度长篇文章。研究团队指出,现有的生成模型在撰写前缺乏必要的研究与规划阶段,导致内容肤浅或产生幻觉。STORM 模拟了人类的写作预处理过程,通过多视角提问和模拟对话,从互联网搜集可信证据并构建逻辑严密的文章大纲。为了测试该系统,研究者创建了 FreshWiki 数据集,涵盖了模型训练截止日期之后的最新高质量条目。实验结果显示,资深维基百科编辑高度认可 STORM 在内容全面性和结构组织上的优势。尽管在消除互联网偏见和复杂逻辑推断方面仍面临挑战,但该系统被证实是辅助长文创作的有力工具。

  • July 23 · 16 min

    AI招人竟然重女轻男 LLM在招聘中的性别偏见研究

    这项研究探讨了大型语言模型(LLM)在日本企业招聘场景中是否存在性别偏见。研究人员利用 60 份日式简历并配以不同性别的姓名,对 GPT-4o 和 Claude 等五种主流模型进行了数万次测试。实验结果显示,即便在简历内容完全一致的情况下,所有模型均对女性申请者表现出明显的评分偏好。研究发现,简单的提示词指令无法有效消除这种偏见,因为模型主要通过候选人姓名来推断性别。相比之下,通过隐私过滤器对姓名进行脱敏处理能显著降低不公平性,但这也可能触发某些模型的安全审核机制而导致请求被拒绝。这项工作揭示了模型对齐策略在不同文化背景下的局限性,并为优化招聘公平性提供了实证参考。

  • July 22 · 12 min

    Surflo:全局潜变量流匹配三维几何重建 几张照片秒变高精3D

    Surflo 是一种创新的 3D 重建模型,能够将数量不等的无位姿 RGB 图像压缩为统一的全局潜变量。该模型采用流匹配(Flow Matching)解码器,支持在单次前向传播中从同一潜变量解码出任意分辨率的 3D 表面点云和网格。与传统的逐视图重建方法不同,它通过全局状态消除了数据冗余,有效解决了视图间几何不一致的问题。此外,研究者引入了渲染引导机制,通过光度梯度在推理时优化点云精度并消除离群点。该方法在多个基准测试中表现卓越,且处理速度比基于优化的技术快一个数量级。最终,该研究还贡献了 DL3DV 场景级水密网格数据集,为未来的 3D 表面学习提供了重要资源。

  • July 21 · 17 min

    Zep:用于智能体记忆的时序知识图谱架构 攻克AI失忆症

    Zep 新型 AI 智能体内存层服务,旨在解决传统检索增强生成(RAG)框架在处理动态数据时的局限性。Zep 的核心驱动力是名为 Graphiti 的知识图谱引擎,它能够动态提取对话中的时间信息与语义实体,从而模拟人类的阶段性与关联性记忆。实验结果表明,在处理复杂且长篇幅的企业级任务时,该系统不仅在检索准确率上超越了现有的 MemGPT,还显著降低了响应延迟。通过构建包含事件、实体和社区的多层级图谱结构,Zep 能够有效管理持续演进的业务数据和历史关系。这种时空感知的架构设计,为开发具备长期记忆和深度逻辑推理能力的 AI 助手提供了高效的生产级解决方案。

  • July 20 · 25 min

    Alibaba:LingBot-World-Infinity 无限交互世界模型

    LingBot-World 2.0(又名 LingBot-World-Infinity)是一款由 Ant Group 等团队开发的先进实时交互式世界模型。该系统通过因果预训练与蒸馏技术,克服了长时生成中的画面漂移问题,能够稳定输出长达一小时且无画质衰减的 720p/60fps 视频流。其核心亮点在于引入了导演-飞行员(Director-Pilot)代理架构:由视觉语言模型充当“导演”进行逻辑推理与事件策划,由扩散变压器担任“飞行员”渲染物理规律一致的视觉画面。用户不仅能通过键盘控制角色移动,还能触发战斗、施法、改变天气等深度交互指令。该项目已完全开源,提供不同参数规模的模型,旨在为游戏生成和具身智能模拟提供一个无限、稳定且可感知的虚拟环境。

Showing 21–36 of 36 episodes