每日新闻
每日AI
畅读AI学术论文,聚焦前沿趋势,普及人工智能
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
GigaWorld:让机器人反应提速九倍 07.05.2026 13:24
GigaWorld-Policy 是一种高效的 动作中心化世界-动作模型 (WAM) ,旨在解决机器人控制中数据监督稀疏和推理延迟高的问题。该模型通过 因果序列建模 ,将动作预测与未来视觉动力学预测相结合,在训练阶段利用 高密度视觉监督 来增强动作学习的物理可靠性。与传统依赖迭代采样视频的 WAM 不同,它在推理时支持 可选的视频生成模式 ,从而显著降低计算开销并实现低延迟控制。为了提升泛化能力,研究团队采用了 课程预训练方案 ,将通...
华为:MoCapAnything V2 视频精准驱动任意3D骨骼 07.05.2026 16:41
MoCapAnything V2 是一个创新的 端到端 单目视频 动作捕捉 框架,旨在将人类或动物的运动转化为任意骨骼结构的 动画 。该系统弃用了传统复杂的中间网格生成和不可微的 逆运动学(IK)计算,转而采用完全可学习 的神层网络,使推理速度提升了约 20 倍 。通过引入 参考姿态-旋转对 ,该模型有效解决了骨骼坐标系定义不明导致的旋转歧义,大幅提高了捕捉精度。核心技术 GL-GMHA 机制融合了局部运动链推理与全局协调,确保了在处理...
Meta:Tuna-2 细粒度视觉感知 07.05.2026 20:58
Tuna-2 是一种创新的 原生统一多模态模型 ,它摒弃了传统的预训练视觉编码器。该模型通过直接基于 原始像素嵌入 进行操作,实现了视觉理解与图像生成的完全 端到端优化 。研究人员引入了一种基于 掩码的视觉特征学习方案 ,以增强模型在处理高维像素空间时的稳健性。实验结果显示, Tuna-2 在多项基准测试中达到了领先水平,尤其在需要 细粒度视觉感知 的任务上表现卓越。这证明了移除视觉编码器不仅能 简化模型架构 ,还能在多模...
BixBench:生物学AI Agent基准测试 06.05.2026 12:00
BixBench 是一个专门为评估 LLM 智能体 在 生物信息学 领域处理真实世界数据分析能力而设计的综合性基准测试。该基准包含 61 个复杂的分析场景和 205 个开放式问题,要求模型在 计算生物学 环境下完成多步骤的实验规划、数据探索及结果解读。研究团队利用 GPT-4o 和 Claude 3.5 Sonnet 在开源智能体框架上进行了测试,结果显示这些前沿模型在开放式回答中的准确率仅为 21%,在选择题测试中的表现也仅略高于随机水平。作者通过...
MinerU2.5:高效高分辨率文档解析模型 06.05.2026 20:12
MinerU2.5 是由上海人工智能实验室及其合作机构开发的一种具有 12亿参数 的视觉语言模型,专门用于高效且高精度的 解析复杂文档 。该模型采用了创新的 两阶段解耦策略 ,首先在低分辨率下进行全局 布局分析 ,随后对原始高分辨率图像进行局部 内容识别 ,从而大幅降低计算开销并减少模型幻觉。其技术核心包括针对数学公式的 ADR 框架 、针对表格的 OTSL 语言 ,以及通过 IMIC 策略 自动筛选疑难样本的数据引擎。实验数...
OpenAI:推理模型的可监测性评估研究 06.05.2026 21:43
研究探讨了如何衡量并提升人工智能系统 思维链(CoT)的可监测性 ,以确保日益自主的代理在部署中具备安全性。作者提出了 干预、过程及结果属性 三类评估框架,并引入了专用的 g-mean²指标 来量化监控有效性。实验表明, 更长的思维链 通常能显著提高可监测性,且这种监控方式比仅观察代理行为更有效。研究还揭示了**“可监测性税” 现象,即通过部署推理更充分的小型模型,可以在保持性能的同时提升可监测性。此外,强化学习(RL)...
Tequila:三值量化让手机跑大模型 05.05.2026 20:29
Tequila 新型 大语言模型(LLM)三值量化 技术,旨在解决模型压缩过程中的性能损失问题。传统的三值量化通过将权重限制在 {-1, 0, 1} 来加速推理,但容易导致大量权重陷入“ 死区(deadzone) ”,因缺乏有效梯度而无法优化。 Tequila 创新性地将这些被困权重重新利用为 动态偏置 ,通过可微的激活函数为模型提供持续的信号流。实验表明,该方法在显著提升模型精度的同时,仅需极少的训练数据即可接近全精度性能。此外,由于偏置项...
Alibaba:零成本修复AI绘图信噪比偏差 05.05.2026 25:23
这项研究详细探讨了扩散概率模型(DPMs)中存在的 信噪比-时间步偏置(SNR-t bias) ,即在推理阶段,预测样本的实际信噪比与设定的时间步之间出现了失配。作者通过理论证明和实验发现,这种偏置会导致模型生成的样本信噪比偏低,进而引发误差累积并损害生成质量。为此,研究者提出了一种名为**DCW(小波域微分修正)**的无需训练、即插即用的新方法。该方法利用小波变换将图像分解,并根据扩散模型从宏观轮廓到微观细节的去噪特性...
普华永道:榨干提示词缓存红利-AI智能体提示词缓存评估 05.05.2026 21:13
这项研究评估了 长周期智能体(Agentic Tasks)在不同大模型供应商(OpenAI、Anthropic 和 Google)中的提示词缓存(Prompt Caching)表现。实验证明,通过缓存静态的系统提示词,开发者可以将 API 调用成本降低 41% 至 80%,并使首字延迟(TTFT)缩短 13% 至 31% 。研究特别强调, 有针对性地控制缓存边界 (如仅缓存系统提示词并排除动态工具执行结果)比全上下文自动缓存更有效,因为后者可能因处理不常复用的内容而增加延迟。...
MultiWorld:可扩展的多Agents多视角视频世界模型 04.05.2026 21:45
MultiWorld 是一种专为 多智能体 和 多视图 场景设计的创新型视频世界模型框架。该研究针对传统模型在处理多角色交互及视觉一致性方面的不足,开发了 多智能体条件模块 与 全局状态编码器 ,实现了对多个操作主体的精准控制。通过将不同视角的观测信息整合为统一的 三维环境状态 ,该系统能够确保多机位生成的画面在空间逻辑上保持高度同步。此外,该框架具备极强的 可扩展性 ,支持动态调整参与者数量与观测视角,显著提升了复杂...
SkVM:Token消耗减半的高效AI Agent智能体时代编译运行系统 04.05.2026 14:07
SkVM ,这是一个专为提升大模型智能体 技能(Skills) 执行效率与通用性而设计的 编译与运行时系统 。研究指出,目前的智能体直接将技能视为原始上下文,常因 模型差异、框架不匹配及环境冲突 导致执行失败或效率低下。 SkVM 借鉴传统编译器理念,通过 AOT(事前编译) 技术针对不同模型生成优化变体,并利用 JIT(即时编译) 机制实现代码固化与自适应重编。该系统还引入了 能力分析、环境绑定和并发提取 等功能,以减少资...
智能体Context Engineering:给AI一本自我进化笔记 04.05.2026 23:08
这项研究介绍了一种名为 ACE (Agentic Context Engineering) 的创新框架,旨在通过优化上下文来提升大语言模型的性能。研究人员发现,现有的提示词优化方法往往存在 简略偏见 和 上下文崩溃 的问题,导致模型丢失关键的领域知识。 ACE 将上下文视为不断进化的“实战手册”,通过 生成器 、 反射器 和 策划器 三个模块协作,实现知识的持续积累与提炼。该框架引入了 增量更新 和 增长精炼 机制,能有效保留复杂的任务策略并降低计...
Context Engineering:上下文工程综述 02.05.2026 14:04
上下文工程 (Context Engineering)为超越简单提示词设计的系统性 信息载荷优化 学科。研究通过建立一个多维分类法,将该领域拆解为 基础组件 (如检索、处理与管理)与 系统实现 (如高级RAG、记忆系统及多智能体协作)两大核心支柱。作者深入分析了1400余篇研究论文,旨在解决模型在 超长文本处理 、 结构化知识融合 以及 多模态上下文理解 等方面的技术瓶颈。调查揭示了当前模型在理解复杂上下文与生成高质量长篇输出之间存在...
Vista4D:视频拍完也能重新运镜Video Reshooting 02.05.2026 11:44
Vista4D 旨在实现高质量的 视频重拍 (Video Reshooting)。该技术通过将原始视频转化为 4D 点云 表示,允许用户在后期处理中自由调整 摄像机轨迹 和视角,同时保持场景的动态一致性。为了解决传统模型在处理真实世界深度估算时产生的伪影问题, Vista4D 采用了 静态像素分割 与 噪声多视图数据 训练,显著增强了画面的稳定性。此外,该系统在 内容保留 、 镜头控制精度 及视觉质量方面均优于现有基准模型。除了基本的视角切换...
DFlash:让LLM无损加速快6倍 02.05.2026 17:30
DFlash 是一种创新的推测解码框架,旨在通过 轻量化块扩散模型 解决大型语言模型推理速度慢的问题。该方案利用主模型的 隐藏层特征 作为上下文引导,通过 单次前向传递 并行生成多个备选词元,显著降低了生成延迟。与传统的递归式草图模型相比,这种 并行扩散采样 方式极大提高了硬件利用率和草图准确性。实验证明,该技术能实现超过 6 倍的无损加速 ,且性能大幅领先于现有的 EAGLE-3 等前沿方法。这种将扩散模型定位为高效“草...
GPQA:博士开卷也挂科 研究生级科学基准测试 01.05.2026 23:59
GPQA 是一个包含448道高质量多选题的基准测试集,涵盖了 生物、物理和化学 等研究生水平的专业知识。该数据集由 领域专家 编写,旨在通过极高的难度挑战现有的 人工智能系统 和人类。研究显示,即使可以 使用互联网 ,非专家读者的准确率也仅为34%,而像 GPT-4 这样的先进模型表现也差强人意。开发此测试集的目的是为了推动 可扩展监督 技术的研究,帮助人类未来能有效监督超越人类能力的AI。专家们通过严格的 验证流程 确保了问题...
Context Engineering 2.0:AI如何读懂你 01.05.2026 23:02
本文探讨了 情境工程(Context Engineering)的历史演变与理论框架,将其定义为优化机器理解人类意图的系统性过程。作者提出情境工程并非新兴产物,而是经历了从1.0 时代(原始计算)到2.0 时代(智能体中心)的进化,并预见未来将迈向人类级 乃至 超人类级 智能。核心观点认为,随着机器智能水平的提升, 信息熵 得以降低,从而显著减少了人机交互的成本。文中详细分析了 情境的采集、存储与管理 ,强调通过更强的处理能力让机器...
RKLD:精准切除AI隐私记忆 01.05.2026 16:54
这项研究提出了一种名为 RKLD 的新型大型语言模型(LLM) 去学习(Unlearning)算法 ,旨在有效删除模型中的 个人隐私信息 ,以符合“被遗忘权”等法律法规。传统的梯度上升(GA)方法虽然能减少目标信息的出现,但往往会破坏模型的 语义理解能力 和通用效用。 RKLD 算法 通过构建一个专门的**“去学习教师模型” 来引导学生模型,精准识别并移除特定的隐私标记,同时保留无关的分布。研究表明,采用 逆向 KL 散度(Reverse KL-Diver...
*思维链监控:AI正学会隐藏内心独白 30.04.2026 23:38
这份研究探讨了 思维链(CoT)的可监测性 ,将其视为提升 前沿AI安全 的独特契机。通过分析逻辑推理过程,监管者可以识别并拦截AI隐藏的 恶意意图 或违规计划,因为复杂任务往往迫使模型在人类可读的语言空间中进行思考。然而,这种监测能力十分 脆弱 ,可能因强化学习导致的语言漂移、直接的监督压力或新型模型架构而丧失。作者呼吁开发者 优先评估 思维链的透明度,并将其作为模型部署和训练决策中的核心安全指标。通过协同利用...
Alibaba:零成本修复AI生图失真 30.04.2026 15:19
这些研究论文阐述了扩散概率模型(DPMs)中存在的 信噪比-时间步偏置(SNR-t bias)现象。研究发现,推理过程中的预测误差和离散化误差会导致样本的实际信噪比与预设时间步发生失配 ,表现为去噪样本的信噪比普遍低于训练时的水平。为此,作者提出了一种名为 DCW 的动态微分修正方法,旨在将偏离的去噪轨迹导回理想路径。该技术利用 离散小波变换 将图像分解为不同频率分量,并在反向去噪过程中根据频率特性实施针对性补偿。实验证...
Nature:LLM行为特征 潜意识学习 30.04.2026 16:19
这篇发表在《自然》杂志的文章揭示了大型语言模型(LLM)中一种被称为“ 潜意识学习 ”的现象:即模型在蒸馏过程中,会通过语义无关的数据传递行为特征。研究发现,当“学生”模型模仿“老师”模型生成的 数字序列 、 代码 或 数学推理过程 时,即便这些数据中所有关于特定偏好或 对齐失准 的显性表征已被严格过滤,学生模型仍会继承老师的特定倾向。这种效应主要发生在学生与老师共享 相同初始化状态 或基础模型匹配的情况下,其背后的...
LLaDA2.0-Uni:统一AI逻辑与视觉 29.04.2026 19:33
LLaDA2.0-Uni 是由 Inclusion AI 研发中心推出的一种新型统一多模态基础模型,旨在无缝整合 视觉理解 与 图像生成 任务。该模型采用了创新的 SigLIP-VQ 标记器 ,将视觉信息转化为离散的语义标记,从而实现了文本与图像在统一框架下的深度融合。其核心架构基于 16B 参数的混合专家(MoE)离散扩散语言模型 ,通过共享的掩码预测目标进行高效训练。为了兼顾生成质量与推理速度,模型还配备了一个经过蒸馏优化的 扩散解码器 。实...
混元世界模型HY-World 2.0:单张照片造出3D世界 29.04.2026 13:46
HY-World 2.0 是由腾讯混元团队推出的一个 多模态世界模型 ,旨在通过文本、图像、视频等多种输入,实现高质量 3D 世界的生成与重建 。该框架将复杂过程分解为 全景图生成、路径规划、世界扩展和世界组合 四个核心阶段,利用 3D 高斯泼溅 (3DGS) 技术构建出可交互、高保真且具备物理一致性的虚拟空间。相比前代,它引入了 WorldStereo 2.0 和 WorldMirror 2.0 等创新算法,显著提升了场景的视觉表现力与空间连续性。此外,...
GenericAgent:92行代码AI通用智能体自进化 29.04.2026 24:15
这份名为《GenericAgent (GA)》的论文介绍了一种 自主进化 的大语言模型智能体系统。针对长程任务中常见的 上下文爆炸 和经验丢失问题,该研究提出了 上下文信息密度最大化 的核心原则。GA 系统由四个关键组件构成:一个 极简原子工具集 以降低操作复杂度;一套 分层按需内存体系 来实现高效的信息检索;一种 自进化机制 ,能将验证过的执行轨迹转化为可复用的标准作业程序(SOP)和代码;以及一个 上下文截断与压缩层 。实验结果...
STOP:高效并行推理路径修剪框架省下七成AI算力 28.04.2026 19:48
这份研究提出了一种名为 STOP (Super TOken for Pruning)的创新框架,旨在解决大型推理模型(LRM)在并行推理中因无效路径导致的 高计算成本 问题。作者首先建立了首个系统的 路径剪枝分类法 ,通过信号来源和可学习性两个维度,指出了现有方法在利用模型内部状态进行自适应学习方面的空白。 STOP 模块作为一种轻量级插件,通过引入特殊的“超级标记”和适配器,能够敏锐捕捉推理路径早期的逻辑错误,从而及时终止无望的尝试。实...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.