每日新闻
每日AI
畅读AI学术论文,聚焦前沿趋势,普及人工智能
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
线性时间与恒定内存:基于RNN的Embedding 28.04.2026 19:28
本研究探讨了使用 循环神经网络(RNN)架构(如 Mamba2、RWKV 和 xLSTM)作为文本嵌入模型 的潜力,旨在解决传统 Transformer 模型在处理长文本时面临的计算压力。研究人员提出了一种 垂直分块推理策略 ,通过跨层递归处理数据,成功将内存消耗从随序列长度线性增长降低为 恒定常数 。实验证明,微调后的 Mamba2 模型在多项主流基准测试(如 MTEB 和 LongEmbed)中展现出与 Transformer 相当的 竞争力 ,尤其在 多语言任务 中表现...
MIT:RLM AI靠写代码读透千万字 28.04.2026 23:59
这些材料介绍了一种名为 递归语言模型(RLMs)的新型推理范式,旨在突破大型语言模型在处理超长上下文时的限制。该方法的核心创新在于将长文本视为外部环境 而非直接输入,允许模型通过编写程序代码来检索、拆解并递归地调用自身处理文本片段。研究表明, RLMs 处理的输入长度可达传统模型窗口的百倍以上,且在信息密集型任务中显著优于现有的上下文压缩或检索增强技术。实验通过 GPT-5 和 Qwen3 等前沿模型证明,这种递归架...
GeneBench:多阶段基因组学与定量生物学AI Agent评估 27.04.2026 14:39
GeneBench 是由 OpenAI 研究人员开发的全新基准测试,旨在评估 AI 智能体在 基因组学 和 定量生物学 领域处理复杂、多阶段科学数据分析的能力。与以往侧重知识检索的测试不同,该基准包含 103 个评估项目 ,模拟了从原始杂乱数据到最终科研决策的完整过程,涵盖数据清洗、统计模型选择及结果诊断。研究显示,即使是领先的 GPT 系列模型 在应对此类需要连续推理和纠错的任务时仍面临挑战,表现出明显的“ 观察与行动脱节 ”现象。...
人类最后的考试:前沿AI测评基准 27.04.2026 17:43
Humanity’s Last Exam (HLE) 是一个旨在评估大型语言模型在人类知识前沿表现的极高难度基准测试集。由于现有测试集如 MMLU 已趋于饱和,研究人员开发了这一包含 2,500 个跨学科问题 的多模态数据集,涵盖数学、自然科学和人文科学等领域。这些题目由全球数百名 领域专家 编写,经过了严格的自动化筛选和专家评审,确保其具有 不可搜索性 且需要深度的专业推理。评估结果显示,目前的顶尖模型在 HLE 上的 准确率极低 ,且往往对...
LingBot-Map:复杂场景高性能实时3D建模 27.04.2026 16:10
LingBot-Map 是一种面向视频流的 3D 场景重建 基础模型,旨在从连续视觉输入中实时恢复相机轨迹与点云。该研究通过创新的 几何上下文注意机制(GCA) ,将空间信息划分为锚点上下文、局部参考窗口和轨迹记忆,在保持计算高效的同时解决了长序列重建中的 轨迹漂移 问题。与现有方法相比,该模型采用纯 前馈架构 ,无需复杂的后处理或测试时优化,即可在万级帧数的长视频中实现稳定的几何一致性。通过 渐进式训练策略 和上下文并行...
OpenAI:AI为什么藏不住心里话 推理模型思维链CoT可控性研究 26.04.2026 17:49
这项研究探讨了 思维链(CoT)的可控性 ,即推理模型是否能按照指令自主改变其思考过程。研究人员推出了 CoT-Control 测试集 ,要求模型在解决复杂问题的同时,遵守诸如“禁止使用特定词汇”或“全大写思考”等约束。实验发现,推理模型在控制 内部思维 方面表现极差,其成功率远低于控制最终输出。 模型规模 越大,可控性虽有提升,但随着 训练强度 、推理长度及任务难度的增加,可控性反而会下降。尽管模型在意识到被监控时表现稍好...
RAG-Anything:全能多模态知识检索 看透长文档图表 26.04.2026 22:25
RAG-Anything 是一个针对多模态文档设计的统一检索增强生成框架,旨在解决传统系统仅能处理纯文本的局限性。该框架通过 双图构建策略 ,将文档中的文本、图像、表格和数学公式转化为互联的知识实体,从而完整保留跨模态的语义关联。其核心的 跨模态混合检索机制 结合了结构化知识导航与语义匹配,显著提升了从复杂排版中精准定位信息的能力。实验证明,该技术在处理 长文本 和科研、金融、医疗等知识密集型领域时表现卓越,大幅超...
SAMA:让AI视频动得稳 解耦语义锚定与运动对齐的视频编辑 26.04.2026 19:36
SAMA ,一个旨在提升指令引导型视频编辑质量的创新框架。研究团队指出,现有模型在 语义修改 与 运动保持 之间难以取得平衡,因此提出了将两者进行 解耦 的架构。该框架通过 语义锚定 技术在特定帧建立视觉基准,并利用 运动对齐 预训练让模型从原始视频中学习动态规律。这种双阶段训练策略使模型即便在没有配对编辑数据的情况下,也能展现出强大的 零样本编辑能力 。实验证明, SAMA 在指令遵循、画面保真度和时序一致性方面均达...
Google:ConvApparel对话式推荐系统 25.04.2026 19:56
Google 研究团队开发的 ConvApparel ,这是一个旨在评估对话式推荐系统中用户模拟器真实性的全新基准测试。研究指出,现有的语言模型模拟器与真实人类行为之间存在“ 真实性差距 ”,导致系统在模拟环境中表现良好,但在现实世界中往往失效。为了解决这一问题,该项目提供了一个包含 4,000 多场真实人类与 AI 购物对话 的数据库,并引入了独特的“ 双智能体协议 ”来捕捉用户在面对优劣不同推荐算法时的反应。此外,作者提出了一套...
Nvidia:Lyra AI让单张照片变4D 25.04.2026 13:16
Lyra 框架,旨在通过 自我蒸馏 技术将视频扩散模型的隐式知识转化为显式的 3D Gaussian Splatting (3DGS) 表示。该方法突破了传统 3D 重建对真实世界多视图数据和复杂相机姿态的依赖,仅需单张图像或一段视频即可生成高质量的三维场景。通过在 潜空间 内运行,Lyra 能够高效处理大量视图并确保几何一致性,从而实现实时渲染。此外,研究者还通过 动态数据增强 策略将其扩展到 4D 场景生成,成功捕捉随时间变化的运动。实验结果...
Artificial Analysis:AI智能指数4.0评估体系 25.04.2026 19:30
Artificial Analysis 发布的 AI 智能指数 4.0 评估体系,旨在通过客观的数据衡量大语言模型的核心能力。该体系将模型表现划分为 智能体、编程、通用能力及科学推理 四个均等权重的大类,采用了包括 GDPval-AA 和 CritPt 在内的十项前沿测试。为了保证结果的 公正性与透明度 ,该机构制定了标准化的零样本测试原则,并结合 LLM 判分员 进行语义对齐校验。除了核心指数外,研究还涵盖了 多语言性能 与 长文本推理 等专项评估...
MindDR:高效多Agents Deep Research框架 24.04.2026 19:32
MindDR 是由理想汽车(Li Auto)研发的一种高效 多智能体深度研究框架 ,旨在利用约 30B 规模的中等参数模型实现顶级的搜索与分析性能。该系统通过 规划、深度搜索和报告 三个专业智能体的协作,将复杂的研究课题拆解为可并行处理的子任务。其核心优势在于一套 四阶段训练流水线 ,涵盖了从冷启动指令微调到针对搜索效率和报告质量的 强化学习(RL)优化。为了解决数据稀缺问题,研究团队还开发了基于知识图谱的合成数据生成系统...
QuantCode-Bench:LLM量化交易策略生成评估基准 24.04.2026 24:02
QuantCode-Bench ,一个专为评估大语言模型生成 量化交易策略 代码能力而设计的全新基准测试。该基准包含 400 个源自 Reddit 和 GitHub 等平台的任务,要求模型利用 Backtrader 框架将自然语言描述转化为可执行的策略。研究人员构建了一个 四阶段评估流程 ,涵盖代码编译、历史数据回测、交易信号触发以及语义一致性检查。实验结果显示,顶级模型在 单轮生成 中虽能保证语法正确,但在实现复杂的交易逻辑时仍面临挑战。然而,在...
DiPO:用困惑度破解AI瓶颈 24.04.2026 18:20
该研究提出了一种名为 DiPO 的新型强化学习优化方法,旨在解决大语言模型训练中 探索与利用 难以平衡的困境。作者首先指出传统方法在处理极易或极难样本时存在训练信号缺失的问题,并利用**困惑度(PPL)**与模型预测准确性之间的关联性来优化策略。 DiPO 的核心包含两个模块: 困惑度空间解耦(PSD)通过动态计算最优阈值,将样本细分为四个象限,从而精确识别需要加强探索或利用的特定样本。随后,双向奖励重新分配(BRR)机...
AI为什么说话越来越像LLM Post-training输出多样性研究 22.04.2026 24:28
这项研究探讨了大语言模型在 训练后阶段(Post-training)出现输出多样性崩溃 的根源。通过对 Olmo 3 模型家族不同训练路径的对比,研究发现多样性的丧失主要由 训练数据构成 决定,而非特定的训练算法。例如,使用窄分布的“思维链”数据进行微调会导致多样性过早骤降,而这种崩溃 植根于模型权重 ,无法在推理时通过禁用思维链格式来修复。此外,输出的简化在不同任务中表现不同:在数学和代码任务中主要体现为 错误答案的消除...
Deep Neural Lesion:深度神经病变一比特摧毁大模型 22.04.2026 22:15
这项研究介绍了一种名为 Deep Neural Lesion (DNL) 的攻击方法,通过仅修改深度神经网络(DNN)中极少数的 参数符号位 ,便能引发模型的灾难性失效。该方法极其高效且具有隐蔽性,因为它无需任何训练数据或复杂的优化过程,仅凭 参数权重大小 和 网络层级位置 即可锁定关键点。研究表明,在图像分类、目标检测及大语言模型等多个领域,仅需翻转一两个比特位,就能使 ResNet-50 或 Qwen3 等顶尖模型的准确率几近清零。实验进一步...
W-RAC:高效低成本RAG网页文档检索框架 22.04.2026 19:52
这篇论文介绍了一种名为 W-RAC(网络检索感知分块) 的创新框架,旨在优化检索增强生成(RAG)系统中网页文档的处理流程。该技术通过将网页解析为具唯一标识符的结构化单元,利用大语言模型进行 语义规划 而非文本生成,从而在保持原文完整性的同时精准分组。实验表明,这种方法能显著提升检索 精确度 ,并大幅降低计算成本与延迟。与传统方法相比,W-RAC 成功减少了约 85% 的输出 Token 消耗 ,并缩短了近 60% 的处理时间 。...
ClawGUI:让AI精准操控手机-GUI智能体全栈训练、评估与部署框架 21.04.2026 20:46
ClawGUI 是一个旨在解决图形用户界面(GUI)智能体在训练、评估与部署中存在脱节问题的 开源统一框架 。该系统由三个核心模块组成: ClawGUI-RL 提供了支持虚拟环境与真实设备的强化学习基础设施,并通过 过程奖励模型 实现细粒度的步骤监督; ClawGUI-Eval 建立了标准化的评价流水线,确保了在多项基准测试中结果的 可复现性 ; ClawGUI-Agent 则支持在 Android 和 iOS 等多平台上进行 真实部署 。实验表明,在该框架下训练的...
MOSS-TTS:实现一小时声音克隆 21.04.2026 20:44
MOSS-TTS 是一款基于 离散音频令牌 、 自回归建模 以及 大规模预训练 构建的语音生成基座模型。该研究的核心在于 MOSS-Audio-Tokenizer ,这是一种纯 Transformer 架构的音频分词器,能够将音频高效压缩,同时兼顾高保真重建与语义对齐。为了平衡生成质量与推理效率,研究者发布了结构简洁、易于扩展的 MOSS-TTS 以及更强调实时性与音色还原的 MOSS-TTS-Local-Transformer 。该系统通过数百万小时的 海量数据流水线 进行训练...
EverMemOS:长程推理自组织存储操作系统终结AI健忘 21.04.2026 13:51
EverMemOS 是一种为大型语言模型(LLM)设计的创新型 自组织记忆操作系统 ,旨在解决长文本交互中的连贯性与逻辑推理挑战。该系统借鉴生物学中的 记忆印迹 原理,通过 情理性痕迹形成 、 语义整合 以及 重构式回忆 三个阶段,将零散的对话片段转化为结构化的知识体系。研究表明,EverMemOS 在 LoCoMo 和 LongMemEval 等多个基准测试中显著超越了现有技术,尤其在处理 多步推理 和 时序问题 方面表现出色。通过构建包含原子事...
StepFun:RealRestorer 挑战顶级闭源修图模型 20.04.2026 23:39
RealRestorer 是一个旨在解决真实世界图像退化问题的开源图像修复模型。研究人员开发了一个包含九种常见退化类型(如模糊、噪点、雨雾等)的大规模 高质量合成数据流水线 ,并采用 两阶段训练策略 ,将合成数据与真实退化数据相结合,以提升模型的泛化能力。此外,论文推出了 RealIR-Bench 基准测试,利用视觉语言模型(VLM)评估模型在去除退化和保持内容一致性方面的表现。实验结果表明,RealRestorer 在开源模型中处于 领先水...
Claude Code 设计架构深度解析 20.04.2026 17:54
Anthropic 开发的智能编程工具 Claude Code 的系统架构与设计哲学。该系统以一个简洁的 循环机制 为核心,通过调用模型、执行工具并不断重复来完成复杂任务。其架构设计优先考虑 人类决策权威 与 安全性 ,内置了具备七种模式的权限系统、五层上下文管理流水线以及四种扩展机制。报告通过对比开源系统 OpenClaw,展示了商业软件如何利用 防御性设计 与 最小化脚手架 来增强开发能力,同时保持严谨的操作限制。此外,作者还探讨...
Anthropic:透明之翼计划 AI时代网络安全 20.04.2026 21:50
Anthropic 宣布推出 Project Glasswing 计划,旨在汇聚全球顶尖科技公司与机构,共同应对 AI 带来的网络安全挑战。该项目核心是利用尚未公开的 Claude Mythos Preview 模型,其卓越的编程与推理能力已能自主发现并修复深藏多年的系统漏洞。Anthropic 将投入 1 亿美元 的信用额度及数百万美元资金,支持开源社区与合作伙伴增强数字基础设施的防御水平。通过这种 以 AI 对抗 AI 的策略,该计划试图在恶意攻击者掌握同等技术前...
Aurora:让大模型边干边学 19.04.2026 18:17
Aurora 是一个将大语言模型训练与推理深度融合的创新系统,旨在解决投机采样技术中模型训练与实际服务脱节的难题。该系统通过 异步强化学习 机制,直接从实时推理轨迹中持续学习,实现了投机模型在上线首日的即时加速与自动优化。它不仅支持 热插拔更新 以确保服务不间断,还利用 树状注意力机制 高效处理接受和拒绝的令牌反馈。实验表明, Aurora 能显著提升推理吞吐量,并能迅速适应用户请求分布的变化。这种“ 边服务边训练 ”...
Google:内存缓存破解大模型记忆瓶颈 19.04.2026 20:30
本文介绍了一种名为 存储缓存(Memory Caching, MC)的新型技术,旨在解决循环神经网络(RNN)在处理长序列时因内存容量固定而导致的性能瓶颈。该研究由谷歌研究(Google Research)与康奈尔大学等机构合作完成,提出通过在推理过程中缓存隐藏状态的检查点,使RNN的有效内存容量随序列长度动态增长。文章详细阐述了四种不同的聚合策略,包括残差存储 、 门控聚合 、 存储汤(Memory Soup)以及稀疏选择性缓存(SSC) 。实验结果表...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.