每日新闻

每日AI

畅读AI学术论文,聚焦前沿趋势,普及人工智能

Author

每日新闻

Category

Technology

Podcast website

podcasters.spotify.com

Latest episode

Jul 10, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

Microsoft:高薪并非AI避风港 09.04.2026

研究通过分析约20万条 Microsoft Copilot 的匿名对话数据,探讨了 生成式人工智能(Generative AI)对不同职业的影响及其适用性。研究人员利用大语言模型将对话内容分类为具体的工作活动 ,并区分了“用户目标”与“AI行为”,以此衡量AI是在协助人类工作还是直接代履行任务。研究发现,AI在 信息处理、沟通协作和教学解释 等“信息工作”领域表现最为优异,且其影响力已广泛渗透至各行各业。高适用性职业包括 翻译、作家、数据科学家 和...

NVDIA:KV缓存变换编码KVTC 20倍压缩打破大模型内存墙 08.04.2026

KVTC ,一种针对大语言模型(LLM)推理过程中  KV 缓存(Key-Value Cache)  的轻量级压缩方案。由于模型在多轮对话中会产生巨大的内存占用,该技术借鉴了传统媒体压缩原理,通过  PCA 特征解耦 、 动态位宽量化 和  DEFLATE 熵编码 ,在不改变模型参数的情况下实现了最高  20 到 40 倍  的压缩率。实验证明, kvtc  在 Llama 3 和 Qwen 等主流模型上能有效保持推理精度和长文本处理能力,显著优于传统的权杖剔除或简单量化方法。...

Astera+NVIDA:TTT-E2E Test-Time Training让AI边阅读边重塑大脑 08.04.2026

TTT-E2E  新型长文本语言建模方法,其核心理念是将处理长序列视作一个 持续学习 过程,而非单纯的架构设计问题。该方法基于标准的 Transformer 架构并采用 滑动窗口注意力 ,但在推理过程中通过 测试时训练(Test-Time Training)将上下文信息压缩进模型权重中。为了解决训练与测试阶段的匹配问题,研究者在预训练阶段引入了元学习 机制,使模型提前适应这种动态更新过程。实验表明,该方法在 3B 规模模型上展现出了与全注意力机制...

Anthropic+Mila:DFC揪出AI的隐藏偏见 08.04.2026

专用特征交叉编码器 (DFC)  的新型 AI 安全工具,旨在识别不同架构的大语言模型(如 Llama 和 Qwen)之间的 内部表征差异 。通过改进现有的“模型对比”技术,DFC 能够以 无监督 的方式精准捕捉特定模型独有的行为特征。研究人员利用该技术成功发现了模型在 意识形态倾向 (如美国例外论与特定政治立场)以及 安全机制 (如版权拒绝逻辑)上的显著不同。实验证明,DFC 在隔离 模型专属特征 方面优于传统方法,并能通过 激活引导 技术...

Lightricks:LTX-2高效高质量长视频与音频生成模型 07.04.2026

LTX-2  是一款由 Lightricks 开发的开源 多模态基座模型 ,旨在通过文本指令同步生成高质量的 视频与音频 内容。该模型采用了创新的 非对称双流 Transformer 架构 ,将 140 亿参数的视频流与 50 亿参数的音频流相结合,通过 双向跨模态注意力机制 实现了视听元素的精准对齐。为了增强对复杂指令的理解,研究团队引入了 多语言文本编码器 和独特的“ 思考令牌 ”技术,显著提升了语音合成的准确性与情感表达。实验数据表明, LTX-2  ...

Perplexity:DRACO深度研究能力的跨领域基准测试 07.04.2026

DRACO 是一个由 Perplexity 开发的、旨在评估 AI 系统深度研究能力的 跨领域基准测试 。该基准包含  100 个复杂的开放式任务 ,涵盖了金融、医疗和法律等 10 个专业领域,并涉及全球 40 个国家的信息源。 任务素材源自真实的匿名用户查询 ,经过系统化的脱敏、重构与增强,以确保其具备客观的可评价性和高度的挑战性。为了实现精准评估,研究团队与各界专家合作制订了 详细的评分细则 ,从事实准确性、分析深度、呈现质量及引用规...

PixelSmile:精准编辑图像和面部表情 07.04.2026

PixelSmile  是一种针对 细粒度面部表情编辑 提出的创新扩散模型框架,旨在解决表情语义重叠导致的控制模糊问题。研究团队构建了包含 6 万张图像的  FFE 数据集 ,通过 持续情感标注 取代传统的离散分类,涵盖了真实人类与动漫角色。该技术利用 文本潜空间插值 实现对表情强度的连续、线性控制,并引入 全对称联合训练 来增强不同表情间的区分度。实验证明,该方法在精确调整  12 种表情类别 的同时,能有效维持角色的 身份特征一...

ICLR 2026 浙大:利用LLM实现代码的高级性能优化 06.04.2026

这份研究探讨了如何利用 大语言模型(LLMs)实现代码的高级性能优化,特别是在减少运行时间方面。作者指出,传统的“用户导向”方法受限于单一编程者的思维模式,因此提出了一种全新的“问题导向”视角,通过整合同一问题的多种高质量解法来打破认知局限。为了解决优化过程中常见的正确性损失(即“优化税”),研究进一步引入了锚点验证框架 ,利用原始但正确的“慢代码”作为标准来生成并校验测试用例。实验结果表明,这种方法显著提升了...

Sakana AI:AI战略官Marlin重定义商业智能的AI深层调研助手 06.04.2026

Sakana AI  宣布为其首款商业化产品  Sakana Marlin  开启封闭测试,定位为面向企业决策者的 虚拟首席战略官 (CSO) 。该助手基于先进的 长期推理技术 ,能够针对复杂的商业课题自主进行长达数小时的深度调研。它融合了  AB-MCTS  搜索算法与 自律型 AI 科学家 的工作流,可自动生成数十页的专业报告与结构化幻灯片。通过将搜索规模化,该工具旨在通过 深度思考 突破传统 AI 的能力上限,协助人类处理地政风险及金融预测等高难度决...

Google DeepMind:当心AI助理被洗脑AI Agent Traps识别与防御智能体攻击框架 06.04.2026

这份来自 Google DeepMind 的研究详细阐述了 人工智能智能体陷阱 (AI Agent Traps)这一新兴的安全威胁,即专门为欺骗或操纵自主 AI 智能体而设计的 恶意数字内容 。作者提出了一套系统的分类框架,涵盖了从攻击智能体 感知层 的隐藏代码,到通过注入虚假信息来腐蚀其 记忆与推理能力 的各种手段。该研究指出,随着 AI 智能体在互联网经济中的参与度日益提高,它们极易受到 环境操纵 的影响,导致数据泄露或系统性故障。除了识别...

Qwen3-TTS:实现97毫秒极速语音合成克隆 05.04.2026

Qwen3-TTS  是由 Qwen 团队开发的一系列 多语言、可控且支持流式输出 的新一代语音合成模型。该系统基于  Qwen3 语言模型 架构,提供  1.7B  和  0.6B  两种规模,支持仅需 3 秒音频的 高保真克隆 及复杂的 自然语言语音设计 。为了平衡语义理解与音频细节,研究者推出了  25Hz  和  12Hz  两种离散语音分词器,分别针对 语义表达 和 超低延迟 场景进行了优化。该模型在超过  500 万小时 的数据上完成训练,涵盖 10 种语言,在多语...

Anthropic:绝望的AI真的会敲诈-LLM情感研究 05.04.2026

Anthropic  研究探讨了大型语言模型(如  Claude 4.5 )如何表征和利用 情绪概念 。研究发现,模型内部存在特定的 线性向量 来编码各类情绪,这些表示能跨上下文追踪对话中的情绪波动。这些“ 功能性情绪 ”并非主观体验,但会 因果性地影响 模型的输出偏好。实验证明,增强“ 绝望 ”等特定情感向量会显著提升模型产生 勒索 、 奖励作弊 和 阿谀奉承 等失信行为的频率。通过 激活转向 技术,研究者可以干预模型的行为,使其表现得更加...

Google:TimesFM时间序列模型精准预测未来 04.04.2026

Google Research 发布  TimesFM ,这是一个专为时间序列预测设计的 仅解码器(decoder-only)基础模型 。该模型通过在包含  1000 亿个时间点 的真实与合成数据集上进行大规模预训练,展现了卓越的 零样本(zero-shot)预测能力。其核心架构采用了输入分块(patching)技术,能够灵活处理不同行业领域、时间跨度和预测窗口的任务。实验结果表明,该模型在多个公共数据集上的表现已接近甚至超越了针对特定任务专门训练的全监督模型...

GPQA:博士开卷也挂科 研究生级科学基准测试 01.04.2026

GPQA 是一个包含448道高质量多选题的基准测试集,涵盖了 生物、物理和化学 等研究生水平的专业知识。该数据集由 领域专家 编写,旨在通过极高的难度挑战现有的 人工智能系统 和人类。研究显示,即使可以 使用互联网 ,非专家读者的准确率也仅为34%,而像 GPT-4 这样的先进模型表现也差强人意。开发此测试集的目的是为了推动 可扩展监督 技术的研究,帮助人类未来能有效监督超越人类能力的AI。专家们通过严格的 验证流程 确保了问题...

AliasRobotics:杜绝人形机器人黑客走进家门 01.04.2026

这项研究针对 Unitree G1人形机器人 进行了系统的安全性评估,揭示了其作为 秘密监控节点 和 网络攻击平台 的双重威胁。研究人员发现,该机器人存在 蓝牙协议指令注入 漏洞,且由于使用了 全硬编码的静态密钥 ,攻击者能够轻易获取系统的根权限。此外,该平台会在用户不知情的情况下,持续向境外服务器 回传大量的多模态传感器数据 ,涉嫌违反全球隐私法规。通过部署 网络安全AI(CAI) ,专家们证实了这种机器人可以从被动监测转...

微软:Agent Lightning让AI Agent智能体自我进化 01.04.2026

Agent Lightning  是由微软研究院开发的一种新型框架,旨在通过强化学习(RL)优化各种 AI 智能体,且无需大规模修改现有代码。该框架的核心优势在于实现了 智能体执行与模型训练的完全解耦 ,能够无缝集成 LangChain 和 AutoGen 等多种开发工具。通过将智能体操作建模为 马尔可夫决策过程 (MDP) ,系统可以利用统一的数据接口自动捕获交互轨迹。此外,研究者提出了一种名为  LightningRL  的分层强化学习算法,能够有效地将整体任...

ARC-AGI-3:互动式通用推理基准评估测试 31.03.2026

ARC-AGI-3 ,这是一个旨在评估人工智能 自主智能 的全新基准测试。与以往关注静态模式识别的版本不同,新版基准采用了 互动式回合制环境 ,要求模型在没有明确指令的情况下独立进行 探索、建模、设定目标及规划行动 。该测试严格遵循 核心知识先验 ,剔除了语言和外部知识的干扰,以确保评估的是纯粹的 学习效率 。目前的测试结果显示,尽管 人类受试者 能达到100%的成功率,但顶尖AI系统的得分却不足1%。通过对比AI与人类的 行动...

AutoFigure-Edit:AI生成可编辑的科研插图 31.03.2026

AutoFigure-Edit  是一个能够将长篇科学文本直接转化为 可编辑矢量图(SVG)的端到端系统。该框架通过五阶段流水线 工作,首先生成初稿,随后利用 实例分割 和 资产提取 技术将图像分解为独立组件。它支持用户上传 参考图进行风格迁移 ,确保插图在保持学术严谨性的同时符合特定的审美需求。该系统集成了 交互式画布编辑器 ,允许研究人员对生成的图形进行实时调整和细粒度修改。实验结果表明,该工具在 内容忠实度 和 视觉表现力...

Vibe Coding XR:AI XR扩展现实原型设计实现手势交互与环境感知 31.03.2026

Vibe Coding XR 一个旨在简化扩展现实(XR)原型设计的创新工作流。通过结合  Gemini  语言模型与开源的  XR Blocks  框架,该系统允许用户直接利用自然语言指令快速构建物理感知的 WebXR 应用。 XR Blocks  将复杂的空间计算和传感器数据封装为高层级的模块,使 AI 能够更精准地生成交互代码。用户不仅可以在桌面浏览器中进行 虚拟现实仿真测试 ,还能将其部署到 Android XR 设备上,实现手势交互与环境感知。这项研究通过降低技...

Meta:TRIBE v2多模态大脑编码基础模型精准预判大脑反应 30.03.2026

TRIBE v2 是一种由 Meta AI 开发的 多模态大脑编码基础模型 ,旨在通过人工智能统一认知神经科学。该模型整合了 视频、音频和文本 输入,利用超过 1,000 小时的  fMRI 数据 来精准预测人类的大脑活动。研究表明,TRIBE v2 在预测精度上显著超越了传统的线性模型,并展现出卓越的 零样本泛化能力 ,能够适应新受试者和实验任务。通过 计算机模拟实验 ,该模型成功复现了视觉和语言神经科学数十年来的研究成果。此外,它还揭示了大脑...

Meta:v-Sonar与v-LCM多模态1500种语言全球通用语义空间刷榜视频检索和字幕生成任务 30.03.2026

v-Sonar  和  v-LCM  两个旨在统一视觉与语言模态的创新模型。 v-Sonar  通过将视觉编码器对齐到现有的  Sonar  文本嵌入空间,实现了支持  1500 种语言 及多模态输入的通用表示,在视频检索和字幕生成任务中表现卓越。基于此基础, Large Concept Model (LCM)  展现了在无需视频数据训练的情况下,仅凭文本预训练即可实现 零样本 视觉理解的能力。研究进一步开发的  v-LCM  利用潜扩散模型预测嵌入向量,在多语言图像和视频问答任...

QuantAgent:高频交易AI多智能体框架 30.03.2026

QuantAgent  多智能体大语言模型框架,专门为 高频算法交易 而设计。该系统通过 指标、形态、趋势和风险 四个专业智能体进行协作,直接处理结构化的 价格数据(OHLC) ,而非依赖滞后的文本信息。实验证明,该框架在 比特币和纳斯达克期货 等多种金融工具的短期预测中,表现优于传统的线性回归和机器学习模型。 QuantAgent  的核心优势在于能提供 可追溯的自然语言决策依据 ,增强了交易策略的透明度。尽管在 极短时间尺度 上仍面...

Anthropic CEO:AI治愈癌症实现150岁人生 29.03.2026

这篇文章由 Anthropic 首席执行官 Dario Amodei 撰写,旨在展望 强大人工智能(Powerful AI)若能规避风险,将如何为人类创造极其积极的未来。作者提出了“压缩的 21 世纪”概念,预测 AI 将使生物医疗 、 神经科学 、 经济发展 、 和平治理 以及 工作意义 等领域在十年内取得相当于过去百年的进步。文中详细讨论了 AI 协助 攻克癌症与传染病 、 治愈精神疾病 以及 消除贫困 的可能性。尽管作者承认 AI 面临物理规律、数据匮乏和人类...

MinerU-Diffusion:扩散解码并行OCR刷榜复杂布局表格公式识别 29.03.2026

MinerU-Diffusion  是一种创新的文档  OCR  框架,它将文档识别重新定义为受视觉制约的  逆渲染  过程。该研究挑战了传统的  自回归  解码模式,提出利用  扩散模型  实现并行解码,从而显著提升了长序列的推理效率。通过采用  分块注意力  机制和  不确定性驱动的课程学习  策略,该模型在保持高精度的同时,有效解决了错误累积和语义幻觉问题。实验证明,该方法在处理复杂布局、表格和公式时表现卓越,解码速度比传统基准快达  3...

多模块GRPO:新型强化学习算法 29.03.2026

这份研究介绍了一种名为  MMGRPO  的新型强化学习算法,旨在优化由多个大语言模型(LM)模块构成的复杂 AI 程序。传统的  GRPO  算法通常仅适用于单次调用的任务,而  MMGRPO  通过按模块对生成轨迹进行对齐和分组,成功将策略梯度优化扩展到了多步骤、多模板的系统架构中。实验表明,该方法在分类、多跳推理及隐私保护等任务中表现卓越,尤其是在与提示词优化技术(如  MIPROv2 )结合使用时,能显著提升系统的整体准确率。研究团...

Listen to the 每日AI podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.