-
2026-07-23·Multi-Agent·Scaling Law·Google DeepMind
Google Research + DeepMind + MIT 用 260 种配置严格实验,首次给多 agent 系统建立定量 scaling law。Agent 数量不是越多越好——特定条件下单 agent 反而比多 agent 更强。
-
2026-07-23·Novelty Detection·Complex Systems·Emergent Behavior
Tufts 大学 Michael Levin 组用一个可微分的"可学习新奇性"统一统计学习、复杂系统、强化学习三大领域。无需标签、无需 reward shaping,系统自主发现环境中的有趣行为。
-
2026-07-24·LLM Optimization·Agent Architecture·GEPA
代码、prompt、agent架构、CUDA kernel、云调度策略——全用一个API优化。ARC-AGI 32.5%→89.5%,Claude Code 79%→100%且快47%,云成本砍40%。八个领域全面打平甚至超越专用工具。
-
2026-07-21·论文解读·Loopie · Layer-Loop · 循环Transformer
Layer-Loop 架构让每层注意力/MoE 先对自己循环 R 次,20B 总参 2B 活跃参跑出 AIME 92%、IMO 银牌——计算匹配时代的全新扩展维度。
-
2026-07-20Self-Improving AgentSurveyFoundation ModelScaffolding
KAUST / Jilin / IDSIA 联合出品,Schmidhuber 署名。97 页综述统一自改进 Agent 框架 A_t = (θ_t, Σ_t):参数改得慢但深,脚手架改得快但浅,好的系统双层并跑分层收敛。覆盖 200+ 篇论文,从 1790 年 Laplace 一路梳理到 2026 年的 GPT Agent。
-
2026-07-18ARC-AGI-3Harness EngineeringState GroundingWorld Model
Schema 不改变模型权重,而是改变模型周围的过程——让 AI 像物理学家一样从原始像素中构建可编程的世界模型。ARC-AGI-3 Public 集 RHAE 98.98%,固定模型仅换 harness 提升 +56pp。
-
2026-07-18Agent HarnessExperience LearningSearch
Notre Dame / LMU Munich / USC 提出 MemoHarness:agent harness 不应手写,而应从执行经验中学习。六维 harness 空间 + 双层经验银行 + 测试时无标签适应,Terminal-Bench 达 0.806,超越所有固定 harness 基线,跨模型迁移平均提升 +0.098。
-
2026-07-17Video GenerationVision Foundation ModelDiffusion
Google DeepMind提出视觉基础模型第三条道路:文本到视频生成预训练同时覆盖空间-时间-语言三维度,扩散backbone改造为单步前馈感知模型,3B规模匹配DepthAnything V3/SAM3/VGGT-Ω等专用SOTA,训练数据少7-500倍;纯合成人体视频训练即可zero-shot泛化到真实世界和未见类别(动物、机器人)。
-
2026-07-17Latent CoTLooped TransformerInference Efficiency
Microsoft Research联合ETH提出LOTUS:循环backbone并行打磨隐向量破解序列生成瓶颈,gold CoT token直接交叉熵监督破解对齐信号缺失——隐式推理首次在3B规模匹配显式CoT准确率,推理快2.5-6.9倍;隐空间可被LM head直接解码出推理步骤,还编码了训练中未见的等价推理路径。
-
2026-07-15Continual LearningBenchmarkPrompt vs Weights
UC Berkeley统一评测八种持续学习方法,证明没有银弹——真正的分水岭在于任务需要"改prompt就够了"还是"必须学进权重":上下文可容纳的知识用检索/prompt方案更稳,超出上下文或需要技能内化时参数更新不可替代。
-
2026-07-14Continual LearningMemory ConsolidationNeuroscience
LLM有和人类顺行性遗忘症相似的缺陷——只有短期记忆(上下文)和凝固的长期记忆(预训练参数),中间没有巩固机制。Google Research提出"睡眠"范式:NREM式记忆巩固(参数扩展+向上蒸馏+突触修剪)+ REM式做梦(自生成合成数据+MoE混合知识域)。Qwen3-8B上AIME-24达79.2%,ARC抽象推理80%,达到同等性能比SFT快4.3-4.8倍。
-
2026-07-14Proactive MemoryMeta-LearningAgent
Meta提出Proactive Memory框架——Agent在推理间隙自动执行记忆维护(记忆选择→检索→更新→写入),用元学习训练记忆策略网络替代规则型memory模块。AiderHumanEval 94.4%完成率、ALFWorld 95%成功率、WebArena 60.9%,全面超越ReAct/RAG/COT等基线。
-
2026-07-13Verification ScalingAgentLogprobs
验证和生成一样,是可以被系统化扩展的维度。从离散 argmax 分数换成 logprob 分布期望,三个扩展轴(粒度/重复/分解)互不冲突、可叠加,zero-shot 跨域 SOTA——Terminal-Bench 86.5%、SWE-Bench 78.2%、机器人 87.4%。
-
2026-07-06Neural CompilationLoRAFuzzy Functions
把自然语言规格编译成 23MB 的 LoRA 适配器,0.6B 解释器本地运行。0.6B+PAW 精度超过 32B 直接调用,内存省 50 倍——权重即代码的新编程范式。
-
2026-07-05LLM IdeationResearch TasteDistributional Evaluation
从分布层面测量LLM与人类在科研品味上的系统性差异:人类12%走桥接路径,LLM直接50-60%。不是不会做科研,是只会做一种口味——缝合。
-
2026-07-03World ModelJEPATest-Time AdaptationMPC
一步梯度更新 predictor,每个 MPC step 仅多 0.01 秒,规划成功率翻倍。低数据 regime 下 1k 轨迹 + adaptation 碾压 16k 轨迹的冻结模型。
-
2026-07-03Agent MemoryMeta-LearningLoRA
Stanford 团队将元记忆认知能力搬到 LLM agent:文件系统操作提升为一等公民动作,meta-LLM 驱动的两个自动优化循环(结构迭代 + 熟练度训练)在长时任务上实现 2x–4x 性能提升,32B 模型达到 frontier 级别。
-
2026-07-01World ModelLooped TransformerAdaptive Computation
1B 参数的循环世界模型,参数共享 Transformer 块迭代精化隐状态,谱约束保证稳定。ScienceWorld 上超越 100x 大的 Claude Opus 4 Max 整整 21 个百分点。世界模型的第三缩放轴:迭代隐深度。
-
2025-02-27ConvNetTop-Down AttentionDynamic ConvolutionVision Backbone
第一个纯 ConvNet 骨干显式引入自上而下注意力——Base-Net 编码底层 → Overview-Net 快速扫全局 → Focus-Net 在语义引导下精确定位。ContMix 动态卷积让固定尺寸核也能捕捉长程依赖。
-
2026-06-29Self-Improving AgentsMulti-AgentGödel Machine
RQGM 让生成器和评估器共同进化——考官不再是固定标准,而是跟学生一起变强的红皇后竞赛。代码审查、论文写作、数学证明全面碾压。
-
2026-06-26合成数据AgenticMeta-OptimizationMeta FAIR
四子 agent 架构(Challenger/Weak Solver/Strong Solver/Judge)迭代造题、调难度、验证质量。外循环元优化让 agent 越造越强。CS/法律/科学推理三领域全面优于传统 Self-Instruct。
-
2026-06-25LLMChain-of-Thought参数化知识Google Research
CoT 推理帮助简单事实回忆,不是因为分解了问题,而是两个互补机制:计算缓冲效应(额外 token 提供更多前向传播,无意义内容也有效)和事实启动效应(生成相关事实做语义热身,类似人类扩散激活)。中间步骤幻觉会显著拉低最终正确率。
-
2026-06-24RLProcess Reward机器人学习Sergey Levine
训练判别器区分成功/失败轨迹的 state-action 访问分布,用输出比率作为过程奖励。理论上保证不改变最优策略(Theorem 4.1),LIBERO-90 + 真实 WidowX 机械臂上约 5 倍加速。对抗式逆 RL 在稀疏奖励设定下的优雅变体。
-
2026-06-23模型架构MLP Tapering深度感知容量分配Mila · Cornell
让 MLP 中间层宽度沿深度 cosine 递减,总参数量和 FLOPs 完全不变。440M Transformer ppl 从 16.28 降到 14.44。跨四种架构(Transformer、Gated Attention、Hope-attention、Titans)、三种规模全部提升。层新颖度分析揭示深层 MLP 越来越冗余,前宽后窄是自然匹配。
-
2026-06-22Test-Time TrainingSpatial Intelligence流式视频清华 · 腾讯混元
用 fast weights 做流式压缩的空间记忆,以线性复杂度处理任意长度空间视频流。混合 TTT 架构保护预训练知识,空间预测机制注入 3D 时空归纳偏置。2B 模型在 VSI-Bench 上超越 GPT-5 和 Gemini-3-Pro。
-
2026-06-22Multi-AgentMeta-SkillPrompt 自进化港科广 · 蚂蚁
把 MAS 编排能力抽象为可进化的 Meta-Skill(prompt 级),解耦模型能力和经验积累。Multi-trajectory rollout + selective reflection 两步闭环进化。跨 LLM、跨任务迁移有效,四个 benchmark + 四个 LLM 全部最优。
-
2026-06-19World ModelLooped Transformer自适应深度FaceMind
第一个把 looped transformer 用在 world model 上。参数共享 block 反复迭代隐状态,简单场景迭代 1 次,复杂碰撞迭代多次。谱约束保数值稳定,最高 100× 参数效率。开辟"迭代隐深度"这个全新 scaling 维度。
-
2026-06-18模型架构非均匀宽度Scaling Laws
系统研究 Transformer 层间宽度分配。× 形(两头宽中间窄)轮廓一致优于等宽 baseline:perplexity 低 ~3%,训练 FLOPs 省 22%,KV cache 省 15%。固定 residual slice 机制零参数开销。
-
2026-06-15World ModelBelief StateSpeculative DecodingMIT · Microsoft
给 next-token prediction 加辅助目标——预测模型的下一个隐状态。理论上证明隐状态收敛到 belief states,推理速度 3.3× 且零额外开销。不改架构、不改推理流程,只改训练目标。
-
2026-06-15Multi-Agent去中心化SWE-benchStanford
用共享上下文 + 任务队列替代中央控制器,彻底去掉 scatter-gather 瓶颈。SWE-bench Verified 65.7%(+10.5pp),成本砍半。与 DecentMem 天然互补:一个去中心化协调,一个去中心化记忆。
-
2026-06-15Multi-Agent Memory去中心化Bandit TheoryCambridge · Chicago
首个去中心化 MAS 记忆框架。每个 agent 维护私有双池记忆(利用池 + 探索池),LLM-as-a-judge 在线动态加权。理论证明全局可达性 + O(log T) 累积遗憾。15 组实验 14 组最佳,比最强中心化基线高 8.6%,token 减少最多 49%。协调随机性越高,去中心化优势越大。
-
2026-06-13路线图ASI多智能体DeepMind
57 页报告,以 Legg-Hutter 智能量表为理论基础,提出 AGI→ASI 四条路径:scaling、范式转移、递归自改进、多智能体涌现。系统列举数字智能结构性优势与摩擦力瓶颈。核心判断:AI 进步不太可能精确停滞在人类水平,多智能体架构可能是最被低估的 ASI 路径。
-
2026-06-11综述自改进LLMGRO框架Stony Brook
113 页综述,提出 GRO(生成-奖励-优化)统一框架覆盖从 STaR 到 Gödel Machine 的全谱系。五阶段闭环(数据获取→筛选→优化→推理精炼→自主评估)+ 六种结构性失败模式(数据自噬、reward hacking 等)。核心判断:自改进的未来在系统层面的闭环设计,而非模型层面的技巧优化。
-
2026-06-11权重压缩流形学习NIT Rourkela
权重流形假说 + 映射定理严格证明:仅训练一个千维潜向量即可生成完整网络权重,实现 200-500× 参数压缩。四项 Mapping Loss 分别对应定理假设,消融验证缺一不可。微调场景落地点最快——1024 参数适配 ResNet50 超越 17M 全参数微调。
-
2026-06-10Agent 系统形式化定理证明Google DeepMind
AND-OR DAG 证明图架构,把通用 LLM 在形式化定理证明上的解决率从不到 10% 提升到 70%。Putnam 2025 全对(12/12),超越金牌级 IMO 专用系统 Aristotle。核心设计:引理记忆化 + 前瞻性规划 + LLM Reviewer 作搜索过滤器。
-
2026-06-09Agent 系统科研基础设施Stanford · Michigan · CMU
学术论文把分支迭代的探索过程压缩成线性叙事,丢掉大量沿途发现。ARA 协议用四层机器可执行研究包替代叙事论文,理解准确率 72.4% → 93.7%。最深刻的发现:结构化知识对弱 Agent 是助力,对强 Agent 可能变成约束。
-
2026-06-09优化器NDS曲率分析LLM 预训练
Muon 比 Adam 快 2 倍的原因:不是梯度对齐更好,而是谱归一化更新方向有更低的 Normalized Directional Sharpness (NDS),每步曲率代价更小。数据越不平衡、训练越到后期,优势越明显。
-
2026-06-06Transformer跨层信息流KV CacheGQA
自注意力在序列维度自由选择信息,但在深度维度只是残差累加。Depth-Attention 在注意力模块内部增加"沿深度方向的注意力",让每层从前面的层选择性复用 value——零参数、零额外 KV cache、不到 0.01% 额外 FLOPs,1.5B/3B Qwen3 风格解码器全面最优。
-
2026-06-05递归自我改进AI 自主开发Anthropic Institute
Anthropic 首次披露内部数据:80%+ 代码由 Claude 编写,工程师代码产出是 2024 年的 8 倍,Claude 单次提交 800+ 修复将 API 错误降低 1000 倍。反馈循环已启动——每次 Claude 升级都加速下一个版本的构建。研究判断力是通向完整递归自我改进的关键鸿沟。罕见提出"可验证的暂停"政策立场。
-
2026-06-04Transformer动态卷积MIT · MIT-IBM Watson AI Lab
将静态短卷积替换为输入依赖的动态卷积,150M-2B 模型上 1.33-1.60× 计算优势,端到端训练仅 +8% 开销。泛化至 MoE、Mamba-2、Gated DeltaNet。思路简单、收益显著——几乎无脑可加的架构改进。
-
2026-06-03Scaling Law梯度干扰Stanford · Harvard · MIT · Anthropic
大模型不是"更聪明"——而是参数多到高频任务的梯度变得极微弱,不再覆盖稀有任务缓慢积累的特征。用 OLMo 4M–4B 实验验证:1B 模型对非任务 token 的梯度干扰仅 7.58×10⁻⁵,20M 模型高达 0.10。数据中心化:提高数据频率可能比盲目扩大模型更有效。
-
2026-06-02Agent MemoryDelta-Rule LearningNTU · 复旦 · 交大
在冻结 LLM 旁维护 8×8 在线关联记忆矩阵,通过 delta-rule 持续更新,读取向量直接注入 attention 生成低秩修正。MemoryAgentBench +31%,移除全部上下文后仅凭 64 元素矩阵仍能恢复关键推理链。
-
2026-06-01视频理解Agent多跳推理ICML 2026
Video-o3 给视频 MLLM 装上"主动寻线索"能力——迭代调用 VideoCrop 精查关键片段,攒够证据再下结论。7B 模型在 MLVU 72.1%、Video-Holmes 46.5% 刷 SOTA。
-
2026-05-30Hybrid ArchitectureMamba-2Gated DeltaNetGoogle Research
序列轴混合:tied K/V 投影共享 90%+ 参数,一套表示同时更新 KV cache 和 RNN state,序列内动态切换 attention 和 linear RNN。linear prefill + attention generation 即追平 Transformer 检索,算力省得多。
-
2026-05-30Pre-training ParadigmLatent SpaceMeta
Meta 提出将 LLM 预训练从离散 token prediction 换成连续潜变量预测——autoencoder 先压缩 token 到 latent,模型预测 latent 向量而非 next token。推理速度提升 2.7×,质量持平甚至超越,语义等价性大幅增强。
-
2026-05-30Self-ImprovingTest-Time TrainingHarnessHexo Labs
第一个在同一个闭环中同时更新 scaffold 和模型权重的系统。Feedback-Agent 运行时动态选择 RL 算法,三个跨域实验一致证明 harness 与权重更新增益不互相饱和。
-
2026-05-30Self-ImprovingSelf-Play迭代优化Google DeepMind
DeepMind 的自改进代码优化器:给定一个评分函数,模型在三个阶段(种群采样→自我评估→自我优化)中迭代生成、评分、改进代码,无需外部 solver。3× 计算量即可达到 2× 最终性能,且跨模型泛化。
-
2026-05-29Agentic RLNVIDIARollout框架
NVIDIA NeMo 团队的 rollout 框架:在 LLM API 边界架代理捕获 token 级交互,把任意 agent harness 当黑盒做 scalable RL。Qwen3.5-4B + GRPO 在 Codex harness 上 SWE-Bench Verified 从 3.8%→26.4%,prefix merging 压缩 5.4× trace。
-
2026-05-29World ModelJEPALeCun可辨识性
LeCun 团队用 Hermite 多项式谱分解证明:LeJEPA 在高斯潜变量下必然线性恢复 World Model(h(z)=Qz),且高斯是唯一满足此条件的分布。反转了经典 ICA 的结论——Gaussian 的旋转不变性从 bug 变成 feature。四个定理递进,Lean 4 形式化验证。
-
2026-05-28扩散模型逐块训练Sakana AI
残差连接天然等价于扩散去噪的欧拉离散化——利用这一等价关系,把网络拆成独立块训练,显存降 B 倍,效果和端到端训练几乎一样。五种架构验证通过,包括非扩散原生的自回归模型。
-
2026-05-27RLVR数据溯源北京大学
给 RLVR 数据集做家谱:1.45M 条训练数据 90%+ 来自 20 个原子源,3.6 万条 benchmark 泄露。提出 SCA 源级归因和 Q 质量评分,用洞察打磨出 DAPO++ 数据集,两个规模上全面第一。
-
2026-05-23多Agent自修复执行自主科研
五大机制(多Agent辩论、Pivot/Refine自修复、可验证结果报告、七档人机协作、跨Run进化)驱动的23阶段自主科研流水线。ARC-Bench上比AI Scientist v2高54.7%。
-
2026-05-22AgentSkill 优化微软
把 skill 文档当成 frozen agent 的外部权重,用训练的纪律来优化。52/52 全胜,skill 可跨模型跨环境迁移。
-
2026-05-22知识蒸馏预训练泛化
知识蒸馏的黄金法则被推翻:弱老师也能教出好学生,强老师反而可能让蒸馏收益饱和甚至逆转。蒸馏的真正价值在泛化而非拟合。
-
2026-05-25SSM记忆巩固深度推理
SSM-Attention 混合模型在深度推理上失败的原因不是记忆容量不足,而是巩固已驱逐上下文的计算量不够。解决方案:让模型在清除 KV cache 之前用循环前向传播反复精炼快速权重,推理延迟不变,睡得越久推理越深。
-
2026-05-24AI 安全漏洞挖掘Anthropic
Anthropic 用 Claude Mythos Preview 联合 50 家合作伙伴,一个月发现超过 10,000 个高危漏洞。网络安全进步的瓶颈已从"发现"变为"修补"——传统 90 天披露窗口和志愿者驱动的补丁流程已不够用。
-
2026-05-24MemoryAgentAutoResearch
检索基础设施不该是静态的。把 BM25 权重、融合模式、上下文预算等十几个旋钮暴露为动作空间,LLM 读失败日志→诊断根因→提案调参→守卫回退的四步循环自动进化,从 F1 30.5% 七轮跑到 54.3%。
-
2026-05-23形式化证明AgentDeepMind
LLM + Lean 编译器验证的 agentic loop 自动解决 9/353 Erdős 问题(含 56 年悬而未决难题)和 44 个 OEIS 猜想。最意外发现:最基础的 LLM+编译器循环就解决了全部成功案例,进化搜索反是锦上添花。
-
2026-05-22递归推理测试时计算TRM
给递归推理模型加噪声、跑 K 条并行轨迹、用 Q 头选最优——不重训练、不增数据,7M 参数成本 $0.001,PPBench 准确率 91.2%(Claude Opus 4 仅 34.7%)。推理瓶颈在探索能力,不在模型容量。
-
2026-05-22递归推理变分推理多轨迹
将递归推理从确定性变成概率性:高层随机探索 + 低层确定性精炼,支持宽度式推理扩展。Sudoku 97%、N-Queens 覆盖率 90.3%,20 条并行轨迹超越所有确定性模型 320 步迭代。
-
2026-05-22高效预训练递归架构PrefixLM
分层递归架构替代标准 Transformer,配合 task-completion 目标和 PrefixLM attention,40B token 从零训练 1B 模型,计算效率比 Llama/Qwen/Gemma 高 96-432 倍。$1,500 预算让任何实验室都能做预训练研究。
-
2026-05-21扩散模型视觉编码器RAE
三个简洁改进——多层特征聚合、保留 REPA、REPA head 免费做 guidance——实现比原版 RAE 快 10 倍收敛,80 epoch 达到 gFID 1.06,并在文生图和导航世界模型上一致验证有效。
-
2026-05-21LLM知识集成Memory
用独立小模型当「记忆」,主模型完全不动参数。训练时消化语料,推理时多轮对话提问——RAG、微调、latent memory 之外的第四条路。
-
2026-05-20AI AgentNAS
用 AI Agent 自动完成神经网络架构搜索。AIRA-Compose 通过组合现有模块进行设计,AIRA-Design 则从零开始构造全新架构——无需人工设计经验,端到端自动化。
-
2026-05-20强化学习优化
Opinion-Driven Policy Distillation 提出了一种比传统 RL 更高效的方法论。核心洞察是"预见性"——Agent 能够预判决策后果,从而跳过大量试错。
-
2026-05-19LLM持续学习记忆
探索 LLM 持续更新中一个反直觉现象:即使是正确的、有用的记忆,在模型更新后也可能变得不可靠。对持续学习系统的记忆管理提出警示。
-
2026-05-18视觉推理World Model
挑战"语言是推理必需载体"的假设,证明纯视觉规划可以完成复杂推理任务,且在某些场景下优于语言链式推理。
-
工程实践2026-07-02Claude CodeAgentic LoopAI 编程工具
Anthropic 发布 Claude Code Loops,将 AI 编程助手从单次问答推进到自主循环执行。Turn-based / Goal-based / Time-based / Proactive 四种递进模式,覆盖人工协作到全自动化的一切场景。evaluator 模型防偷懒、adversarial review 保质量、渐进式控制权释放的设计哲学。
-
观点2026-06-23研究方法论Jordan Mass禅宗
硅谷研究员 Jordan Mass 用禅宗公案串起 ML 研究底层心法:好结果大概率是 bug、别读太多论文、别追热点学底座、实验结果的平等心、Coding Agent 的理解外包陷阱。技术会变,但好奇心、偏执、对真相的敬畏不会过时。
-
观点2026-06-15Agent 架构自动化循环Addy Osmani
基于 Addy Osmani 文章:五个构件(自动化、Worktree、Skill、Connector、Sub-agent)加一块外部记忆,构成完整的 agent 自动化循环。杠杆点从 prompt 能力移到了系统设计,但系统产出的上限仍然是你对工作的理解深度。
-
工程实践2026-06-07Agentic EngineeringClaude CodePlan FirstAgent 调度
Matt Van Horn 从"高中后再没交付过有价值的东西"到多个万 star 项目贡献者,靠的不是更努力写代码,而是彻底改变和计算资源的关系。Plan First 翻转 80/20、双层规划破解模型偷懒、多 Tab 并行人变调度员——一整套正在形成的 Agentic 工程方法论。
-
工程实践2026-06-06Claude数据分析Skill 设计数据治理
裸 Claude 回答数据分析问题准确率仅 21%,加上 skill 稳定 95%+,不维护一个月掉回 65%。四层架构(Data Foundations → Sources of Truth → Skills → Validation),精加工知识而非原始检索,LLM 自动生成元数据定义"净效果为负"。
-
安全2026-06-04网络安全MITRE ATT&CK威胁情报
Anthropic 审查 832 个恶意账户,映射到 MITRE ATT&CK 框架。三大发现:攻击重心从钓鱼向后渗透转移、传统威胁评估体系因 AI 而失效、编排架构成为高危攻击者唯一持久区分信号。
-
实战2026-05-22树莓派nanobotAI Agent
600元树莓派 + 开源 nanobot,挂两个飞书AI助手(熊大&熊二),三个月自动出19期论文播客、近百篇论文解读、A股日报、美股模拟交易——每月电费1块8,API费用50块。一套普通人也能复制的7×24小时AI方案。