跳到正文

#推理

今日 0 条
9月4日周五
  1. Gary Marcus:The Road to AI We Can Trust(RSS)74

    Gary Marcus 评 GPT-6 Astra:进步明显但鲁棒性与可监控性存疑

    Gary Marcus 发文点评 GPT-6 Astra,称多项报告显示其为真正的进步,OpenAI 产品显式创建并操纵符号世界模型,令其近十年的主张获得印证。

    推荐理由:作者结合自身近十年主张神经符号世界模型的立场,指出 Astra 的关键未知在鲁棒性与可监控性,判断有具体依据。

9月3日周四
  1. ARC Prize:官方博客79

    ARC Prize 发布 OpenAI GPT-6 Astra 在 ARC-AGI-3 上的评测结果

    ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。

    推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。

9月2日周三
  1. Artificial Analysis 完整文章(网页)66

    Google 发布 Gemini 3.8 Flash,四个月内第四款 Flash 模型

    Google DeepMind 发布 Gemini 3.8 Flash,在 Artificial Analysis Intelligence Index 上以 high 推理得分 59,较 Gemini 3.7 Flash 提升 3 分。

    推荐理由:评测方一手数据给出了智能指数、单任务成本和速度的具体变化,可帮助读者判断该模型在实际任务中的性价比。

9月1日周二
  1. 上海人工智能实验室 InternLM:原创项目63

    上海AI实验室发布 InternLumina-U2:16B-A1B 多码本扩散统一多模态模型

    上海AI实验室发布 InternLumina-U2,一个 16B 参数(激活 1B)的 MoE 扩散语言模型,用 8 码本全离散视觉表示统一覆盖文本问答、文生图、图像理解与编辑、视频及 3D 理解。

    推荐理由:原文给出多码本全离散统一架构的设计细节、基准分数和双硬件适配说明,读者可以了解统一理解与生成模型的一条新路线。

  2. 公众号:千问APP(阿里)46

    千问APP升级学习功能,新增作文辅导与教材精讲

    千问APP在开学季升级学习功能,新增与教材同步的单元作文辅导、初中语文数学教材精讲,并将高中、大学数理化拍题讲解能力扩展至千问小讲堂,相关功能均免费开放。作文辅导通过逐步提问引导孩子梳理素材和结构;教材精讲可从章节或知识点切入,讲解中可随时打断追问,千问会根据具体问题调整讲解内容和节奏。

  3. Artificial Analysis 完整文章(网页)75

    Artificial Analysis 实测 Claude Fable 5.1 登顶智能指数但每任务成本高 20%

    Artificial Analysis 评测 Claude Fable 5.1,其以 66 分登顶 Artificial Analysis Intelligence Index,超过 Claude Opus 5(63)、Fable 5(62)、GPT-5.6 Sol(61)和 Grok 4.6(61)。

    推荐理由:Artificial Analysis 实测了 Claude Fable 5.1 的智能指数、各基准得分与每任务成本,读者可据此权衡其相对 Opus 5 和 GPT-5.6 的性价比。

8月13日周四
  1. Microsoft Research38

    微软发布 MindTopo 基准,揭示多模态模型拓扑推理短板

    Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型的拓扑推理能力,覆盖连通性、分离、顺序、包围与打结五类任务,并区分静态识别与交互规划两个认知层级。测试显示,当前专有与开源模型在静态推理上明显强于交互规划,且两者均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列仍不可靠。

8月12日周三
7月26日周日
6月11日周四
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的设备上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。

5月8日周五
  1. Berkeley AI Research36

    自适应并行推理:高效推理扩展的下一个范式

    伯克利 AI Research 发布综述,梳理并行推理领域进展,重点讨论自适应并行推理——让推理模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。文章指出,现有方法多由模型外部固定并行结构,而不同问题需要不同并行度。文中还介绍了 ThreadWeaver、ParaThinker、GroupThink、Hogwild! Inference 等方法。

4月20日周一
3月13日周五
11月1日周六
  1. Berkeley AI Research36

    无需 TD 学习:用分治法实现可扩展的 off-policy 强化学习

    伯克利 AI 研究提出一种基于分治(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。该方法针对 off-policy RL 场景,在目标条件 RL 中利用三角不等式构造传递性 Bellman 更新,用两个较短的子轨迹价值更新完整轨迹价值。目前仍存在如何选取最优子目标 w 的问题。