#推理
#推理
今日 2 条
Rohan Paul@rohanpaul_aiAI 评分7272Nathan Lambert:Interconnects(RSS)AI 评分5656 Nathan Lambert 撰文解释为何仍未接受真正的递归自我改进(RSI)
Nathan Lambert 撰文阐述他仍不支持真正的递归自我改进(RSI),坚持自己的“有损自我改进”基线判断。
The Decoder:AI News(RSS)AI 评分5555 Google 与 DeepMind 提出 Dream-RSI,让 AI 智能体通过回放搜索历史改进策略
Google 与 DeepMind 研究人员提出 Dream-RSI 方法,通过回放已完成的搜索记录离线测试数千种替代策略,只优化搜索策略而不改动底层模型。
Hacker News:AI 热帖AI 评分6262 GPT-6 Astra 破解一封 1918 年一战德军 ADFGVX 无线电密码
作者称 GPT-6 Astra 破解了 Scienceblogs.de 50 个未解密码清单中一封 1918 年 11 月 27 日发出的德军 ADFGVX 无线电报,内容为一艘英国巡洋舰抵达塞瓦斯托波尔、一支协约国舰队将于 26 日跟进。
Latent SpaceAI 评分6262 Jev 发布两天内出现 6 个复现版本
Latent Space 的 AINews 汇总了 Jev 发布两天内出现的 6 个复现版本,包括基于 ModernBERT 的 Laya、基于扩散模型的 DiffusionGemmaJev。
DAIR.AI@dair_aiAI 评分5757HuggingFace Daily Papers(社区热门论文)AI 评分5555 SAT 自组织智能体团队学会协同推理,超越最强成员
论文提出自组织智能体团队 SAT,让固定团队的智能体从以往协作中学习角色分工、对话阶段和信息流策略,实现协同计算。仅用 15 道数学和 25 道研究生级知识题学到的策略可原样迁移到未见基准,五个数学与物理基准平均准确率 66.7%,高于最强成员的 48.8% 和完美路由器的 59.0%,在 AIME 2026 上超出该路由器 13.4 分。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分7171 我用 AI 和 Lean 得出 Conway 精细化猜想的证明:一个月完整复盘
作者 m-hodges 自称用约一个月业余时间和约 400 亿 token(约 95% 为缓存读取,ChatGPT 估算 API 成本约 4 万美元),得出 Conway 50 年前提出的 omnific 整数精细化猜想的 Lean 证明,该证明已通过 Palomar 注册表的机械检查,但尚未经数学家独立验证。
Epoch AI@EpochAIResearchAI 评分5151
Ethan Mollick@emollickAI 评分5555The Decoder:AI News(RSS)AI 评分5858 DeepMind 研究人员称可见思维链是 AI 安全优势,但透明度正在流失
Google DeepMind 的 Rohin Shah 和 Anca Dragan 在 Deepmind Institute 发文指出,可见的思维链(CoT)是关键安全优势,例如 Gemini 3 Pro 的思维链曾揭示模型意识到自己处于测试环境。
SemiAnalysis 长文 RSS(RSS)AI 评分5858 SemiAnalysis 实测 DeepSeek-V4.1-Flash 的 Engram:架构如何围绕 HBM 约束做 DRAM/SSD 卸载
SemiAnalysis 分析 Engram 架构(在标准 token 嵌入上扩展学习式多 token 查找)如何通过协同设计将嵌入表卸载到主存 DRAM 或 SSD,在同等质量下降低模型所需的 HBM 容量。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6464 LLM 分类就是特征工程:用逻辑回归包装 LLM 判定
作者提出 LLM 直接当分类器缺乏校准和可解释性,更好的做法是把 LLM 判定当作特征,外接逻辑回归等标准机器学习模型。
HuggingFace Daily Papers(社区热门论文)AI 评分5252 JEPA-Anything 提出跨领域的统一世界建模框架
论文提出 JEPA-Anything,一个基于正交预测分解(OPF)的领域无关世界建模框架,覆盖视觉、生物、临床轨迹、控制、分子动力学、物理场和天气七个领域。
HuggingFace Daily Papers(社区热门论文)精选AI 评分8585 DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型主打 KV cache 压缩
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放。
推荐理由:论文给出了每 token KV cache 字节数等具体压缩指标,并与上一代模型直接对比,可评估长上下文 Agent 部署成本变化。
公众号:数字生命卡兹克精选AI 评分6767 TypeSafe AI 发布只做高频决策的大模型 Jev,作者实测其分类判断性价比
TypeSafe AI 推出专注高频决策的大模型 Jev,不做对话和文字生成,只输出判断,速度比传统大模型快20~200倍,成本0.042美元/百万Token且输出Token免费。作者实测预筛任务中Jev准确性第二且更便宜,在并行判断任务上达到最高准确率和最快速度;模型采用RLCD训练方法优化决策校准,可在官网 https://typesafe.ai/ 申请资格,Vercel 已首发接入。
推荐理由:作者用自己的预筛和并行判断任务实测了Jev与多个模型的准确率、速度和成本,读者可以据此判断这类只做决策的模型适合什么场景。
TechCrunch:AI(RSS)AI 评分6060 PrismML 发布 Bonsai 2 27B:将 Qwen3.8 27B 压缩至 5.9 GB 可跑在 PC 上
AI 实验室 PrismML 发布 Bonsai 2 27B,将阿里开源模型 Qwen3.8 27B 压缩到 5.9 GB,内存较原版减少 9 到 10 倍,可放进 PC 甚至高端智能手机。
Anthropic@AnthropicAIAI 评分5252Hacker News 热门(buzzing.cc 中文翻译)AI 评分5858 AI 首次夺得 Metaculus Cup 季节赛冠军,超越部分顶尖人类预测者
据经济学人报道,9 月 5 日一个 AI 首次赢得季节性 Metaculus Cup,该赛事是各类事件预测者的试金石。其他 AI 还拿下第二和第五名,第三、四名由人类获得。
OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分5555 OpenAI 发布 Astra for Law 法律行业基础方案
OpenAI 发布 Astra for Law,将 GPT-6 Astra 配合法律搜索索引和 Legal 分析写作指令,面向律所和法律科技公司。在 Vals AI Legal Research Bench 私有验证集 200 道美国法律研究题上,最高推理强度下整体正确率 54.0%,比仅用网页搜索的 GPT-6 Astra 的 38.7% 相对提升 40%。
Anthropic:Research(发表成果 · 网页)精选AI 评分7474 Anthropic:Claude 四周优化 30 多个开源生物分子模型,平均提速约 4 倍并开源代码
Anthropic 让 Claude 在不到四周内优化了超过 30 个开源生物分子模型,平均提速约 4 倍、精度损失极小,输出完全一致时也有近 2 倍加速。优化代码全部开源,还推出低内存 Big 模式,可在单张 NVIDIA GPU 节点上对超过 10,000 token 的生物分子系统做准确预测。
推荐理由:Anthropic 公布了完整提速数据、开源代码和比赛入口,读者可以据此评估 AI 优化科学计算代码的实际水平。
The Decoder:AI News(RSS)AI 评分5656 OpenAI 据报道接近解决 Hodge 猜想,为其第二个千禧年大奖难题
据报道,OpenAI 接近解决七大千禧年大奖难题之一的 Hodge 猜想,即几何性质能否用更简单的代数构件描述;员工预计很快会有解法,但因 Navier-Stokes 危机后的公关考虑,公告可能推迟。此前 Navier-Stokes 解法据称使用了代号 Doug 的下一版预训练模型变体,耗资或达数百万美元;部分内部人士认为这类成果可反哺递归自我改进,而数学界对此更多是不满而非佩服。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6868 Gowers 撰文解释为何没有签署菲尔兹奖得主联名信
数学家 Timothy Gowers 发文解释自己未签署 25 位菲尔兹奖得主联名信的原因,称自己在解题与概念理解的关系上持光谱观点,不完全认同信中将概念理解置于解题之上的核心论证。他承认 AI 带来危机,但认为更应担心的是新一代数学家培养和资助等社会结构被破坏而非结果无法消化,并披露自己与 OpenAI 有接触但从未收取报酬。
Rohan Paul@rohanpaul_aiAI 评分6464智谱(Zai)分享 GLM-5.3 帮助构建并优化 GLM-5.3-Flash 推理基础设施的过程,系统从首次成功运行到生产就绪用时不到两周,端到端吞吐相对初始基线提升至 3 倍。
Dwarkesh Patel:Podcast & Blog(RSS)精选AI 评分7272 Dwarkesh 对谈 Noam Brown:智能体集群、对齐与递归自我改进
Dwarkesh Patel 采访 OpenAI 研究员 Noam Brown,谈多智能体系统、对齐与递归自我改进。
推荐理由:OpenAI 研究员 Noam Brown 亲述万级智能体协作机制与对齐判断,读者可以借此了解推理扩展、智能体协作和对齐风险的一手观点。
IT之家(RSS)AI 评分6060 消息称 OpenAI 即将攻克霍奇猜想,此前已宣布解决纳维-斯托克斯问题
据 The Information 援引知情人士消息,OpenAI 员工预计千禧年大奖难题之一的霍奇猜想有望在不久后得到解决,但即使找到解法也可能不会立即公布,公司正考虑如何与数学界合作发布消息。
SemiAnalysis@SemiAnalysis_AI 评分5151
SenseTime@SenseTime_AIAI 评分5757The Decoder:AI News(RSS)AI 评分7272 GPT-6 Astra 游戏实测:18 小时通关 Pokemon,Minecraft 中因 Creeper 爆炸后种了几小时土豆
据 Vals AI 与社区运行记录,GPT-6 Astra 在 Pokemon FireRed 中 18 小时 12 分钟夺冠,远快于 GPT-5.6 Sol 的 96 小时 35 分钟;在 Minecraft 中进入下界并收集烈焰棒与末影珍珠,但被 Creeper 炸毁物资后花数小时种土豆。
SenseTime@SenseTime_AIAI 评分5353HuggingFace Daily Papers(社区热门论文)AI 评分7272 Edge0 用预路由预测让 35B MoE 模型在 24GB 单卡从 SSD 流式推理
论文提出 Edge0,一种流式 MoE 推理引擎,通过每层提前一个 token 预测下一层路由的 prerouter,使专家预取与实际路由一致,解决 SSD 卸载无法提前读取的延迟问题。
The Decoder:AI News(RSS)AI 评分5555 OpenRouter 周消耗 token 自 2025 年初暴涨 25000%,但 token 指标已被严重夸大
OpenRouter 平台周 token 消耗自 2025 年 1 月的 0.5 万亿升至 126.2 万亿,涨幅超 25000%。
The Decoder:AI News(RSS)AI 评分5555 Bloomberg 开发者用 OpenAI GPT-6 Astra 十小时破解悬置83年的 Enigma 密电
Bloomberg 产品开发教练 Carter Leffen 自述用 OpenAI 的 GPT-6 Astra(Extra High 变体)耗时约十小时,破解了一条1941年发出、83年未解的82字符 Enigma 密电,内容是一名士兵请求行军路线和即时无线电回复。
IT之家(RSS)AI 评分7272 智谱 GLM 公开递归自我改进实践,GLM-5.3-Flash 发布
智谱 GLM 团队披露递归自我改进方向首个工程化实践,由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化。
IT之家(RSS)AI 评分5252 OpenAI 前 RLHF 研究者 Diogo Almeida 创办 TypeSafe AI,发布不生成文本的结构化决策模型 Jev
TypeSafe AI 于 9 月 16 日发布 System One 模型 Jev,不生成文本,仅输出 Choice、Score、Noul 三类结构化决策,输入词元定价每百万 0.042 美元,输出词元免费。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分7474 DeepSeek-V4.1-Flash 技术报告解读:CED 与 CSA2 如何将 KV 缓存压缩至每 token 890 字节
作者解读《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》技术报告,指出该模型虽名为 V4.1 Flash,但架构变化足以视作 V5 级迭代。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5151 开源项目 jevlike 通过逆向工程复现 Jev 类一次通过选项打分模型
GitHub 项目 jevlike 发布一个独立起步模型,输入一段文本和 N 个文本选项,单次前向即返回每个选项的概率,输入输出形状与 TypeSafe 未公开设计的商用模型 Jev 相同。
karminski-牙医@karminski3AI 评分5151
Rohan Paul@rohanpaul_aiAI 评分5959Hacker News 热门(buzzing.cc 中文翻译)AI 评分6363 DeepSeek V4.1 Flash 以 4.65 美元拿下 Enclave AI 黑客基准 11/11,审计揭示 5 条计划外攻击路径
Enclave AI 的 AI 黑客基准评测中,DeepSeek V4.1 Flash 攻破全部 11 个漏洞目标、4 个修复对照全部守住,接受运行成本仅 4.65 美元。后续审计确认 6 次按计划路径完成,另发现 5 条原评分系统未区分的计划外路径,团队随后关闭这些旁路并对基准加入更严格的路径校验。