跳到正文

#推理

今日 2 条
9月9日周三
  1. IT之家(RSS)82

    纽约大学教授质疑OpenAI借助其研究抢先发布纳维-斯托克斯问题证明

    纽约大学教授Tristan Buckmaster与Anthropic数学家Levent Alpöge使用Codex和Claude在纳维-斯托克斯存在性与光滑性问题上取得初步进展,随后OpenAI公布了该千禧年大奖难题的完整证明,称其由一个尚未发布的新一代模型发现,研究始于9月1日,总计消耗3000亿个输出Token,按Astra价格计算约2250万美元。

  2. 公众号:数字生命卡兹克70

    GPT-6 Astra推理等级怎么选才最省Token

    卡兹克发文讲解GPT-6 Astra的推理强度等级(Reasoning Effort)含义,指出各档位是同一模型的不同思考预算,Ultra则类似拉起多个智能体协作的专项工作组。

    推荐理由:作者基于烧完两个200刀会员的第一手使用体感,给出推理等级的通俗解释和分档位省Token的具体用法。

  3. Hacker News:AI 热帖53

    作者发布浏览器端 LLM 注意力权重可视化工具

    作者发布一个基于 Transformers.js 的 LLM 注意力可视化工具,可悬停查看生成 token 依赖的历史 token,代码开在 GitHub。可视化将所有层、所有注意力头的注意力权重乘以 value 向量模长后聚合为单一数值控制透明度,并预生成提示词避免下载数百 MB 模型;作者还通过修改 onnx 文件暴露内部值,上传到自己的 Hugging Face 仓库供浏览器生成使用。

  4. OpenAI:官网动态(RSS · 排除企业/客户案例)86

    OpenAI 宣布以内部 AI 系统给出 Navier–Stokes 千禧年问题解答

    OpenAI 宣布其内部 AI 系统给出 Navier–Stokes 存在与光滑性问题的解答,证明初始光滑的流体可在有限时间内形成奇点,并附证明文稿与 Lean 形式化验证。

    推荐理由:OpenAI 自述用内部模型与上万智能体给出 Navier–Stokes 奇点证明和 Lean 形式化,还交代了欧拉方程副产物与协作细节。

  5. TechCrunch:AI(RSS)85

    NYU 数学家指控 OpenAI 在千禧年难题竞赛中不正当竞争,Bubeck 否认

    NYU 数学教授 Tristan Buckmaster 与 Anthropic 数学家 Levent Alpöge 公布针对 Navier-Stokes 存在与光滑性这一千禧年难题的三项证明初步结果,并称其研究进展信息被泄露给 OpenAI,对方随后用大量算力沿其独特路线追赶证明。

    推荐理由:原文记录了数学家与 OpenAI 就千年难题证明优先权展开的争议细节,以及双方各自的公开回应,可帮读者了解 AI 参与数学研究引发的信任问题。

9月8日周二
  1. 公众号:卡尔的AI沃茨54

    实测个人AI助手Today:记忆可改可删,晨间简报按日程偏好自动调整

    作者以自己的日历、跑步训练和睡眠数据实测个人生活AI助手Today(Public Beta),认为其定位是个人生活连续性管理而非任务交付型工作Agent。文中记录了三个体验:日程被临时打乱时生成晨间简报并建议同步日历、睡眠不足时自动顺延非紧急待办、记忆面板可查看编辑删除每条事实且改动即时生效。作者建议按阶梯信任逐步开放权限,并指出语言切换不同步等早期产品问题。

  2. Epoch AI:研究、数据与评测69

    Epoch AI 实测 GPT-5.6 与 Claude 5 长上下文延迟缩放差异

    Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。

    推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。

9月7日周一
  1. IT之家(RSS)59

    科大讯飞发布星火 X2.5 模型:293B-A30B MoE 架构,全国产平台训练

    科大讯飞 9 月 7 日正式发布星火 Spark X2.5 多语言文本生成模型,基于全国产平台训练,采用 MoE 框架,参数为 293B-A30B,支持 256K 上下文。模型全面提升代码和智能体能力,覆盖 200 余种语言,已在讯飞星辰 MaaS 平台上线,输入定价 1.6 元/百万 Token(缓存命中 0.24 元),输出 6 元/百万 Token。

  2. Charlie O’Neill 研究写作(RSS)60

    Charlie O'Neill 谈 RL 环境信仰与理性下注:长、真、自有

    Charlie O'Neill 撰文指出,宣称一切将是 RL 环境的人很少按该信念做出理性行动,如同当年 scaling 和 AGI 信奉者并不真下注。他提出无论 RSI 是否成立都应造高价值数据与环境:若 RSI 成立,单位效用环境价值将指数增长,值得在实验室内做最有针对性、可累积的环境;若不成立,实验室需要模型在所有领域变强,会为有用数据支付高价。