#推理
#推理
今日 2 条
凡人小北@frxiaobeiAI 评分5151IT之家(RSS)AI 评分8282 纽约大学教授质疑OpenAI借助其研究抢先发布纳维-斯托克斯问题证明
纽约大学教授Tristan Buckmaster与Anthropic数学家Levent Alpöge使用Codex和Claude在纳维-斯托克斯存在性与光滑性问题上取得初步进展,随后OpenAI公布了该千禧年大奖难题的完整证明,称其由一个尚未发布的新一代模型发现,研究始于9月1日,总计消耗3000亿个输出Token,按Astra价格计算约2250万美元。
Thomas Wolf@Thom_Wolf精选AI 评分7878推荐理由:作者回应 OpenAI 的 Navier-Stokes 结果,提出当前 AI 数学突破偏重反例搜索,缺乏优雅性与数学品味,为判断该领域进展提供了另一角度。
IT之家(RSS)AI 评分5656 DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash,各项指标全面超越 V4 Pro
DeepSeek 开放平台发布通知,计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型,官方称经内外部多方测试,其在性能、费用、速度、总用时等指标上全面超越 V4 Pro。
公众号:蚂蚁百灵(Ling)AI 评分6565 蚂蚁百灵开源首个原生多模态大模型 Ling-3.0-flash-VL
蚂蚁百灵发布并开源首个原生多模态大模型 Ling-3.0-flash-VL,基于 Ling-3.0-flash 的 MoE 架构,总参数 124B,单次推理激活 5.5B,原生支持图像、文本与视频输入,上下文窗口 256K Token。
公众号:数字生命卡兹克精选AI 评分7070 GPT-6 Astra推理等级怎么选才最省Token
卡兹克发文讲解GPT-6 Astra的推理强度等级(Reasoning Effort)含义,指出各档位是同一模型的不同思考预算,Ultra则类似拉起多个智能体协作的专项工作组。
推荐理由:作者基于烧完两个200刀会员的第一手使用体感,给出推理等级的通俗解释和分档位省Token的具体用法。
HuggingFace Daily Papers(社区热门论文)AI 评分7474 NVIDIA 发布 Nemotron IMO 2026 开源配方,纯自然语言证明拿下 30/42 达金牌线
NVIDIA 基于 Nemotron 3 Ultra 训练 SFT 与 RL 两个专精检查点,结合生成-验证-精炼的测试时推理流水线,在 IMO 2026 正式得分 30/42,超过 29 分的金牌线,全程不使用形式化证明器、外部工具或联网。
IT之家(RSS)AI 评分7878 OpenAI 宣布用约 10000 个 AI 智能体 88 小时解决纳维-斯托克斯问题,陶哲轩点赞并表担忧
OpenAI 于 9 月 8 日宣布,其未公开的内部模型(性能远超 GPT-6 Astra)解决了千禧年大奖难题之一的纳维-斯托克斯存在性与光滑性问题,通过约 10000 个 AI 智能体协作在约 88 小时内生成了证明,证明初始平滑流体可在有限时间内出现奇点。
Hacker News:AI 热帖AI 评分6464 Inception 发布扩散大语言模型 Mercury 2.5
Inception 发布 Mercury 2.5,称其为目前最强扩散大语言模型,智能较 Mercury 2 提升 40%,在 NVIDIA GPU 上达 1,107 tokens 每秒,上下文 260K tokens,定价 $0.20/百万输入、$0.75/百万输出,发布期 8 折优惠。
Epoch AI@EpochAIResearchAI 评分5555Hacker News:AI 热帖AI 评分5353 作者发布浏览器端 LLM 注意力权重可视化工具
作者发布一个基于 Transformers.js 的 LLM 注意力可视化工具,可悬停查看生成 token 依赖的历史 token,代码开在 GitHub。可视化将所有层、所有注意力头的注意力权重乘以 value 向量模长后聚合为单一数值控制透明度,并预生成提示词避免下载数百 MB 模型;作者还通过修改 onnx 文件暴露内部值,上传到自己的 Hugging Face 仓库供浏览器生成使用。
Aravind Srinivas@AravSrinivasAI 评分7878
OpenRouter@OpenRouterAI 评分5454
Yuchen Jin@Yuchenj_UWAI 评分5656
Rohan Paul@rohanpaul_aiAI 评分6666
Rohan Paul@rohanpaul_aiAI 评分8282OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分8686 OpenAI 宣布以内部 AI 系统给出 Navier–Stokes 千禧年问题解答
OpenAI 宣布其内部 AI 系统给出 Navier–Stokes 存在与光滑性问题的解答,证明初始光滑的流体可在有限时间内形成奇点,并附证明文稿与 Lean 形式化验证。
推荐理由:OpenAI 自述用内部模型与上万智能体给出 Navier–Stokes 奇点证明和 Lean 形式化,还交代了欧拉方程副产物与协作细节。
TechCrunch:AI(RSS)精选AI 评分8585 NYU 数学家指控 OpenAI 在千禧年难题竞赛中不正当竞争,Bubeck 否认
NYU 数学教授 Tristan Buckmaster 与 Anthropic 数学家 Levent Alpöge 公布针对 Navier-Stokes 存在与光滑性这一千禧年难题的三项证明初步结果,并称其研究进展信息被泄露给 OpenAI,对方随后用大量算力沿其独特路线追赶证明。
推荐理由:原文记录了数学家与 OpenAI 就千年难题证明优先权展开的争议细节,以及双方各自的公开回应,可帮读者了解 AI 参与数学研究引发的信任问题。
Nathan Lambert@natolambertAI 评分5454
Mark Chen@markchen90AI 评分7272
OpenAI@OpenAIAI 评分7676
OpenAI@OpenAI精选AI 评分7474推荐理由:原文补充了数据隔离说明,并指出其 Euler 情形证明结果与 Alpöge 和 Buckmaster 的工作不同,读者可据此比较两条独立证明路径。
Greg Brockman@gdbAI 评分7878
Noam Brown@polynoamialAI 评分6060
Noam Brown@polynoamialAI 评分7878Noam Brown 就 OpenAI 宣布以智能体组合求解 Navier-Stokes 千禧年大奖难题发表看法,承认这次证明花费数百万美元,但认为成本会快速下降。
🚨 AI News | TestingCatalog@testingcatalogAI 评分5858Inception 发布扩散大语言模型 Mercury 2.5,官方称智力较 Mercury 2 提升 40%,在常见 NVIDIA GPU 上速度达 1107 tokens/sec。
🚨 AI News | TestingCatalog@testingcatalogAI 评分7676
OpenBMB@OpenBMBAI 评分5858
OpenBMB@OpenBMBAI 评分5353面壁智能 OpenBMB 在开源 MiniCPM5-2B 后,进一步开源其背后的 RL 训练栈。Meshy 是服务化 RL 训练框架,将推理、rollout 和训练解耦为统一数据平面上的独立服务。
公众号:卡尔的AI沃茨AI 评分5454 实测个人AI助手Today:记忆可改可删,晨间简报按日程偏好自动调整
作者以自己的日历、跑步训练和睡眠数据实测个人生活AI助手Today(Public Beta),认为其定位是个人生活连续性管理而非任务交付型工作Agent。文中记录了三个体验:日程被临时打乱时生成晨间简报并建议同步日历、睡眠不足时自动顺延非紧急待办、记忆面板可查看编辑删除每条事实且改动即时生效。作者建议按阶梯信任逐步开放权限,并指出语言切换不同步等早期产品问题。
Rohan Paul@rohanpaul_aiAI 评分5353Epoch AI:研究、数据与评测精选AI 评分6969 Epoch AI 实测 GPT-5.6 与 Claude 5 长上下文延迟缩放差异
Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。
推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。
OpenBMB@OpenBMBAI 评分5454Hacker News 热门(buzzing.cc 中文翻译)AI 评分5959 湖南大学论文借 OpenAI Codex 证明球面 Hadwiger 猜想引发数学界前景讨论
博主 _alternator_ 撰文讨论湖南大学 Wang & Wu 的新预印本,其证明自 1974 年悬置的球面 Hadwiger 猜想时声明使用了 OpenAI Codex 协助完善证明细节、查找缺口和排版编辑。
OpenBMB@OpenBMBAI 评分6262
DAIR.AI@dair_aiAI 评分6060LinkedIn 论文《Does Your Agent's Memory Survive a Model Upgrade?》用 48 条合成历史比较四种记忆格式在更换读写模型后的可迁移性。
The Decoder:AI News(RSS)AI 评分5656 阿里发布 Qwen-Drive 1.0,一个模型同时承担驾驶与座舱助手
阿里巴巴 Qwen 团队发布 Qwen-Drive 1.0,基于 Qwen3.5-4B,在语言模型上叠加 3D 环境感知和路径规划两个模块,用同一模型同时服务驾驶系统和座舱助手。
Tencent Hy@TencentHunyuanAI 评分6363IT之家(RSS)AI 评分5959 科大讯飞发布星火 X2.5 模型:293B-A30B MoE 架构,全国产平台训练
科大讯飞 9 月 7 日正式发布星火 Spark X2.5 多语言文本生成模型,基于全国产平台训练,采用 MoE 框架,参数为 293B-A30B,支持 256K 上下文。模型全面提升代码和智能体能力,覆盖 200 余种语言,已在讯飞星辰 MaaS 平台上线,输入定价 1.6 元/百万 Token(缓存命中 0.24 元),输出 6 元/百万 Token。
Charlie O’Neill 研究写作(RSS)AI 评分6060 Charlie O'Neill 谈 RL 环境信仰与理性下注:长、真、自有
Charlie O'Neill 撰文指出,宣称一切将是 RL 环境的人很少按该信念做出理性行动,如同当年 scaling 和 AGI 信奉者并不真下注。他提出无论 RSI 是否成立都应造高价值数据与环境:若 RSI 成立,单位效用环境价值将指数增长,值得在实验室内做最有针对性、可累积的环境;若不成立,实验室需要模型在所有领域变强,会为有用数据支付高价。