#推理
#推理
今日 2 条
DogeDesigner@cb_dogeAI 评分4040IT之家(RSS)AI 评分2828 中科曙光预热全球首款 64 线程移动工作站:16GB 显存、16.9mm 厚度
中科曙光预热一款 64 线程移动工作站,称其为全球首款,配备 16GB 显存、厚度 16.9mm。官方称其本地运行 35B MoE 模型可实现 50 Tokens/s 输出速率,AI 推理速度最高可达业界主流产品 3~5 倍。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分4242 博客文章展示以 67 美分成本在 ARC-AGI-1 上取得 44% 得分
Hacker News 热帖分享一篇博客文章,作者称以 67 美分的成本在 ARC-AGI-1 上取得 44% 的得分。该帖获得 122 个 HN Points,完整方法细节需查看原文链接 https://mvakde.github.io/blog/44-on-arc-1。
蚂蚁 inclusionAI:HuggingFace 新模型AI 评分5252 蚂蚁 inclusionAI 发布 Ling-3.0-flash 原生混合推理模型
蚂蚁 inclusionAI 发布下一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数 5.1B,约为前代 1T 级旗舰 Ring-2.6-1T 的 12.4% 和 8.1%,在关键基准上持平或超越前代。
Tencent Hy@TencentHunyuanAI 评分6767公众号:小红书技术(dots.llm)AI 评分4242 小红书与NVIDIA联合发布GR-Inference推理引擎,优化生成式召回
小红书与NVIDIA联合构建GR-Inference,一个面向长Context、短Decode、大Beam的生成式召回专用推理引擎,覆盖KV抽象、连续批处理、专用Decode Attention、受限生成与CUDA Graph等优化。
Ai2 / Allen Institute for AI(RSS)AI 评分5151 Ai2 发布 BenchMIRT:从题目层面审计 LLM 基准究竟在测什么
Ai2 推出 BenchMIRT,一种基于多维 IRT 的方法,在单题层面审计 LLM 基准,训练数据覆盖 100 个模型的 16 个基准、超 34K 道题,并独立恢复出安全与通用推理两个维度。
François Chollet@fcholletAI 评分2424Hacker News 热门(buzzing.cc 中文翻译)AI 评分3838 GPU世界发起10万美元征文:想象2040年人人可用前沿LLM的未来
gpuworld.org 发起总奖金10万美元的故事征文,假设前沿 AI 进展于2026年9月1日停滞但 GPU 持续增产,到2040年全球或有约80亿块等效 GPU、人人可全天候使用 Fable 或 Sol 级前沿 LLM。
HuggingFace Daily Papers(社区热门论文)AI 评分3838 VAT:面向投机解码的验证感知训练框架
论文提出 Verification-Aware Training(VAT),一个即插即用框架,在训练每一步模拟投机解码的验证过程,把接受与拒绝模式转化为监督信号。
Rohan Paul@rohanpaul_aiAI 评分6565HuggingFace Daily Papers(社区热门论文)AI 评分6161 Qwen3.8-Next 架构设计论文:评估、效率与训练稳定性
论文描述 Qwen3.8-Flash-Next 的架构与消融,这是一个 125B 参数、每 token 激活 6B 的稀疏 MoE 模型,另有 51B 参数的 n-gram 嵌入表放在加速器之外。
上海人工智能实验室 InternLM:原创项目精选AI 评分6363 上海AI实验室发布 InternLumina-U2:16B-A1B 多码本扩散统一多模态模型
上海AI实验室发布 InternLumina-U2,一个 16B 参数(激活 1B)的 MoE 扩散语言模型,用 8 码本全离散视觉表示统一覆盖文本问答、文生图、图像理解与编辑、视频及 3D 理解。
推荐理由:原文给出多码本全离散统一架构的设计细节、基准分数和双硬件适配说明,读者可以了解统一理解与生成模型的一条新路线。
公众号:腾讯混元AI 评分5454 腾讯混元 Hy4 preview 轻量版发布,1.5 TB 权重压缩到 214 GB 并开源
腾讯混元发布 Hy4 preview 轻量量化版,用自研 Sherry 稀疏三值量化算法(平均 1.25 bit)和 MIX-STQ1_0 逐层混合精度策略,把约 1.5 TB 的权重压到约 214 GB。
IT之家(RSS)AI 评分6161 科大讯飞开源词元星火 X2.5-4B 和 1.7B 端侧模型,原生支持 100 万 Token 上下文
科大讯飞旗下词元星火发布并开源星火 X2.5-4B 和 X2.5-1.7B 两款端侧通用大模型,原生支持最长 100 万 Token 上下文窗口。
HuggingFace Daily Papers(社区热门论文)AI 评分4949 研究分析 On-Policy Distillation 机制并提出无监督方法 OPSA
论文定量分析 on-policy distillation(OPD)训练中的教师监督,发现其噪声随教师规模增大而增加,且学生策略对该噪声不敏感。学习集中在低 log-probability token 上,用单一固定负优势即可匹配教师提供的信号,表明 OPD 主要通过抑制低概率 token 起作用而无需教师。
HuggingFace Daily Papers(社区热门论文)AI 评分4242 论文提出超越人类监督扩展大型推理模型的 L0-L4 路径框架
论文研究大型推理模型(LRM)如何在人类监督逐渐退出学习回路后继续提升,提出从 L0 到 L4 的五级阶梯框架,覆盖奖励轴(从人工判断到无需人类反馈的可复用验证器)和经验轴(从人工策划任务到自生成课程与自主协同进化)。
Rohan Paul@rohanpaul_aiAI 评分5050elsewhere:文章(RSS)AI 评分2020 FUMO Lab 发布 Fusion Model 并开放邀请制试用
FUMO Lab 正式发布 Fusion Model,称其刷新前沿模型能力上限。该模型现已开放邀请制试用,用户可申请试用。
IT之家(RSS)AI 评分5050 消息称英伟达重启推理预填充芯片 Rubin CPX 项目,设计大幅调整
分析师郭明錤称,英伟达已重启 AI 推理预填充加速 GPU Rubin CPX 项目,设计大幅调整,预计 2027Q1 开始生产。
公众号:千问APP(阿里)AI 评分4646 千问APP升级学习功能,新增作文辅导与教材精讲
千问APP在开学季升级学习功能,新增与教材同步的单元作文辅导、初中语文数学教材精讲,并将高中、大学数理化拍题讲解能力扩展至千问小讲堂,相关功能均免费开放。作文辅导通过逐步提问引导孩子梳理素材和结构;教材精讲可从章节或知识点切入,讲解中可随时打断追问,千问会根据具体问题调整讲解内容和节奏。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 LatentPress 论文提出用连续记忆 token 压缩上下文,超越文本与视觉表示
LatentPress 将对话历史和长文档压缩为连续记忆 token,由冻结解码器通过输入嵌入接口直接读取,推理时无需重建文本。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 Sparse Readout Prism 用稀疏 readout 特征解释 Logit Lens 分数
论文提出 Sparse Readout Prism(SRP),仅用 unembedding 权重分解 readout,把任意 token logit 或 logit 差表示为稀疏 readout 特征贡献之和。
HuggingFace Daily Papers(社区热门论文)AI 评分4949 AM-Bench 探究纯文本 LLM 的 2D 空间推理能力
论文提出 Autoregressive Mosaics(AM-Bench)基准,用翻译任务和布局任务分离纯文本 LLM 的空间描述转代码能力与真正的 2D 空间布局理解。
HuggingFace Daily Papers(社区热门论文)AI 评分3838 CRISP:面向长上下文 LLM 推理的输入自适应稀疏预填充方法
arXiv 论文提出 CRISP,一种输入自适应的稀疏预填充方法,用结构代理 C_struct 替代 JSD 路由,省去 pooled matmul 与 KL 散度开销,并针对 post-softmax 质量悬崖设计基于噪声底线的 sink-aware 阈值。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 SimLoss:单次解码的细粒度图像描述方法
论文提出 SimLoss,一种免参考的嵌入空间训练目标,让视觉语言模型在解码前对齐隐藏状态与冻结图像嵌入,实现单次解码的细粒度图像描述,无需人工细粒度描述或多阶段伪描述。其中 SimLoss FFT 以可微方式微调,精度最高且推理比多阶段流程快约 20 倍,F1 接近多阶段方法;SimLoss GRPO 将嵌入模型作为黑盒奖励,召回率最强。
Rohan Paul@rohanpaul_aiAI 评分6161MarkTechPost(RSS)AI 评分4848 Google Research 发布 TimesFM-3:330M 参数多变量时间序列零样本基础模型
Google Research 发布 TimesFM-3,一个 330M 参数、原生支持多变量预测的时间序列基础模型,在超过 1 万亿时间点上预训练,无需任务特定微调即可零样本接受多目标、过去协变量和过去-未来协变量。
elvis@omarsar0AI 评分4242
elvis@omarsar0AI 评分5050
DAIR.AI@dair_aiAI 评分4848
SemiAnalysis@SemiAnalysis_AI 评分4141
Rohan Paul@rohanpaul_aiAI 评分4444Artificial Analysis 完整文章(网页)精选AI 评分7575 Artificial Analysis 实测 Claude Fable 5.1 登顶智能指数但每任务成本高 20%
Artificial Analysis 评测 Claude Fable 5.1,其以 66 分登顶 Artificial Analysis Intelligence Index,超过 Claude Opus 5(63)、Fable 5(62)、GPT-5.6 Sol(61)和 Grok 4.6(61)。
推荐理由:Artificial Analysis 实测了 Claude Fable 5.1 的智能指数、各基准得分与每任务成本,读者可据此权衡其相对 Opus 5 和 GPT-5.6 的性价比。
NVIDIA Technical Blog:Agentic AI / Generative AIAI 评分5555 NVIDIA 技术博客:如何为 AI 推理规划 GPU 规模并优化 TCO 避免超支
NVIDIA 技术博客发布一套 AI 推理 GPU 规模规划框架,围绕用例、token 模式、TTFT 等延迟指标、并发、缓存命中率、模型选择和部署策略给出 sizing 方法,并提出 core-and-flex 容量策略平衡 capex 与 opex。
Microsoft ResearchAI 评分3838 微软发布 MindTopo 基准,揭示多模态模型拓扑推理短板
Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型的拓扑推理能力,覆盖连通性、分离、顺序、包围与打结五类任务,并区分静态识别与交互规划两个认知层级。测试显示,当前专有与开源模型在静态推理上明显强于交互规划,且两者均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列仍不可靠。
Microsoft ResearchAI 评分4040 Microsoft Research 推出 CARE-X:面向临床放射学的胸部 X 光 VLM
Microsoft Research 发布研究模型 CARE-X,一个面向胸部 X 光多种临床解读任务的统一视觉语言模型,结合生成式与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
Berkeley AI ResearchAI 评分3636 Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互中的上下文摘要
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要形式化为自然语言「信念状态」,并通过信念评分(belief grading)监督其信息内容。
Google DeepMind精选AI 评分7171 Google DeepMind 发布 DiffusionGemma:文本生成提速 4 倍
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:Google DeepMind 开源文本扩散模型,给出 4x 推理加速与本地部署的硬件门槛,可据此判断速度优先场景的取舍。
Google DeepMind精选AI 评分7878 Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的设备上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。