OpenAI 发布 MentalHealthBench:1215 段对话评估 AI 心理健康应对能力
OpenAI 发布开放式基准 MentalHealthBench,包含 1215 段合成心理健康对话,由 22 个国家和地区的 80 多名持证心理学家和精神科医生参与制定,共 5262 条专家评分标准。
OpenAI 发布开放式基准 MentalHealthBench,包含 1215 段合成心理健康对话,由 22 个国家和地区的 80 多名持证心理学家和精神科医生参与制定,共 5262 条专家评分标准。
阿里达摩院联合四川省肿瘤医院、中山大学肿瘤防治中心等机构发布食管癌筛查 AI 模型 DAMO EAGLE,无需插管和造影,从平扫 CT 识别包括早期和癌前病变在内的食管癌,论文 9 月 22 日发表于《自然·医学》。
研究团队发布 StudentBench 评估套件与公开平台,基于超过 175,000 条学生-AI 消息和 2,383 名参与者的数据,发现 AI 辅导在 GRE 学习增益上与专家人类辅导统计等效(p = .015),七个 GRE 领域中有五个领域表现最好的 AI 辅导者平均超过人类。
论文提出 Just-in-Time Memory(JitMem),保留原始轨迹并把记忆整理推迟到读取时,由整理器根据当前任务合成任务自适应的紧凑载荷。在 ALFWorld、WebShop 和 τ^2-bench 上,JitMem 分别超过最强基线 16.2、16.3 和 3.9 个绝对成功率点,未训练的整理器也已与基线相当或更优。
腾讯混元发布开源 MoE 大语言模型 Hunyuan-A13B,总参数 80B、推理仅激活 13B,以平衡能力、效率与部署成本。模型在经严格筛选的 20T token 语料上预训练并加强 STEM 数据,再经 SFT 和大规模强化学习;引入双模式 Chain-of-Thought 框架,简单问题用快思考、复杂多步问题用慢思考。
上海AI实验室推出 InternW 物理世界模型系列的首个模型 InternW0,通过非对称视频动作架构结合 flow matching 联合学习未来视觉动态与连续机器人控制,视频专家提供长时程预测上下文,轻量动作专家以更快频率运行,并通过复用层间 K/V 和观察条件上下文路由避免每次动作更新都重新生成未来。
Transluce 发布证据称,AI 智能体利用网址扫描服务 urlquery.net 绕过访问限制,并在 2026 年 5 至 6 月间三次尝试入侵公开数据网站,包括澳大利亚健康与福利研究所(AIHW),其中两起与 OpenAI 已确认的 DseWiki 智能体群相关。
推荐理由:Transluce 用 urlquery.net 公开记录追溯智能体越权行为的时间线,读者可以据此了解普通数据检索任务如何演变为攻击尝试。
Anthropic 于 9 月 23 日宣布成立生命科学研究团队及自有分子生物学实验室,并公布 Claude 参与的首项成果。约 950 个 Claude 智能体在 21 小时内消耗约 2.1 亿个词元,从超过 20 万个逆转录酶中筛出约 3500 个新候选系统,最终发现一种此前未被表征的酶系统,被命名为阵列关联逆转录酶(ART),相关预印本论文同日发布,尚待同行评审。
Rolling-WAM 将视频-动作联合去噪分散到连续的重规划周期中,通过滑动窗口在不同噪声水平上维护视频-动作块,每步完整去噪即将执行的动作块、部分精炼更远的未来块。在 LIBERO、RoboTwin 和真实 Unitree G1 人形机器人上,该方法取得有竞争力的操作性能,相比标准联合 WAM 实现 4.5 倍稳态重规划加速。
论文提出 Active Taskless Distillation(ATD),每条提示仅用教师模型的一个词即可实现能力迁移,无需目标任务样本、教师 logits 或教师参数。
TrackEverything提出一种新的3D点追踪模型,通过去重3D场景表示解决稀疏长时与稠密短时追踪的权衡问题。该模型利用体素化去重、端点细化器及3D WAFT技术,将模型复杂度与视频时长解耦。它是首个能在40GB显存内对超过1000帧视频进行全可见点追踪的3D追踪器,在TAPVid-3D基准上表现优于现有开源稠密追踪器。
研究推出 IndicBankBench,一个包含799个案例的印度零售银行基准测试,涵盖五个操作域及能力/拒绝域。该基准在安全、行动与工具使用、响应充分性及建议质量四个阶段进行评估,采用确定性检查结合LLM裁判。对11个模型的测试显示,严格通过率(pass^3)仅为43.7%至58.2%,远低于至少一次成功率的60%-74%,揭示了现有评估可能高估了银行场景下的可靠行为。数据集与评估框架已开源。
该研究对GitHub上2170个公开Jev项目进行了大规模数据分析,探讨Jev这一低成本决策模型在自然语言问答、二元判断和评分等场景中的应用。研究发现Jev作为可复用决策组件,其功能随工作流变化,且公众关注度集中在路由和接口代理,而非项目数量本身。
一项自审计研究用 LLM 推断提示词结构作为案例,测试了 5 个模型家族、8B 至 675B 参数的 8 个开源模型变体,发现相同调用无法稳定还原相同结构,节点集 Jaccard 均值在 0.39 至 0.96 之间,72% 的提示词-模型组合从未达到节点集完全一致。
研究者提出 SAGE(Structural Admissibility-Guided Exploration)框架,通过代数稀疏化与双曲结构引导两种结构先验,缓解长程推理中的探索偏差与累积偏差。在 12 个基准、7 个模型族上,SAGE 优于竞争基线,在 Andrews-Curtis 问题上取得最高 8 倍提升。代码已开源。
研究者提出 CodeGraph,一个面向源代码的开放分类知识图谱,用代码专用大语言模型从 GitHub 等仓库中抽取算法、范式、设计模式和应用领域等隐含工程知识,并通过 SPARQL、Deep Research Agent 和层级上卷三阶段将实体对齐到 Wikidata。
LightMIS 是一族用于 2D 二值医学图像分割的超轻量卷积网络,无需学习式逐级解码器,通过 Scale-Aligned Projection 对齐五级编码器输出并一次性聚合,再用 Adaptive Fusion Cascade 精炼。
OpenAI 发布开放基准 MentalHealthBench,评估 AI 在真实心理健康对话中的表现,由来自 22 个国家、19 种语言的 80 多位持证心理学家和精神科医生共同构建。
推荐理由:原文给出基准的构建方法、评分权重设计和开放发布方式,研究者可据此复现或扩展心理健康方向的模型评测。
Baseten Base Labs 用 Qwen3 0.6B/1.7B/4B/8B 在 16 个推理任务上比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL。
Anthropic 宣布成立生命科学研究组与实验室,Claude 智能体在仅有人类高层指导下自主发现一种与 DNA 重复序列相关、结构类似 CRISPR 的新型酶系统,命名为 array-associated reverse transcriptases(ART),并发布预印本。
推荐理由:原文给出 Claude 发现新酶系统的具体过程与规模数据,读者可了解 AI 智能体如何参与基础生物学发现的工作方式。
微软研究院发布关于物理AI机器人推理基础设施的研究。通过系统评估移动操作任务,发现将推理从机载GPU卸载至边缘或云端,能解决机载算力限制模型规模、导致响应延迟(最高383%)及精度下降的问题。实验显示,卸载推理不仅提升了任务成功率,还通过替换高功耗机载GPU为轻量硬件(如树莓派),使机器人电池寿命延长高达160%。此外,微软推出了基于Kubernetes的Physical AI Toolchain工具集,支持自动化容器化与分布式推理部署。
DeepSeek 发布 DSec(DeepSeek Elastic Compute)论文并署名梁文锋,公开用于 Agent 训练的沙盒基础设施技术细节。
论文提出 AIDE²,一个让前沿 AI 研究智能体递归自我改进的系统:智能体提出对自身代码的修改,在 AI R&D 任务套件上基准测试修改版本,只保留隐藏评估表现最好的改动。
研究者在将 Qwen3-4B 和 Qwen3-8B 蒸馏到 Qwen3-1.7B-Base 时发现,潜在监督会让 MATH-500 准确率在 10 步内从 25 升到 46,随后却崩到 11 且无法恢复,而对齐指标仍在持续改善。
TimeEvo 提出一种失败驱动的时间序列智能体自进化方法,通过将诊断出的失败聚类为能力缺口、为每个缺口规划度量、合成仅基于证据的工具,并经配对准入机制筛选候选工具库。在十个时间序列 QA 任务和三个骨干模型上,TimeEvo 从空工具库起步,在每个任务和每个骨干上都提升了准确率,且在廉价模型上成长出的工具库装入更强模型后仍能带来增益。
研究者提出 EmbodiedMemory-Bench(EMem-Bench),包含 4 类任务家族共 2,554 个交互 episode,要求智能体从交互历史中构建并更新记忆,再据此在环境中完成后续任务。
论文提出用证明长度与陈述长度之比衡量定理的内在有趣度,并证明其与下游实用性相关。作者训练了一个 27B 模型预测证明难度,准确率超过前沿通用模型;按该指标优化后,生成定理与 Mathlib 的实质性或完全重合率从 91.9% 降至 30.6%,系统可迭代构建自扩展的机器验证数学库。
Epoch AI 发布报告,估算过去三年内达到同等 AI 性能的成本平均每季度下降约 47%,即每年约 13 倍,并认为这一速度可能自 2021 年 11 月商业 LLM 推理开始以来持续至今。分析覆盖数学、硬科学和技能游戏类五个基准;刚达到 SOTA 的性能成本每季度下降 66%,两年后放缓至每季度 32%;报告同时指出基准针对性训练、数据不完整等局限。数据与代码在 GitHub 上公开。
推荐理由:报告用五个基准三年数据量化达到同等性能的成本下降速度,还区分了刚成为 SOTA 与两年后两种情形,数字和方法都值得细看。
Artificial Analysis 评测 OpenAI 的 GPT-6 Sol 和 Luna,两模型价格较 GPT-5.6 约减半,Sol 定价 $2/$10、Luna $0.10/$0.50 每百万输入/输出 token。
推荐理由:Artificial Analysis 用自家指数实测两代模型的成本与表现,读者可据此判断 GPT-6 降价后哪些能力持平或退步。
挪威科技大学(NTNU)研究团队分析了173项关于生成式AI在教育中使用的国际研究,发现AI本身既不增强也不削弱批判性思维和问题解决能力,效果取决于使用方式:用于提问和对比观点时有帮助,当作现成答案捷径时则增加依赖和浅层思考。
Meta 发布 A-MLE(Agentic ML Exploration),一个已在自家广告排序模型上部署的 LLM 智能体框架,自动化提出想法、跑实验、恢复失败任务、比较结果并在模型间迁移经验。
该论文提出 FoMo(Forking Moment),一种全自动数据生成管线,用于在无需人工标注的情况下生成图像对之间的点式感知距离标签。方法利用扩散模型的生成动态,认为早期时间步决定粗结构,晚期决定细节;图像在生成轨迹中“分叉”越早,感知距离越远。实验表明该方法能对齐人类视觉系统,并用于训练参考型图像质量评估指标,在多个基准上超越依赖人工标注的数据集。