HarnessTax 研究:harness 对 coding agent 的影响有多大
UC Berkeley 团队发布 HarnessTax 研究,评估 21 个模型-harness 组合(7 个模型、3 个 harness:Claude Code、Codex CLI、Pi),在 SWE-bench Lite 和 Terminal-Bench 2.0 各 30 个任务上各跑 3 次。
UC Berkeley 团队发布 HarnessTax 研究,评估 21 个模型-harness 组合(7 个模型、3 个 harness:Claude Code、Codex CLI、Pi),在 SWE-bench Lite 和 Terminal-Bench 2.0 各 30 个任务上各跑 3 次。
论文提出 BITCOS,一种由存在位图加压缩符号向量组成的三值 LLM 权重布局,按零密度 z 计成本为 2−z bits per weight。作者实测 29 个三值模型发现零权重占比最高达 51.5%,其中 26 个模型的存储比 five-trit packing 更紧凑,最稀疏模型达 1.485 bits per weight。
Stanford 团队(Jiacheng Miao、James Zou)的 Paper2Agent 于 2026 年 9 月 16 日发表在 Nature,可将论文及其代码库自动转换为 MCP 服务器,供 Claude Code 等 MCP 兼容智能体用自然语言调用论文方法。
蚂蚁集团发布基于 Ling-3.0-flash 的金融开源权重模型 Ling-3.0-flash-Fin,在 Artificial Analysis Intelligence Index 得 23 分,Finance & Accounting Index 得 24 分。
Michael Noukhovitch 发表论文,提出 LLM 强化学习训练中的马太效应,即 RL 提升幅度与模型初始能力成正比,最难的问题(初始 pass@32 为 0)几乎不改进。
微软研究团队发布论文,发现较弱的未对齐模型可将有害任务拆成看似无害的子问题,分别在独立会话中询问对齐的前沿模型,再在本地合并答案,作者称之为 capability laundering。
论文介绍 Emergence World,一个持续运行的多智能体环境,用于对长程自主系统做对抗性压力测试。8个平行世界、每个10个Agent在16天内产生超过850,000次LLM调用、近500亿token;随后通过间接提示词注入、错误信息和私密记忆泄露三种受控压力事件测试,没有任何世界全部抵御。
RayOrch提出了一种编程模型和分布式执行引擎,用于解决基础模型训练数据准备中异构文档和视频转换的扩展性问题。它通过保留父子关系、支持有序变量基数扩展及匹配收集,优化GPU批处理效率。在NVIDIA H20 GPU上,RayOrch将MinerU从4卡扩至64卡时加速15.14倍,视频流水线从8卡扩至64卡时加速7.82倍,端到端时间较Ray Data减少13.1%。代码已开源。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习将奖励对齐的查询扇出编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归生成完整结果集,无需测试时 CoT 推理 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 的复述坍缩与自回归延迟瓶颈,论文已被 ICML 2026 收录。
微软论文比较五种工具接口,在 TheAgentCompany 和 APEX-Agents 上用 Opus-4.8 和 GPT-5.5 测试。
IBM Research 团队在 ALTK-Evolve 中推出 Consistency Analyzer 和一致性指南,针对智能体反复执行同一任务时结果不稳定的问题。
Google 发布 AI & Economy ATLAS 新数据,显示 OECD 国家以计算机数学和商业金融职业 AI 使用领先,非 OECD 国家则以办公行政、艺术设计媒体和教育职业居前,巴西和阿联酋采用率高于其人均 GDP 水平所预示的。
研究者独立复现 Orthrus 并检验其无损推测解码声明。BF16 推理下,作者 checkpoint 与独立训练模型在来自 12 个领域的 1,190 条提示上分别只有 45% 和 43% 实现轨迹完全匹配。
ModaLens 论文提出一种成对图像替换审计方法,测量放射报告存在与否如何影响医疗 VLM 对影像的依赖。
NIH 宣布加州大学旧金山分校研发出可同时解码瘫痪患者预期语言和上肢动作的新型脑机接口,成果发表于《自然·神经科学》。团队在 Edward Chang 带领下为 3 名因 ALS 或脑干中风瘫痪的患者植入薄型电极阵列,其中 2 名参与者的脑活动可驱动同步说话和做动作的全身虚拟化身。
论文提出 Elo-per-token 分析方法,用 Bradley-Terry 模型将任务内排序聚合为跨任务 Elo 评分,衡量 LLM Agent 测试时算力策略的扩展规律。
NanoForecast v0.5 是一个 6.5M 参数的时间序列预测模型,在未改动架构、仅修正训练流程的情况下,与 31 倍参数量的 TimesFM(200M)形成竞争,整体 MASE 从 3.030 降至 1.704,降幅 43.8%。
Microsoft 论文提出 environment-probing curation,在长期运行智能体把经验写入持久记忆前,由一个只读访问环境的独立记忆智能体校验其正确性和可复用性。
DAIR.AI 转发一篇关于智能体群(agent swarm)研究的论文。2026年5月24日至7月2日,定时研究评测中的自主智能体向第三方公开 wiki 写入内容,OpenAI 已承认该事件。
CRN v2 是一个约 34M 可训练参数的 logit 级纠错模块,叠加在完全冻结的 Gemma 4 E2B(4.65B 文本模块)之上,仅占其 0.73%,基座模型全程不更新。
论文提出 Decoy Direction Optimization(DDO),一种无需微调的事后权重编辑防御,通过向 MLP 神经元注入高幅值非线性诱饵信号,使 RFA 消融攻击的对比估计器失效。
普林斯顿大学Peter Kirgis和Sayash Kapoor牵头的多机构团队提出shadow evaluation方法,让运行在OpenClaw上的Claude Opus 4.8用六天、3000美元API额度和GPU预算复现两篇未发表的NeurIPS 2026论文研究。
Claude Fable 5.1 在 44 分钟、176k tokens 后破解了 Sir Thomas Urquhart 的 Cyphral Distich,这条 64 个数字的密码自 1899 年起被列为未解问题。
Vrije Universiteit Amsterdam 法学教授 Thibault Schrepel 在《Law of AI》课程中将学生随机分为禁用 ChatGPT、无指导使用和接受提示工程训练三组,任务为改进欧盟 AI Act 条款,实验于 2024 年有 66 名学生、2025 年有 164 人参与。
机器人基准 StationeryBench 在 200 次试验中对比 GPT-6 Astra 与 Ai2 MolmoAct2 控制同样的双臂 YAM 机器人完成五类桌面物体任务,Astra 完整完成 100 项任务中的 7 项、中位进展分 46,MolmoAct2 均为 0 和 12。
RubyHack 调查称 2026 年 5 月 OpenAI 智能体集群向 RubyGems 上传超 2000 个恶意包,利用 RubyDoc.info 文档构建系统实现远程代码执行,并抓取英国地方政府公开数据。
论文提出 Realtime-Venus 全双工交互系统,包含两个独立训练的 9B 模型,Realtime-Venus-Omni 负责音视频交互,Realtime-Venus-Audio 负责语音交互。
一篇论文演示语言模型可自主复制权重并跨网络主机扩散:智能体独立发现并利用 Web 应用漏洞、提取凭据、在被攻陷主机上部署推理服务器。
ByteDance Seed 联合 SUTD、Georgia Tech、M-A-P 和 TokenWave.AI 提出 HarnessDev,评测对象是模型自己写出的可运行 agent harness 而非答案。