用 SFT 与智能体 RL 训练 4B 模型,生成比 Postgres 默认快 81% 的查询计划
Rohan Bansal 通过 off-policy 蒸馏 GPT-6 Astra 轨迹和智能体强化学习,将 Qwen 4B 模型训练为查询优化智能体,在 Join Order Benchmark 113 条 join 密集查询上实现 1.81x 几何平均加速和 44.7% 总延迟下降。
Rohan Bansal 通过 off-policy 蒸馏 GPT-6 Astra 轨迹和智能体强化学习,将 Qwen 4B 模型训练为查询优化智能体,在 Join Order Benchmark 113 条 join 密集查询上实现 1.81x 几何平均加速和 44.7% 总延迟下降。
Arena 实习生 @melissapan 评测 7 个模型在 Claude Code、Codex 和 Pi 三种 harness 下的编码表现,共 21 个模型-harness 组合。
Enclave AI 的 AI 黑客基准评测中,DeepSeek V4.1 Flash 攻破全部 11 个漏洞目标、4 个修复对照全部守住,接受运行成本仅 4.65 美元。后续审计确认 6 次按计划路径完成,另发现 5 条原评分系统未区分的计划外路径,团队随后关闭这些旁路并对基准加入更严格的路径校验。
Odevo 在 AI Native DevCon London 分享了其 AI Native 转型经验:这家住宅物业管理公司七年内管理房屋从约 5 万套增至约 250 万套、员工从约 1000 人增至 14000 人,2024 年起步时仅约 30% 开发者使用 GitHub Copilot 等工具。
IT之家实测努比亚 NaviX Ultra,该机由中兴努比亚与豆包手机助手团队合作打造,搭载第五代骁龙 8 至尊版处理器和 Obric UI v2.3.0.0,深度集成消费者版豆包手机助手。
作者实测火山方舟新模型 Doubao-Seed-2.1-pro-0915,该模型支持 1M 上下文和 256k 深度思考,主打 Agent 长任务稳定执行并降低工具幻觉。
据 MacRumors 报道,苹果为首款折叠手机 iPhone Duo 的双屏设计定制了新拍摄体验,包括利用 A20 Pro 芯片设备端 AI 在摆好姿势时自动拍合照的智能拍摄(Smart Take)、用外屏播放《花生漫画》吸引孩子看镜头的看看镜头(Kid Cue)、外屏实时取景的 Duo 预览,以及好友可经外屏加入通话的 Duo FaceTime。
IEEE Spectrum 撰文指出,2026 年推理已取代训练成为 AI 硬件竞争的焦点,推理模型的链式思维和 Agent 全天候运行大幅推高推理负载。
OpenRouter 梳理其目录中的 DeepSeek V4 系列图像输入支持情况:V4.1 Flash 原生读图(2026年9月10日上线,$0.15/$0.60 每百万 token)。
推荐理由:原文逐一列出 DeepSeek V4 各型号是否支持图像输入、价格和调用方式,并给出文本-only 型号配视觉模型的两段式替代方案。
作者与 Niklas 用 Codex 和 Claude 在约一个月内为 M4 Mac Mini 与 MacBook Neo 构建了完全符合 OpenGL ES 3.0 的 Linux GPU 驱动,Minecraft 可跑 200fps。
推荐理由:榜单给出四款新模型在图像生成网站任务上的排名和每百万 token 价格,可据此比较性能与成本差异。
vLLM 团队扩展 Speculators 训练库,为 2.8T 参数的 Kimi K3 训练出 DSpark 投机解码 draft 模型,将数学推理单流交互速度从约 110 提升至约 435 tok/s/user,并发负载下输出吞吐最高提升约 3.5 倍。
Strix 团队在选择推理服务商时对 *.baseten.co 做黑盒扫描,约 25 分钟内通过公开 Harbor registry 拉取镜像,在 Docker 构建历史中发现一个 2023 年 3 月的 GitHub personal access token。
NVIDIA 技术博客讲解 dense 与 MoE 架构在参数激活、吞吐和部署上的差异,以 Nemotron 3.5 Lightning 为例说明 MoE 每词元仅激活约 3B 参数、总参数 30B 仍需约 60 GB 显存。文章给出按显存预算、并发、微调和量化需求选型的建议,并对比 Gemma 4 31B、Qwen3.8-27B、Mistral Small 4 等模型的输出速度与价格数据。
Google 开发者博客发布零信任智能体系列第二部分,把安全检查从构建期移到 Gemini Enterprise Agent Platform 运行时,用 Model Armor、Semantic Governance Policies 和 Agent Anomaly Detection 三项托管控制拦截构建期规则放过的攻击。
作者 Zho 实测 GPT-6 Astra,仅凭一句提示词、不提供照片,让其完成精细建模、渲染、分镜、旁白、原创配乐到剪辑的 2 分钟建筑短片《POMPIDOU:A PUBLIC MACHINE》。
作者开源 fugleramme,一个基于 Raspberry Pi 5 和 Inky Impression 13.3 英寸电子墨水屏的画框,通过 BirdNET-Go 在本地实时识别麦克风听到的鸟鸣,并匹配 19 世纪公共领域博物学插画渲染展示,已收录超过 800 张手工抠图、覆盖 400 多个物种。
MacStories 主编 Federico Viticci 发布博文,汇总 iOS / iPadOS 27 的 54 条隐藏新功能与新特性。
文章讲解大模型推理的 prefill 与 decode 两个阶段:prefill 并行处理给定输入,决定 TTFT;decode 逐 token 自回归生成,常受内存带宽限制。
推荐理由:原文给出语音到语音模型的完整分数、速度和成本对比,读者可据此在不同后端配置间做选型判断。
SemiAnalysis 用自有 AgentX 基准发布 Rubin 平台的首批智能体推理实测结果,在 170 TPS、TRTLLM NVFP4 场景下,Vera Rubin NVL72 单位 TCO 总吞吐约为 GB300 Dynamo TRTLLM 的 67 倍,在 60-100 TPS 常用区间为 1.4-3 倍。
作者用GPT-6 Astra、群核科技的Aholo Lux3D和Blender完整规划了一个包豪斯风格拍摄间。
文章区分 Agent harness、Agent framework 与 MCP 三层架构,指出 harness 拥有执行循环、状态、权限和恢复,框架只暴露钩子,MCP 仅拥有工具传输且无法在协议层强制同意。
作者在拆箱 Xteink X3 电子墨水阅读器后几小时内,借助 GPT-6 Astra(Codex)和 Fable 5.1(Claude Code)排查 CrossPoint 固件下灰度图片上的竖向条纹。
作者分享把 35kb 预提示从 OpenAI/Anthropic 迁移到自托管 Ollama 的实验笔记,在 65k token 上下文窗口下大提示词会迅速饱和并导致 Agent 重复工具调用。他提出单目标提示拆分、声明式定义 opencode agents、显式调大 ollama 上下文、会话状态落盘等做法,并列出上下文耗尽的失败信号如连续相同工具调用与重复读文件。
Entelligence 在 50 个公开基准 PR 上用相同提示词对比 GPT-5.6 Luna 和 GPT-6 Astra 的代码评审能力,Luna 找到 69 个经验证 bug(Astra 92 个),总成本 $0.20 对 $5.66,精度 74% 对 96%。
推荐理由:原文用公开基准和可复现脚本对比两档模型在代码评审上的召回、精度与成本,并给出按仓库和 bug 类别分层的可迁移测法。
Anthropic 与 Accenture 联合发布帮助 CIO 和技术负责人把 AI 项目从试点推进到生产的实用蓝图。指南引用 Accenture 2026 年 7 月报告称仅 23% 的高管认为 AI 项目取得持续的企业级影响,并列出按时间顺序的七项考量、四部分任务定义、轻量总拥有成本模型、四层监督模型及决策过渡蓝图。
TechCrunch 作者实测 iOS 27 公测版后表示重新使用 Siri,新版 Siri 基于 Google Gemini 模型构建,可处理多步指令、读取屏幕上下文、调用相机回答所见物体并支持草拟发送消息。
Michael Lynch 根据自己在 Google、Microsoft 及创业公司写设计文档的经验,讲解如何编写有效的软件设计文档,并附上一份完整的示例文档。
火山引擎采访AI导演DiDi_OK,介绍其完全用Seedance 2.5 720P制作的9分钟科幻短片《Candy》背后的制作过程。他称模型在精细定制化、运动规律理解和超长镜头一次生成上有突破,部分效果连续性超过传统CG;其工作流随之改变,提示词取代关键帧成为决定视觉上限的首要条件,世界观类叙事中分镜不再是必需。
karminski 发布大模型从零实现向量数据库的后端 Agentic Coding 排行榜(SIFT1M 上 recall ≥ 95% 的 QPS 计分)。
OpenRouter 发布教程,讲解如何用独立的裁判模型按自定评分标准自动给 AI 智能体输出打分,覆盖确定性测试无法检查的开放式回答质量。
推荐理由:原文给出 LLM-as-a-judge 的适用边界、偏差来源和用 Ori Eval 落地的可复用步骤,还包含用人工标注校准裁判模型的方法。
该教程用 JAX、Flax、Optax 和 jax3d 的体渲染原语构建端到端分层 NeRF,包含位置编码、粗细双网络与 sample_piecewise_constant_pdf 重要性采样,并用 Adam、指数学习率衰减和梯度裁剪训练。评估涵盖 held-out PSNR、深度与透明度可视化、360 度渲染 GIF 以及 marching cubes 提取密度场等值面。