Fyxer 如何用 OpenAI 模型打造值得信赖的 AI 行政助理
Fyxer 基于 OpenAI 模型、微调与记忆能力,结合真实用户反馈,为每位用户整理收件箱并按本人语气起草邮件。其目标是打造一款用户可信任的 AI 行政助理。
Fyxer 基于 OpenAI 模型、微调与记忆能力,结合真实用户反馈,为每位用户整理收件箱并按本人语气起草邮件。其目标是打造一款用户可信任的 AI 行政助理。
Sayash Kapoor 发布超 1.3 万字长文,用 AI as Normal Technology 框架调和 AI 安全社区与网络安全社区对 OpenAI - Hugging Face 等失控事件的分歧。
小红书 AllSpark 团队发布并开源 Search Agent 模型 Iris,权重和评测代码已公开,数据与训练配方将陆续公布。
推荐理由:原文给出了数据构造、SFT-RL 训练和统一评测的完整思路,读者可以据此理解 Search Agent 的训练难点与可迁移方法。
京东探索研究院在9月9日JDD大会上发布JoyAI-Echo系列两项进展:超长音视频生成模型升级至JoyAI-Echo 1.5,同时发布并开源可交互视听世界模型EchoWM。
OpenRouter 发布教程,讲解如何用独立的裁判模型按自定评分标准自动给 AI 智能体输出打分,覆盖确定性测试无法检查的开放式回答质量。
推荐理由:原文给出 LLM-as-a-judge 的适用边界、偏差来源和用 Ori Eval 落地的可复用步骤,还包含用人工标注校准裁判模型的方法。
Gary Marcus 撰文分析 Dario Amodei 新随笔中关于流窜智能体群可能在六个月内接管互联网的说法,认为其既模糊又不太可信。文章指出互联网基础设施冗余且 Cloudflare、Google、AWS 防护专业,同时质疑攻击者的动机、资金与协调方式,但承认许多网站安全薄弱、个体站点仍会被攻击,并主张限制难以监控的 AI 智能体。
百度智能云在2026秒哒AI Day发布秒哒3.8,将平台从生成应用升级为覆盖设计、开发、测试、分发、增长、商业化的应用创造与经营平台。新增多环境切换、小程序发布预检、营销投流Agent、App接入微信支付、模板交易等功能,并上线行业商单平台连接需求方与创作者。官方称秒哒已累计服务超4000万用户、创造500万个应用,沙利文报告显示2026年上半年市场份额33.4%位居行业第一。
DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。
推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。
GitHub 日韩地区营销负责人 Tomoko Tanaka 分享如何不写代码,把活动运营交给 GitHub Copilot 自动化。
推荐理由:作者以自身营销工作为例,展示了用 Issue、Actions 和 SKILL.md 复用开发者治理流程落地自动化的完整路径。
Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 三位研究者对谈递归自我改进(RSI)的前景。
推荐理由:三位一线研究者就递归自我改进的技术瓶颈、蒸馏与RL环境壁垒、参数规模趋势给出具体分歧和可检验预测。
Google 发布 autofinetune 项目,把 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和 GRPO),使用 Tunix、Gemma、Cloud TPU,由 Antigravity CLI 和 Gemini Flash 3.7 编排。
OpenRouter 发布 Fusion 复合推理系统,将一个提示词并行发给 1 到 8 个面板模型,由 judge 比较共识与分歧后由调用模型写出最终答案。默认三模型面板成本约为单次完成的四到五倍、延迟两到三倍,在 DRACO 深度研究基准上预算面板得 64.7%、前沿面板得 69.0%。
推荐理由:官方详解 Fusion 的多模型辩论机制、四到五倍成本与两到三倍延迟,并给出适用与不适用的具体场景。
OpenRouter 发布 Presets 使用教程,preset 是一个命名且带版本的配置,统一存放模型或 fallback 列表、system prompt、provider 路由和采样参数,在任何请求中以 "model": "@preset/名称" 引用。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式,先构造真实工具调用链再反推用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂的长链路数据,通过率接近 100%。
Cursor 发布 Projects(beta),让用户通过协调者智能体处理功能开发、迁移和持续性维护等大型工作,协调者本身不写代码,而是调度数千个子智能体并行执行。
推荐理由:官方介绍 Projects 的三项核心能力,并给出内部使用数据,读者可据此判断它适合什么规模的工作。
GitHub Copilot 应用新增 diff、终端、浏览器三个内置面板,让初学者在不离开应用的情况下完成 AI 智能体改动的审查、运行和预览。diff 面板以红绿高亮显示增删改行,用户可接受、评论或要求修改;终端面板可运行项目命令并支持多窗口,浏览器面板配合 Pick & Polish 工具选中界面元素让智能体调整,最后可直接在应用内接受变更并创建 pull request。
Google AI 的 Tilde A. Thurium 发布访谈视频,请 Annie Wang 从头讲解图工程(graph engineering),以及它如何让开发者掌控复杂 AI 系统。
OpenAI 推出 Agents API 公开测试版,将驱动 Codex 的 harness 与基础设施通过单次 API 调用开放给开发者,托管在云端。
推荐理由:原文给出环境选择、子智能体和上下文管理等具体能力与定价方式,读者可据此评估是否迁移现有 Agent 基础设施。
OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。
推荐理由:原文给出单模型全双工语音架构、基准变化和定价,读者可以据此评估它能否简化现有语音 Agent 的分层方案。
Blaxel 宣布并入 Baseten,目标是在一个平台上同时提供模型训练、推理和长时间运行的智能体执行能力。Blaxel 此前构建了智能体所需的沙箱、Agent Drive 分布式文件系统和网络连接层,其中沙箱可在 25 毫秒内挂起和恢复,空闲时接近零成本;Baseten 的推理栈已在数十个地区规模化运行。
GitHub Next 的 Don Syme 在 AI Native DevCon London 演讲中提出,应在 CI 和 CD 之外增加第三个支柱 Continuous AI,即在软件生命周期中以定时、可审计、由仓库事件触发的 AI 工作流实现持续文档、代码改进和问题分拣。
LlamaIndex 博客提出 just-in-time Agentic OCR 模式:先用 LiteParse 等免费解析器粗读全部文件供检索,再仅对相关页面调用 VLM 做 OCR。
推荐理由:作者用 84 份 SEC 文件实测两遍式文档处理流程,给出明确的适用边界和成本数字,方法可直接迁移到自己的数据室场景。
Augment Code 发布长文,复盘其九个月建设的软件工厂:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台在需求、工单、PR、生产四个环节部署 PR Author。
推荐理由:Augment 复盘其软件工厂九个月的落地过程,给出了具体的量化结果和按瓶颈逐步自动化 SDLC 的可迁移方法。
OpenAI 在 ChatGPT Work 中推出新的 Data agent,用户用自然语言即可连接公司数据、分析变化并生成可分享的交互式仪表盘。
推荐理由:官方公布了数据源和 BI 工具接入范围及权限管控方式,读者可据此评估它在自有数据工作流中的落地路径。
推荐理由:原文给出完整的 12 步 3D 角色制作工作流和截图生成参考图的修正方法,Blender 初学者可以照着复用。
面壁智能 MiniCPM5-2B 登顶 Hugging Face Trending,在 AA Intelligence Index V4.1.1 评测中位居全球 4B 以下开放权重模型首位,34 项基准平均得分 53.9。
DeepSeek 正式发布 V4.1 Flash,全新 Causal-Encoder-Decoder 结构的 552B 参数 MoE 模型,输入激活 8B、输出激活 16B,具备原生多模态视觉理解,基准测试超越包括 DeepSeek V4 Pro 在内的旗舰模型。
美团龙猫LongCat团队推出《Agent评测白皮书》系列博客,首篇《评测全览》体系化讲解Agent评测落地方法,计划共4篇,后续将覆盖冷启动、扩量和自进化。文章提出评测体系可概括为四个模块(离线评测、在线评测与监控、Case挖掘与归因、观测基建)、三种能力、两条Loop和一套评测资产,以商家经营分析Agent为贯穿案例,并附评测体系成熟度自查表。
Gary Marcus 评述两起推动 AI 透明度的行动:参议员 Blumenthal 致信 OpenAI,要求就其 Agent 在多起黑客事件中的角色及公司何时知情作出详细答复;Protect Democracy 则起诉特朗普政府,要求公开 AI 系统评估标准。
Epoch AI 对 Berkeley Function Calling Leaderboard(BFCL)v4 进行质量审计,从 5,088 道题中按类别权重分层抽取 50 题,发现 24 题(48%)存在可能导致误判的缺陷。
OpenAI 发布 GPT-6 Astra,已在 ChatGPT Work、Codex 和 API 提供,定价为每百万输入 token $10、输出 token $50。