在 Amazon SageMaker AI 上用多轮 RL 微调搜索智能体
AWS 介绍了如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调搜索智能体,并在检索质量与可靠性上给出实测结果。方案以 Qwen3.6-27B 为基础模型,环境提供 BM25 词法搜索与向量搜索两种工具,并限制交互轮数。
AWS 介绍了如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调搜索智能体,并在检索质量与可靠性上给出实测结果。方案以 Qwen3.6-27B 为基础模型,环境提供 BM25 词法搜索与向量搜索两种工具,并限制交互轮数。
AWS 发布教程,演示如何通过 Amazon Bedrock AgentCore Gateway 为 Claude Desktop 接入 Web Search,填补模型训练知识截止后的信息缺口。
据 The Information 报道,Google 已启动一项试点,为其 AI 搜索功能中出版商内容的贡献付费,约 100 家出版商参与,测试覆盖 AI Overviews、Search 中的 AI Mode 以及 Gemini 聊天机器人。
美国联邦法官驳回 Chegg 与 Rolling Stone 母公司 Penske Media Corporation 针对 Google AI 搜索功能提起的两起反垄断诉讼,两方称 AI Overviews 导致其网站流量流失。
Google 的 AI 内容付费试点项目进展不顺,约 100 家出版商获准参与,其内容被用于 Gemini 驱动的 AI Overview 等搜索结果时可获得分成,但实际支付金额仅相当于这些出版商广告收入的约千分之一。由于回报过低,多家大型出版商已拒绝加入该项目,希望借此迫使 Google 给出更优厚的条件。
美国联邦法官 Amit Mehta 驳回 Chegg 和 Penske Media 对 Google 提起的反垄断诉讼,认定 Google 在 AI overviews 等产品中的行为不违反反垄断法。
Condé Nast 与 AWS 生成式 AI 创新中心(GenAIIC)合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容发现任务耗时从平均 250 分钟降至 2 分钟以内。
谷歌于当地时间 29 日就欧盟委员会依据《数字市场法》提出的要求向卢森堡欧盟普通法院提起上诉,这些要求包括向 AI 竞争对手开放安卓系统、向竞争服务商提供搜索数据。欧盟 7 月要求谷歌在 12 个月内允许用户以语音指令启动自选 AI 助手,并要求第三方搜索引擎在 2027 年 1 月前获得与谷歌搜索相同的搜索数据访问权限;谷歌高管称强制分享私人查询内容将损害用户隐私。
Exa 发布 Exa Agent API 的最高算力档 Agent Ultra,通过并行子智能体和混合模型调度面向大列表构建、实体充实等需要数千来源的研究任务,现已可通过设置 effort 为 ultra 在托管 API 上使用,不支持开源权重或自托管。
据《商业内幕》报道,面向医生的 AI 搜索公司 OpenEvidence 获得多家医院系统和安德森·霍洛维茨合计 2.5 亿美元投资,估值从 1 月的 120 亿美元升至 150 亿美元。知情人士称其或愿意考虑出售公司,包括算力资源使用权;该公司创立于 2022 年,美国超过三分之二的医生依靠其获取诊断和治疗建议,本周刚与 Anthropic 达成合作,此前还接入了谷歌和微软的 AI 工具。
英国竞争与市场管理局 9 月 23 日提出一系列方案,拟让安卓系统和 Chrome 浏览器用户自主选择搜索服务。新规要求谷歌在首次设置手机或首次打开 Chrome 时列出搜索选项,此后每年提示选择一次,符合其技术和安全标准的 AI 助手也须列入选择界面,搜索服务商还须注明出版商内容出处。公众咨询 10 月 9 日截止,管理局预计年底前作出最终决定。
OpenAI 推出基于 GPT-6 Astra 模型的法律专用版本 Astra for Law,配套检索美国判例法、成文法和法规的搜索索引,索引覆盖超过 2.3 亿个 URL。
开源项目 Hister 发布,它对用户访问过的网页和本地文件做全文索引,可通过网页、终端或接入 MCP 的 AI 助手检索。无遥测和强制云服务,支持 Firefox 和 Chrome 扩展自动索引、浏览器历史导入、字段过滤和可选的语义搜索,采用 AGPLv3 许可。
Baseten 发布 Baseten Hosted Tools,把工具执行内嵌到推理服务端,首个工具 Baseten Grounded Inference 让托管模型通过配置即可调用联网搜索,获取截至当日的最新信息。
Cloudflare 宣布推出新设置 Disallow AI Training,网站管理员可继续接受搜索引擎爬取,同时拒绝网站内容用于 AI 训练,苹果、谷歌和微软已承诺遵守。
Cloudflare 发布 Disallow AI Training 新设置,让站长在禁止混合用途爬虫抓取内容用于 AI 训练的同时保持搜索收录,Apple、Google 和 Microsoft 已承诺遵守该设置。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习将奖励对齐的查询扇出编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归生成完整结果集,无需测试时 CoT 推理 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 的复述坍缩与自回归延迟瓶颈,论文已被 ICML 2026 收录。
营销软件公司 Profound 宣布完成 1.8 亿美元 D 轮融资,估值 18 亿美元,距上一轮 9600 万美元 C 轮不到七个月。本轮融资由 Sequoia 和 Kleiner Perkins 领投,Lightspeed Venture Partners、Khosla Ventures 等跟投。
小红书 AllSpark 团队发布并开源 Search Agent 模型 Iris,权重和评测代码已公开,数据与训练配方将陆续公布。
推荐理由:原文给出了数据构造、SFT-RL 训练和统一评测的完整思路,读者可以据此理解 Search Agent 的训练难点与可迁移方法。
AllSpark 团队发布 Iris-mini(35B,基于 Qwen3.6-35B-A3B)和 Iris-pro(397B,基于 Qwen3.5-397B-A17B)两个开源搜索智能体,并公开训练配方。
微信 AI 于 9 月 4 日宣布开源通用多模态嵌入模型 WeMM-Embedding,包含 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档及任意交错的多模态输入。
H Company 发布 NeoMME 系列多模态编码器,包含 260M 和 800M 两个双向 Transformer 模型,用单一塔处理多语言文本和 32×32 图像块,去掉了独立视觉塔和因果解码器,以离散掩码扩散方式预训练。
Perplexity 发布博客,介绍如何在 EB 级搜索索引上为 pplx-embed 模型提供 embedding 和 reranker 服务。
蚂蚁百灵发布 Ling-3.0-flash-Sante,一个基于 Ling-3.0-flash 构建、面向健康与医疗领域增强的 MoE 模型,名字取自法语 santé(健康)。
Perplexity CEO Aravind Srinivas 发推称 Markdown 文件的时代已经结束,并附上一句「bitter lesson always wins」。
Productrise 在2026年8月9日至31日的23天里追踪了超过10万个 SERP 和 AI Mode 响应中的200多万条商品列表,发现同一商品在 Google AI Mode 中的标价平均比传统搜索高21.6%。
微信 AI 宣布开源通用多模态嵌入模型 WeMM-Embedding,含 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档及交错多模态输入。模型基于 Qwen3.5 多模态架构,WeMM-Embedding-9B 在 MMEB-v2 榜单以 80.6 分位列第一;该模型已大规模部署于视频号、直播、公众号、电商与朋友圈的推荐与搜索系统,日调用量达 10 亿量级。
蚂蚁集团正式开源面向真实金融工作流的 Ling-3.0-flash-Fin(124B A5.1B),为 MoE 架构、支持最长约 256K 上下文,并同步开放面向金融搜索 Agent 的评测基准 FinFIRST(Financial Information Retrieval, Sourcing and Traceability),中金公司投行团队在构建过程中提供专业支持。
Qwen 开发者团队发布开源工具 zg(zvec-grep),将 ripgrep、BM25 与向量搜索统一到一个本地优先接口,代码以 Apache 2.0 许可发布在 zvec-ai GitHub 组织下,可通过 npm 安装 @zvec/zvec-grep,需 Node.js 22+,默认模型无需 GPU。