在 Amazon SageMaker AI 上用多轮 RL 微调搜索智能体
AWS 介绍了如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调搜索智能体,并在检索质量与可靠性上给出实测结果。方案以 Qwen3.6-27B 为基础模型,环境提供 BM25 词法搜索与向量搜索两种工具,并限制交互轮数。
AWS 介绍了如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调搜索智能体,并在检索质量与可靠性上给出实测结果。方案以 Qwen3.6-27B 为基础模型,环境提供 BM25 词法搜索与向量搜索两种工具,并限制交互轮数。
AWS 发布教程,演示如何通过 Amazon Bedrock AgentCore Gateway 为 Claude Desktop 接入 Web Search,填补模型训练知识截止后的信息缺口。
Condé Nast 与 AWS 生成式 AI 创新中心(GenAIIC)合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容发现任务耗时从平均 250 分钟降至 2 分钟以内。
Baseten 发布 Baseten Hosted Tools,把工具执行内嵌到推理服务端,首个工具 Baseten Grounded Inference 让托管模型通过配置即可调用联网搜索,获取截至当日的最新信息。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习将奖励对齐的查询扇出编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归生成完整结果集,无需测试时 CoT 推理 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 的复述坍缩与自回归延迟瓶颈,论文已被 ICML 2026 收录。
小红书 AllSpark 团队发布并开源 Search Agent 模型 Iris,权重和评测代码已公开,数据与训练配方将陆续公布。
推荐理由:原文给出了数据构造、SFT-RL 训练和统一评测的完整思路,读者可以据此理解 Search Agent 的训练难点与可迁移方法。
蚂蚁百灵发布 Ling-3.0-flash-Sante,一个基于 Ling-3.0-flash 构建、面向健康与医疗领域增强的 MoE 模型,名字取自法语 santé(健康)。
蚂蚁集团正式开源面向真实金融工作流的 Ling-3.0-flash-Fin(124B A5.1B),为 MoE 架构、支持最长约 256K 上下文,并同步开放面向金融搜索 Agent 的评测基准 FinFIRST(Financial Information Retrieval, Sourcing and Traceability),中金公司投行团队在构建过程中提供专业支持。
Anthropic 发布面向电商、旅游、电信和票务平台的商务智能体蓝图,提供可在数天内上线的 harness、模式和护栏,附购物智能体与商家智能体的完整参考实现及 Claude Code 插件。
推荐理由:原文给出完整可部署的购物与商家智能体实现、接入方式和合作生态,工程团队可据此评估落地铁路线。
小红书与NVIDIA联合构建GR-Inference,一个面向长Context、短Decode、大Beam的生成式召回专用推理引擎,覆盖KV抽象、连续批处理、专用Decode Attention、受限生成与CUDA Graph等优化。
百度千帆Token Plan企业版更新,DeepSeek-V4-Pro-0813正式版与GLM-5.3、GLM-5.3-Flash三款模型上线,原有模型ID可直接调用。百度搜索工具正式接入,专属API-KEY即可调用,限时优惠每次2.5积分。Token福利包扩展覆盖语音、OCR、智能文档分析等AI开放能力,席位扩展为四档并有限时赠送积分、夜享Token低至2折等活动。