Amazon Quick 与 Bedrock 如何用实时 ACL 重构 RAG 访问控制
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在原有预检索 ACL 过滤之上新增实时 ACL 校验,在查询时直接向权威数据源核实权限。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在原有预检索 ACL 过滤之上新增实时 ACL 校验,在查询时直接向权威数据源核实权限。
Qlik 基于 Amazon Bedrock 构建的 Qlik Answers 自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超过 10 万条异常与离群点,多数启用智能体工具的 Qlik Cloud 账户正在活跃使用。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为数值向量。该模型 7.4 亿参数,在 Massive Text Embedding Benchmark(Code)上得分 78.68,比前代 68.76 提升近 10 分,Google 称其表现超过规模两倍的竞品。
MIT Technology Review 基于 300 位数据与 AI 高管的调查显示,企业平均仅约 34% 的智能体 AI 项目进入生产环境,数据与知识薄弱是主要失败原因。生产领先者(平均 61% 项目走出试点)在语义等知识能力上更强,55% 的受访者将数据碎片化列为扩展智能体知识访问的首要挑战。企业计划优先投资检索技术、AI 评估智能体和知识图谱。
Amazon Bedrock Managed Knowledge Base 现已支持智能体检索,通过 AgenticRetrieveStream API 将多部分问题拆分为子查询并迭代判断证据是否充分,而标准 Retrieve API 仅执行一次混合搜索。langchain-aws 包同时暴露两种检索方式,文章对比了同一多部分问题在两条路径下的表现与成本。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,支持多轮追问、按 claim ID 和 claim type 等元数据过滤检索,并返回带引用的答案。
AWS 发布基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台参考架构,用 AI 智能体从合同 PDF 中提取结构化字段并交叉验证,解决 RAG 无法跨数百份合同做聚合统计的问题。
RenderRank 是一种从压缩视觉文档表示中学习查询相关性打分的重排序器,不再依赖传统文本 token 序列。在 BEIR 的 11 个数据集上,它减少 16.5-35.5% 输入 token,平均 NDCG@10 达 55.96,超过所有参数量低于 4B 的文本基线及部分更大模型。
ColNanoVDR 是首个将无文档查询蒸馏用于多向量视觉文档检索(VDR)的框架,通过基于熵最优传输的 OTW 目标对齐学生与教师的查询 token,无需页面数据。
千问与夸克网盘深度打通,用户可让千问读取网盘资料并重新整理。有博士把 6TB 文献梳理成个人知识库和可视化知识地图,有用户从几千张照片中筛出精华生成全球旅行地图和明信片 PDF,还有人用三步学习法在 48 小时内啃完一门新学科。整理好的资料可一键上传夸克网盘并生成分享链接,用于团队协作。
Databricks 发布 Lakebase Search,为 Lakebase Postgres 带来 lakebase_vector(可扩展近似最近邻搜索)和 lakebase_text(BM25 全文搜索)两个扩展,已在 AWS 和 Azure 正式可用。
Databricks 发布 Genie One 企业推广分步指南,建议从单一团队和一组明确问题起步,先定义语义层再逐步扩大范围。Genie One 让业务用户用自然语言提问并获得带来源引用的答案,配套 Genie Agents、Genie Ontology 和 Unity Catalog 分别负责领域智能体、业务语义图谱与权限治理。
LlamaIndex 发文解释表单为何需要专用解析器:VLM 擅长通用推理,但表单解析结果并不会随推理增强而变好,且成本更高。LlamaParse 将表单表示为带 id、label、value 的字段与 section 嵌套 JSON 树,能保留复选框、签名及字段归属关系,避免扁平化后两个 "Date" 字段无法区分。
AdaTutoRank 是一种集合级重排序器,采用自适应辅导优化(ATO)训练,在九项评分维度、三级层次结构下为冷启动提供银标签、为强化学习提供奖励、为蒸馏提供提示。
Gleb Otochkin 在 AlloyDB Omni 上用 3 万行商品数据和 vector(768) 嵌入,实测语义搜索、过滤查询和多表 join 三类场景下向量与业务数据同表存储与独立嵌入表加主键 join 的性能差异。
OpenRouter 于 2026 年 9 月 11 日核实嵌入模型目录共 37 个条目,并通过自家 embeddings API 向 19 个模型发送批量请求、共 28 项检查,确认请求与响应行为。
推荐理由:作者用自家 API 实测 19 个模型并按用例给出候选、价格与维度,读者可按输入类型和存储约束直接对照选型。
百度智能云联合中国电子技术标准化研究院牵头制定的四项人工智能国家标准正式发布,自2026年8月27日起实施,由全国信息技术标准化技术委员会(TC28)归口管理。
OpenAI 发布 Astra for Law,将 GPT-6 Astra 配合法律搜索索引和 Legal 分析写作指令,面向律所和法律科技公司。在 Vals AI Legal Research Bench 私有验证集 200 道美国法律研究题上,最高推理强度下整体正确率 54.0%,比仅用网页搜索的 GPT-6 Astra 的 38.7% 相对提升 40%。
LangChain 发布开源智能体助手 Deep Life Sci,面向临床和实验室科学家。它接入 600K+ ClinicalTrials.gov 研究、2900 万 PubMed 摘要和 1200 万 PubMed Central 全文,并用沙盒子智能体进行真实数据分析。
LlamaIndex 发文分析 OCR 文档处理中准确率与自动化率的关系,指出路由门控而非读取能力决定直通处理率。文中算例显示 20 个字段的发票在 97% 每字段准确率下仅约 54% 文档全对,94% 准确率但带每字段置信度的 Pipeline B 可自动放行 92% 文档,而 97% 准确但无信号的 Pipeline A 直通率为 0。
Google 的 Gleb Otochkin 在 AlloyDB Omni 上实测嵌入向量版本更新对 PostgreSQL 存储的影响:在含 768 维向量和 HNSW 索引的 20k 行表上更新全部向量后,表、TOAST 和索引体积几乎翻倍(TOAST 从 81 MB 到 159 MB,HNSW 索引从 78 MB 到 156 MB),约一半空间被死元组占据。
Redis 发布全托管语义缓存服务 LangCache,现已在 Redis Cloud 以公开预览形式提供,通过 REST API 及 Python、JavaScript SDK 接入。
LlamaIndex 博客提出 just-in-time Agentic OCR 模式:先用 LiteParse 等免费解析器粗读全部文件供检索,再仅对相关页面调用 VLM 做 OCR。
推荐理由:作者用 84 份 SEC 文件实测两遍式文档处理流程,给出明确的适用边界和成本数字,方法可直接迁移到自己的数据室场景。
arXiv 论文(https://arxiv.org/abs/2505.12540)提出 vec2vec,这是首个无需配对数据、编码器或预定义匹配集就能在不同模型嵌入空间之间翻译文本嵌入的方法,基于柏拉图表示假说的强版本,用对抗损失与循环一致性学习共享潜在空间。
论文提出 PACE 数据集,评估模型能否识别由自我中心知识库事实构成的隐性约束,使看似合理的用户请求变得不恰当,并提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤协调检索决定性证据。实验同时评估证据检索质量与冲突判断准确率,PaceMaker 一致优于现有方法。
论文提出 CORE,通过合成五个组合匹配级别的候选列表和 Rank-KL 目标,把多模态模型作为重排器时的组合判断蒸馏进嵌入模型。
H Company 团队发布 NeoMME,含 260M 和 800M 两个尺寸的多语言多模态编码器,用单个双向 Transformer 从零处理文本 token 和 32×32 图像 patch,不使用预训练视觉塔或因果语言模型,训练采用掩码离散扩散目标,每个模型处理约 5240 亿 packed token。
论文提出 ContextPilot,让智能体主动规划、存储、压缩或删除旧上下文,并通过 RL 学习哪些上下文决策真正有效。
Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。
ByteByteGo 发文解析 RAG 系统中嵌入模型的关键作用,指出语言模型再强也无法弥补错误检索,因为嵌入模型决定了哪些文本进入上下文。文章图解了索引与检索两个阶段的工作流程,列举了语义相似但答非所问的多种失败模式,包括否定句、版本差异和数字标识等,并说明更换嵌入模型需要全量重建向量、索引和权限,成本高昂,类似蓝绿部署。
论文提出 EM^2Mem,一个事件中心的多模态记忆框架,在记忆构建阶段将异构证据绑定到事件锚点,每个事件索引的记忆单元对齐多模态记录、时间上下文、图关联关系、语义事实和来源信息。
LatentPress 将对话历史和长文档压缩为连续记忆 token,由冻结解码器通过输入嵌入接口直接读取,推理时无需重建文本。