跳到正文

#多模态

今日 0 条
10月7日周三
10月5日周一
9月29日周二
  1. Microsoft Research 博客(RSS)61

    Microsoft Research 发布 AI 生物研究系统 Quine,并开放 Quine Fellows 项目申请

    Microsoft Research 推出 Quine,一个包含生物学世界模型和交互式 harness 的 AI 研究系统,可跨基因组、蛋白质、化学、细胞状态和生物成像等模态联合学习并推理干预后果。

    推荐理由:原文给出 PDAC 化合物筛选一个周末完成并经湿实验验证的结果,读者可据此评估 AI 驱动生物发现的实际路径。

  2. LlamaIndex:产品、工程与评测49

    LlamaParse 为什么表单解析比 VLM 更可靠?

    LlamaIndex 发文解释表单为何需要专用解析器:VLM 擅长通用推理,但表单解析结果并不会随推理增强而变好,且成本更高。LlamaParse 将表单表示为带 id、label、value 的字段与 section 嵌套 JSON 树,能保留复选框、签名及字段归属关系,避免扁平化后两个 "Date" 字段无法区分。

9月28日周一
  1. MeshyAI24

    2026 年 10 月 10 日,Meshy 与 Chrona 联合在旧金山举办 Tech Week 活动,主题为“用 AI 构建多人 3D 世界”。活动包含实时 3D 世界演示、创作者现场展示(6 位创作者参与并由观众投票)、多场圆桌对话,嘉宾包括 Meta 的 Yiqi Zhao、Roblox 的 Jinnan Chen 等。现场提供 3D 模型代金券、周边等福利,已有超 200 人报名,来自 Google、Meta、Roblox、Epic Games 等公司。

  2. H Company 官方74

    H Company 发布 Holo4 开放权重模型,统一操作界面与工具

    H Company 发布 Holo4 的二百七十亿参数稠密模型和混合专家版本,提供 API、可下载权重与多种量化格式。模型把桌面、网页、安卓操作及代码和工具调用结合在同一智能体中;不同测试平台的分数不能直接横向比较。

    推荐理由:开放权重和量化版本让团队能在自有环境尝试界面操作智能体,并对不同设备和工具组合开展实际任务评测。

9月25日周五
  1. 公众号:千问APP(阿里)35

    千问App上线盒马菜谱与淘宝闪购异地美食Skill

    阿里千问App联合盒马和淘宝闪购,推出“盒马菜谱”和“淘宝闪购异地美食”两大智能体技能。用户可通过文字指令、拍摄冰箱食材或宴席照片获取家宴方案及做法,并一键下单购买食材;旅游时也可查询当地特色美食推荐并直接配送。该功能旨在通过AI辅助解决假期饮食规划与采购问题。

9月24日周四
  1. Liquid AI 模型与工程博客(网页)57

    Liquid AI 发布 LFM2.5-VL-DSpark 视觉语言 drafter 模型,边缘端解码最高提速 3.13 倍

    Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark drafter 模型,参数约 280M,仅增加 8.9% 参数量。GPU 上解码吞吐最高提升 2.66 倍、边缘设备 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍;模型已上架 Hugging Face,支持 llama.cpp、SGLang 和 MLX-VLM。

9月23日周三
9月22日周二
  1. Xiaomi MiMo73

    小米 MiMo 发布 MiMo-V2.6 Pro 与 Flash 两个全模态模型,通过规模化强化学习训练。Pro 在多数 Agent 基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis Intelligence Index 得分 46,为开源模型中最高;能力覆盖编码、computer use、3D 推理和创作。

    推荐理由:官方发布全模态模型并开放权重、技术报告和训练代码,附与 Claude Opus 5、GPT-5.6 Sol 的 Agent 基准对比数据。

9月20日周日
9月19日周六
9月18日周五
  1. Qwen:Blog Retrieval(API)69

    Qwen 发布 Qwen3.8-LiveTranslate 实时同传模型,LAAL 降至 2.3 秒

    Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker–Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。

    推荐理由:官方给出了架构设计、LAAL 从 2.8 秒到 2.3 秒的数字和多语言评测结果,读者可以据此评估其实时翻译能力的实际变化。

  2. Qwen:Blog Retrieval(API)78

    Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付

    Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。

    推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。

9月17日周四
9月16日周三