跳到正文

#多模态

今日 4 条
9月8日周二
  1. MarkTechPost(RSS)56

    Reducto 发布 r-1 单遍文档解析模型,错误率降 20%、每页 1 美分

    Reducto 发布 r-1,用一次全页解析替代多阶段 agentic OCR 流水线,官方称相较自家旧管线错误率降低 20%,价格从每页 3 至 6 美分降至 1 美分全包。r-1 原生处理表格、阅读顺序、格式和边界框 grounding,需 V3 Parse API 通过 settings.model 开启,暂无开源权重;对标 Amazon Textract 等的评测为厂商自测,未公开数据集。

  2. IT之家(RSS)56

    微信支付智能眼镜 SDK 上线,Rokid 乐奇 AI 眼镜完成首款适配

    微信支付上线智能眼镜 SDK,将扫一扫支付能力封装后向符合标准的智能眼镜厂商开放,Rokid 乐奇 AI 眼镜为首款适配产品。用户需先在厂商 App 开通并验证支付密码,日常付款分唤起、扫码、滑动镜腿确认、语音播报四步,基础版每日限额 200 元,具备虹膜或指纹等身份识别的设备可享更高额度。SDK 目前处于 Beta 阶段,仅支持扫描收款码付款,暂不支持小程序码、加好友等场景。

9月7日周一
  1. IT之家(RSS)54

    消息称字节跳动开发实时空间视频生成 AI 模型,张一鸣亲自督导,最快下月发布

    据彭博社报道,字节跳动正开发实时空间视频生成 AI 模型,创始人张一鸣亲自督导研发,计划最早下月发布,发布时间尚未最终确定。该模型基于电影级视频生成模型 Seedance 构建,面向直播、短剧和游戏创建交互式虚拟世界,可在每秒 20 帧帧率下以约 50 毫秒延迟按需生成视频流,响应 Pico 头显用户的语音或动作。

  2. IT之家(RSS)59

    京东 JoyAI App 推出首个能实时视频购物的 AI 数字人

    京东 JoyAI App 推出可实时视频购物的 AI 数字人,通过“万能博士”在视频通话内实时解析商品画面、调取京东商品并直接下单,全程不切换 App。用户上传一张图片即可自定义数字人形象、人设、音色和交互场景,数字人还支持点外卖、订酒店、健康咨询、金融咨询等服务,支付环节搭载京东 AI 付声纹验证。今年以来 JoyAI App 对话用户数增速超过 15 倍。

  3. IT之家(RSS)65

    阿里千问办公推出业内首个多人工作台,支持百人在线协作

    阿里云 9 月 7 日宣布千问办公推出业内首个多人工作台,用户用自然语言描述需求即可生成并发布最多支持百人同时在线协作的网页。该功能具备角色权限、云端数据库、管理后台和在线发布四项核心能力,适用于活动组织、家校协同和企业协作等场景,可从千问办公首页功能入口直接体验。

  4. HuggingFace Daily Papers(社区热门论文)54

    DF26 基准:现有检测手段已难以分辨 AI 生成视频与真实视频

    DF26 基准针对单人物公开演讲场景评测 AI 生成视频检测,包含 271 个真实视频和由七个现代视频模型生成的 2,420 个合成视频。结果显示人类和最先进的 deepfake 检测器准确率都接近随机水平,暴露出当前评测协议的局限,并提出了对现代生成模型分布偏移保持鲁棒性的基准需求。

9月6日周日
  1. 公众号:卡尔的AI沃茨75

    GPT-6 Astra 实测:改硬件、Blender 3D、自动剪辑与PPT一篇跑完

    作者实测 GPT-6 Astra 的电脑自动化、3D 和剪辑能力。外置键盘快捷键配置 41 秒一次成功,Blender 海盗船不到 10 分钟完成且给出逐部位生成逻辑,还用关键帧做出 3D 镜头移动视频和星球状的马里奥 3D 游戏关卡。真人口播剪辑经三次修改达到可发布标准,附完整剪辑提示词;PPT 二次美化评定为 6 到 7 分;UI 设计对比仍不及 Claude Fable 5.1。

  2. IT之家(RSS)64

    公安部发布“国家反诈 AI”App,微信、支付宝小程序同步开放

    公安部宣布,由公安部刑侦局指导、上海市公安局自主研发的“国家反诈 AI”App 正式上线,微信、支付宝小程序同步开放,用户可在各大手机应用市场下载。该 App 融合大语言、多模态模型和智能体技术,提供 AI 大模型智能问答、反诈资讯和反诈辞典三大功能,可对用户输入的可疑场景完成风险研判、识别诈骗套路并推送典型案例,从文字、语音、视频多个维度拆解诈骗手法并提供防范对策。

  3. Simon Willison 博客61

    Simon Willison 实测 GPT-6 Astra 开发者版本

    Simon Willison 分享对面向开发者的 GPT-6 Astra 的试用印象:Astra 在细节把握、理解用户提示词和构建更复杂输出方面全面提升,尤其擅长 3D 建模,他见过它生成花园、船厂、动物、城市景观甚至戴森球的精美渲染,并成功生成了骑自行车的鹈鹕戴红色领巾的场景。

9月5日周六
  1. IT之家(RSS)64

    解放军总医院第六医学中心完成全球首例 AI 超声机器人引导下先天性心脏病封堵术

    9 月 5 日上午,解放军总医院第六医学中心心血管病医学部完成人工智能超声机器人引导下先天性心脏病介入封堵术,经科技查新为全球首例同类智能技术临床应用。患者为 48 岁男性,确诊房间隔缺损且缺损边缘解剖条件较差。该系统由朱航主任团队与清华科研团队联合研发,通过机械臂自主扫查、AI 自动甄别病灶、构建心脏三维模型并规划手术路径,实现影像识别与手术操作的双向智能协同,提升了手术精准度与安全性。

  2. 公众号:百度智能云(文心)32

    加南科技F2 AR智能眼镜携手百度智能云探索心跳感知

    百度智能云介绍与杭州加南科技的合作:F2 AR智能眼镜不配置摄像头,通过PPG心率、IMU、语音、位置与交互信号为AI提供用户上下文,心率偏离基线时可结合情境生成可确认或忽略的状态提示,并形成Heart Moment心情可视化功能。架构上终端负责感知与AR呈现,云端由百度智能云提供大模型、实时语音、翻译、百度地图与百舸、千帆等能力,形成端云协同的一体化方案。

  3. IT之家(RSS)42

    微软预告 Excel 新增 Copilot Canvas AI 画布,打造可视化交互式数据看板

    据 Windows Latest 报道,微软计划为 Excel 推出 Copilot Canvas 功能,可将工作簿中的图表、关键指标和分析洞察整合为交互式画布,并支持自然语言对话修改内容。画布保持连接原始工作簿,数据变化后自动更新,微软计划未来几周逐步推送并预计 10 月初完成部署。

  4. IT之家(RSS)31

    消息称苹果计划 2027 年推出全新家庭安全监控服务,将 AI 引入家庭安防

    据 MacObserver 报道,苹果计划在 2027 年推出全新家庭安全监控服务,作为拓展智能家居业务的一部分。同时苹果正研发一款注重隐私保护的家庭安防摄像头及自动化设备,利用 AI 分析周围环境而无需传统摄像头持续录制视频。该服务预计成为新的订阅项目,可能与新款 Apple TV 4K、HomePod mini、家庭中枢设备 HomePad 协同,未来也可能纳入 Apple One 套餐。