用 Amazon Quick 与 Adjudicated Query 模式批量完成租赁合规审查
AWS 提出 Adjudicated Query 设计模式,让业务人员通过 Amazon Quick 聊天界面提出合规问题,而通过/不通过的判定由确定性规则引擎完成,模型仅负责翻译问题与叙述结果,不参与最终裁决。
AWS 提出 Adjudicated Query 设计模式,让业务人员通过 Amazon Quick 聊天界面提出合规问题,而通过/不通过的判定由确定性规则引擎完成,模型仅负责翻译问题与叙述结果,不参与最终裁决。
NVIDIA 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等合作伙伴推出 64GB 统一内存版 DGX Spark,起售价 $4,999。
Suno 推出 Speech 功能,可根据脚本或提示描述生成语音,并支持同时生成配音与背景音乐,现已面向网页和移动端开放公测。该功能提供 Simple 和 Advanced 两种模式,可调节音色、语音风格等,最长约八分钟。Suno 表示将根据用户反馈持续改进。
Ramp AI Index显示,美国企业AI支出下降,主要源于OpenAI与Anthropic的竞争导致模型降价。自7月支出见顶以来,AI使用量增长约50%,9月底创下新高。Anthropic占token支出51%,OpenAI占44.5%,开源模型占比不足5%。
openJiuwen 团队发布 X-Router 自演进模型路由技术,通过动态选择模型降低 Agent 调用成本。
推荐理由:原文给出了实测数据与开源入口,读者可以据此判断智能路由对 Agent 成本与质量的实际影响。
Black Forest Labs 发布 Flux 3 模型家族的图像模型 Flux 3 Image,支持多步编辑且不改变图像其他部分,覆盖文生图、图生图、文本渲染和照片级真实感。用户可用边界框构图、最多引用十张参考图,输出最高 4K 分辨率。API 访问在 10 月 8 日前享五折优惠,商业权重可授权企业自建基础设施运行和微调,开源权重版本预计数周内推出。
前 AlphaGo 核心成员、UCL 机器学习教授 Thore Graepel 撰文指出,当前 LLM 的链式思考仍属系统 1 直觉,缺乏显式认知状态与知识操作分离,不构成真正推理。他主张借鉴 AlphaGo 的搜索架构,构建可审计的推理系统,并为此离开 Google DeepMind。
推荐理由:作者以 AlphaGo 核心成员身份对比 AlphaGo 搜索与 LLM 推理,提出可审计的推理架构方向,适合关注 AI 可靠性的读者。
知情人士透露,博通的华尔街银团正开始筹集600亿美元的新一轮AI芯片融资,为Anthropic芯片项目提供资金。
Latent Space 播客专访 MIT 研究者 Alex Zhang,探讨其递归语言模型(RLMs)、GPU 内核编写及大规模多智能体集群研究。
GPT-6 Astra Ultrafast 已上线 OpenAI API,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行于 NVIDIA Blackwell GPU 上。
AWS 在 Amazon Bedrock AgentCore 上提出四智能体模式,将云迁移中基础设施即代码(IaC)开发时间从每应用 3-4 周缩短至分钟级。该模式与 AWS Transform 及 AWS DMS 协同,通过 MCP 工具连接内部系统,覆盖迁移与运维两大流程,适用于 300+ 应用的大型迁移项目。
Google 今日在兼容 Android 设备的 Gemini Live 中推出 Guided Vision,通过共享摄像头让 AI 实时语音描述画面,帮助阅读小字、识别物体与描述环境。该功能面向盲人、低视力用户及特定场景需求者,并可在 Google TalkBack 或 Android 9 及以上设备的辅助功能快捷方式中使用。Google 提醒用户勿将其用于导航、安全出行或障碍物检测。
Google 的轨道计算卫星原型今日搭载 SpaceX 火箭升空,将验证其 TPU 芯片能否在太空运行。Google 发布的白皮书预计,Starship 需在未来十年完成约 1,800 次发射(每年 180 次)才能以低成本将计算送入轨道。测试显示芯片在辐射环境下推理错误率约为百万分之一,但大规模训练仍面临挑战。
OpenAI 面向全球用户推出 ChatGPT 两项购物新功能:虚拟试衣和收藏(Favorites)。虚拟试衣基于新发布的 ChatGPT Images 2.5 模型,用户上传自拍或全身照即可预览服装与配饰上身效果,购物结果中新增“try on”按钮;收藏功能可将商品保存至应用内 Library 供后续查看。此前 OpenAI 曾放弃即时结账功能,而 Google 已于去年推出虚拟试衣。
AWS 机器学习博客发布分步指南,为 Claude Platform on AWS(CPonAWS)配置多环境访问。方案采用专用 AI Services 账户模式,通过跨账户 SigV4 支持 AWS 工作负载、工作区级 API 密钥供开发者本地使用、OIDC 联合认证支持外部环境,实现生产与开发流量隔离并共享单一订阅。
Amazon Bedrock AgentCore 提供构建环境智能体的平台,其 Runtime 支持容器化代理托管、长时运行工作负载和会话隔离。环境智能体监听事件流(如 S3 文件上传)而非等待用户提示,通过单个 ask_human 工具暂停等待人工审批后继续执行。
Amazon Payments 在 Amazon SageMaker AI 上采用多目标上下文多臂老虎机(MAB),为产品获客漏斗各阶段(申请开始、提交、审批)分别运行 LinUCB 模型并线性组合其 UCB 分数,以同时优化整个漏斗。
AWS 博客演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT)的持久化记忆层,部署于 Amazon EKS。
Tavus 推出 Griffin,称其为首个“人类交互模型”(HIM),可实时理解并参与面对面视频对话。Tavus 研究中,48% 的参与者在 1 分钟视频通话后误以为 Griffin 是真人,而此前系统最高仅 2%。
营销公司 Graphite 的一项新研究分析了前沿模型的写作习惯,发现 Claude Opus 5.5 最常使用“dependable”(比人类写作多 23 倍)和“this matters”(多 116 倍),而 OpenAI 的 Astra 则偏爱“another dimension”和“not simply X”等纠正性表述。
推荐理由:Graphite 对前沿模型写作习惯的量化分析,揭示了各模型独特的措辞特征,为识别 AI 生成文本提供了新线索。
何恺明团队提出 NAT-ARC,一套纯视觉的 ARC 抽象推理解题方案。它不依赖 LLM,而是用 ImageNet 上的猫狗花草图像做 MAE 预训练,再迁移到抽象格子推理上。
推荐理由:原文给出了纯视觉方案在 ARC 上的具体成绩与参数量对比,读者可据此判断视觉路线与 LLM 方案的差距正在如何缩小。
Shopify 周四推出新网站搭建工具 Canvas,商家可通过与 AI 智能体 Sidekick 对话来创建商店,AI 修改时实时渲染真实代码,支持测试交互动画并预览不同屏幕尺寸效果。Canvas 初期不支持第三方主题、应用模块、市场、翻译及主题更新,且仅限桌面端,但 Shopify 表示后续将逐步完善。
谷歌发布新一代旗舰模型 Gemini 4 Argon,在 DeepSWE v1.1 上以 77.9% 超越 Claude Opus 5.5 与 GPT-6 Astra,CWE-bench v1 以 68% 并列第一,Vals Index 登顶。
台湾统一企业集团旗下数字平台 uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并辅以提示词级输出优化,使其适配涵盖九类行为与三类主体的零售内容审核策略。
OpenAI 在 DevDay 发布新智能体 Dots,由 GPT-6 Astra 驱动,定位“首席参谋”式专业助手,可构建虚拟世界,但仅限 $20/月 Pro 及以上用户使用。Meta 的 Muse 则免费提供专用虚拟机,向所有 Meta 账户开放。OpenAI 预计到 2030 年支出 $2800 亿,并计划融资 $300 亿,估值 $1.4 万亿,高昂算力成本使其暂难免费。
Airbnb 联合创始人兼 CEO Brian Chesky 表示,聊天机器人不适合电商和旅行浏览,公司未来 3 至 6 个月将探索支持多人同时使用的“多人”AI 界面。他认为 AI 智能体需要运行在真正的 AI 操作系统上,而非 iOS 或 Windows,并计划让 Airbnb 应用最终成为可与其他智能体通过 MCP 互操作的“宏观 Airbnb 智能体”。
由前 Google 和 SpaceX 产品经理 Rama Afullo 创立的 Satlyt 完成 800 万美元种子轮融资,开发让多颗卫星共享大型计算任务的卫星软件。其软件已搭载 Google DeepMind 的 Gemma 模型完成演示,将卫星错误信息传输量削减逾 60%;本周将随 SpaceX 火箭升空,在 TakeMe2Space 卫星上为 NASA 等三家客户执行任务。
OpenAI 披露其阻止了一场针对模型推理的蒸馏攻击,攻击始于 7 月 1 日,7 月 24-25 日达到高峰,涉及超 4000 名用户和 1.5 万个相关账户,OpenAI 于 7 月 28 日全面关闭。
推荐理由:原文披露了针对 OpenAI 与 Anthropic 模型的蒸馏攻击细节,并指出 Azure 等云平台防护滞后,读者可据此评估模型服务生态的安全短板。
Google DeepMind 推出 Gemini 4 Argon,面向编程、企业知识工作与网络防御,在 19 项可信基准测试中 13 项取得 SOTA。其输出上限达 100 万 token,为行业首创,通过新的 Long Decode Continuation API 功能实现。
Google 母公司 Alphabet 推出新 AI 模型 Gemini 4 Argon,主打防御性网络安全任务,能“自主发现、验证并修复关键软件漏洞”。该模型目前仅通过 Google 安全计划 Fairwind Program 向部分网络合作伙伴开放,其员工已在日常工作中使用 Argon 进行调试和代码库迁移。
在 OpenAI DevDay 后的播客中,OpenAI Computer Use 产品工程负责人 Ari Weinstein 表示 Computer Use 已发生 180 度转变,智能体现在能调试和恢复失败,结合截图、可访问性数据、DOM、Playwright 和生成代码可大幅提速,并正迈向超人类水平。
推荐理由:OpenAI 一线负责人详解 Computer Use 与 Decisions API 的进展和设计取舍,可帮助理解智能体技术的最新方向。
Google 发布新一代前沿模型 Gemini 4 Argon,在关键基准测试中击败部分竞争对手,但整体仍未明显领先,Anthropic 的模型仍占据榜首。Argon 是 Gemini 3.1 Pro 之后七个多月来的首个前沿模型,初始定价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 便宜 95%。
Google 今日发布新一代前沿模型 Gemini 4 Argon,据称在真实软件工程、法律与金融等企业知识工作及网络安全防御等复杂工作流中具备“前沿性能”。公司初期仅向“可信网络防御者”开放,并正参与美国政府发布前模型访问的自愿流程。Google 表示将在更广泛推出前加强“关键前沿防护”,包括防范滥用、提示注入攻击及监控对齐问题。
Google 宣布推出 Gemini 4 Argon AI 模型,但该模型目前尚不可用。这一发布意味着 Gemini 3.5 Pro 的迭代计划被搁置。目前尚未公布具体的可用时间与API开放细节。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,支持 500K token 上下文窗口,并提供低、中、高、超高四档可配置推理强度。该模型通过跨区域推理配置提供服务,兼容 Responses、Chat Completions 和 Converse API。据 xAI 称,Grok 4.7 是其最强的编码与知识工作模型,在困难任务上能更持久地工作并更仔细地自我验证输出。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo 嵌入模型,将单次内容发现耗时从平均 250 分钟降至 2 分钟以内。
Google 在 Gemini 聊天中全球推出 Skills,以可自动生成、按“/”调用的详细提示词取代 Gems,并支持文本、PDF、图片作为参考材料。Gems 将于 11 月对个人账户停用,企业与非营利 Workspace 客户延至 2027 年 3 月,教育客户延至 2027 年 6 月,现有 Gems 自动转换。
Google 的 AI 贡献试点计划已吸纳约 100 家出版商,当内容实质性地用于 Gemini 驱动的搜索结果(如 AI Overview)时,网站可获得付款。但据 The Information 报道,中小出版商获得的金额微薄,仅相当于其广告收入的约千分之一,多家大型出版商已拒绝参与,希望迫使 Google 提供更优厚的条件。
CoreWeave 在 Fully Connected 大会上宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网可用,Cognition 成为首个在 Vera Rubin 上运行生产负载的客户,其 SWE-2 推理工作负载的 token 总吞吐量较 GB200 NVL72 提升最高 4.8 倍。
Amazon Bedrock Knowledge Bases 提供全托管 RAG 能力,通过 AgenticRetrieveStream API 支持自然语言查询理赔文档,并返回带引用的答案。方案从 Amazon S3 摄取 PDF、Word 等格式的理赔记录,支持多轮追问、元数据过滤和上下文接地护栏,确保答案有据可查。文中使用合成理赔数据演示,未涉及生产客户部署。