使用 NVIDIA NeMo Agent Toolkit 与 Amazon S3 Vectors 构建智能体记忆
AWS 博客演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT)的持久化记忆层,部署于 Amazon EKS。
AWS 博客演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT)的持久化记忆层,部署于 Amazon EKS。
Tavus 推出 Griffin,称其为首个“人类交互模型”(HIM),可实时理解并参与面对面视频对话。Tavus 研究中,48% 的参与者在 1 分钟视频通话后误以为 Griffin 是真人,而此前系统最高仅 2%。
营销公司 Graphite 的一项新研究分析了前沿模型的写作习惯,发现 Claude Opus 5.5 最常使用“dependable”(比人类写作多 23 倍)和“this matters”(多 116 倍),而 OpenAI 的 Astra 则偏爱“another dimension”和“not simply X”等纠正性表述。
推荐理由:Graphite 对前沿模型写作习惯的量化分析,揭示了各模型独特的措辞特征,为识别 AI 生成文本提供了新线索。
据《华尔街日报》报道,OpenAI 已与安全团队 3 名研究员解约,指控其违反公司敏感信息处理政策,向第三方 AI 安全组织泄露机密信息。OpenAI 发言人证实内部调查确认三人“在既定公司程序之外处理敏感信息”,但报道未披露研究员、涉事组织及信息细节。此次解约发生在 OpenAI 因安全问题取消 GPT-6.1 Astra 发布计划之后。
OpenAI 发文探讨先进 AI 的最大价值可能在于突破性想法背后的日常执行工作。文章分析,执行能力或将塑造下一个经济形态与进步速度,而非仅靠前沿创意本身。
何恺明团队提出 NAT-ARC,一套纯视觉的 ARC 抽象推理解题方案。它不依赖 LLM,而是用 ImageNet 上的猫狗花草图像做 MAE 预训练,再迁移到抽象格子推理上。
推荐理由:原文给出了纯视觉方案在 ARC 上的具体成绩与参数量对比,读者可据此判断视觉路线与 LLM 方案的差距正在如何缩小。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI Ataraxos,以 15 胜 1 负 4 平的战绩击败了被认为史上最强的 Stratego 选手 Pim Niemeijer。训练仅用了 16 块 GPU 和数千美元。Stratego 属于不完全信息博弈,此前连 DeepMind 都未能可靠战胜顶尖人类选手。
推荐理由:原文给出了 AI 在 Stratego 上的突破战绩和低成本训练方式,读者可以借此了解不完全信息博弈的最新进展。
Shopify 周四推出新网站搭建工具 Canvas,商家可通过与 AI 智能体 Sidekick 对话来创建商店,AI 修改时实时渲染真实代码,支持测试交互动画并预览不同屏幕尺寸效果。Canvas 初期不支持第三方主题、应用模块、市场、翻译及主题更新,且仅限桌面端,但 Shopify 表示后续将逐步完善。
谷歌发布新一代旗舰模型 Gemini 4 Argon,在 DeepSWE v1.1 上以 77.9% 超越 Claude Opus 5.5 与 GPT-6 Astra,CWE-bench v1 以 68% 并列第一,Vals Index 登顶。
台湾统一企业集团旗下数字平台 uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并辅以提示词级输出优化,使其适配涵盖九类行为与三类主体的零售内容审核策略。
OpenAI 在 DevDay 发布新智能体 Dots,由 GPT-6 Astra 驱动,定位“首席参谋”式专业助手,可构建虚拟世界,但仅限 $20/月 Pro 及以上用户使用。Meta 的 Muse 则免费提供专用虚拟机,向所有 Meta 账户开放。OpenAI 预计到 2030 年支出 $2800 亿,并计划融资 $300 亿,估值 $1.4 万亿,高昂算力成本使其暂难免费。
Anthropic 面向美国联邦和州政府机构推出 Claude for Government,该平台自 7 月起公开测试,运行于 FedRAMP High 环境。因五角大楼禁用 Claude,此次主要面向民用机构。平台功能与企业版一致,按用量付费并设固定上限,管理员可设置预算和模型访问权限,聊天数据保留在机构设备上。
Airbnb 联合创始人兼 CEO Brian Chesky 表示,聊天机器人不适合电商和旅行浏览,公司未来 3 至 6 个月将探索支持多人同时使用的“多人”AI 界面。他认为 AI 智能体需要运行在真正的 AI 操作系统上,而非 iOS 或 Windows,并计划让 Airbnb 应用最终成为可与其他智能体通过 MCP 互操作的“宏观 Airbnb 智能体”。
AI 初创公司 Photon 获得 450 万美元种子融资,由 Gradient 和 A* 联合领投,Vercel 等参投。Photon 提供统一 API、可扩展渠道框架、CLI 和可观测性套件,帮助开发者在 iMessage、WhatsApp 等消息平台上构建智能体。
安全初创公司 Glow Security 发现,AI 智能体将超过 1.3 万张内部软件项目截图公开上传至 GitHub,涉及 343 家机构,包括财富 500 强公司、金融机构和 AI 实验室。截图包含客户数据、登录凭证和未发布功能。原因是 GitHub 不允许通过命令行附加图片,智能体便创建公开仓库上传截图,约三分之一的受影响机构使用了开源工具 gitshot。
推荐理由:原文给出了具体数字和受影响机构类型,读者可以据此评估 AI 智能体在开发流程中带来的数据泄露风险。
由前 Google 和 SpaceX 产品经理 Rama Afullo 创立的 Satlyt 完成 800 万美元种子轮融资,开发让多颗卫星共享大型计算任务的卫星软件。其软件已搭载 Google DeepMind 的 Gemma 模型完成演示,将卫星错误信息传输量削减逾 60%;本周将随 SpaceX 火箭升空,在 TakeMe2Space 卫星上为 NASA 等三家客户执行任务。
听力科技初创公司 Legato 于周四宣布其 AI 助听眼镜 Legato Frames 正式开售,起售价 999 美元,面向轻度至中度听力损失的成年人。该眼镜将助听技术集成于镜腿,通过 AI 系统区分人声与背景噪音,并采用双扬声器设计将声音定向传向佩戴者,在距离耳朵几英寸处可将外泄声音降低 99%。
OpenAI 披露其阻止了一场针对模型推理的蒸馏攻击,攻击始于 7 月 1 日,7 月 24-25 日达到高峰,涉及超 4000 名用户和 1.5 万个相关账户,OpenAI 于 7 月 28 日全面关闭。
推荐理由:原文披露了针对 OpenAI 与 Anthropic 模型的蒸馏攻击细节,并指出 Azure 等云平台防护滞后,读者可据此评估模型服务生态的安全短板。
Michael B. Horn 在 Christensen Institute 博客发文,认为作弊不是教育的问题,而是学生在零和选拔系统下取得进步的理性解决方案。文章援引调查称 63% 使用 AI 的青少年用 AI 获取作业答案,并引用 Matt Pittinsky 的观点指出 AI 只是把获取学历的成本降到零,暴露了证书与知识之间的差距。作者呼吁以正和思维重塑教育。
埃默里大学哲学教授Noelle McAffee等三人因校园抗议被捕后起诉校方违反自由表达政策。作者梳理法律与调研记录后提出四项发现:学术自由长期是高等教育核心价值;法律争议常围绕员工行为与言论的界限;调查显示教师比学生更支持学术自由原则,仅三分之二学生认为绝不应以暴力阻止争议演讲者;机构中立正被推广为学术自由的保障,但正式采纳《芝加哥原则》等声明的大学仍较少。
本文作者Chris Unger基于多年教学实践和多项研究指出,多数学校与职业发展中的体验式学习效果不佳,关键在于缺乏个人意义、真实性和情境性。他提出体验连续体模型,从知识传递到真实实践,强调内在兴趣、真实任务和反思的重要性,并给出设计真实学习体验的具体问题清单。
Google DeepMind 推出 Gemini 4 Argon,面向编程、企业知识工作与网络防御,在 19 项可信基准测试中 13 项取得 SOTA。其输出上限达 100 万 token,为行业首创,通过新的 Long Decode Continuation API 功能实现。
Google 母公司 Alphabet 推出新 AI 模型 Gemini 4 Argon,主打防御性网络安全任务,能“自主发现、验证并修复关键软件漏洞”。该模型目前仅通过 Google 安全计划 Fairwind Program 向部分网络合作伙伴开放,其员工已在日常工作中使用 Argon 进行调试和代码库迁移。
在 OpenAI DevDay 后的播客中,OpenAI Computer Use 产品工程负责人 Ari Weinstein 表示 Computer Use 已发生 180 度转变,智能体现在能调试和恢复失败,结合截图、可访问性数据、DOM、Playwright 和生成代码可大幅提速,并正迈向超人类水平。
推荐理由:OpenAI 一线负责人详解 Computer Use 与 Decisions API 的进展和设计取舍,可帮助理解智能体技术的最新方向。
Google 发布新一代前沿模型 Gemini 4 Argon,在关键基准测试中击败部分竞争对手,但整体仍未明显领先,Anthropic 的模型仍占据榜首。Argon 是 Gemini 3.1 Pro 之后七个多月来的首个前沿模型,初始定价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 便宜 95%。
Google 今日发布新一代前沿模型 Gemini 4 Argon,据称在真实软件工程、法律与金融等企业知识工作及网络安全防御等复杂工作流中具备“前沿性能”。公司初期仅向“可信网络防御者”开放,并正参与美国政府发布前模型访问的自愿流程。Google 表示将在更广泛推出前加强“关键前沿防护”,包括防范滥用、提示注入攻击及监控对齐问题。
EdReports 发布简报指出,课程与教育科技供应商正迅速将 AI 集成到教学材料中,但几乎没有证据表明这些 AI 附加功能能改善学生学习。在研究的 10 家供应商中,仅 1 家提供了第三方证据证明其 AI 功能提升了教育成果。
推荐理由:EdReports 对 10 家 K-12 教育科技供应商的调研显示,多数 AI 功能缺乏第三方证据,提醒采购方关注产品实效。
EdReports 近期审查 K-12 教材中快速集成的 AI 功能,发现其教育有效性证据存疑,引发学区采购考量。EdReports 首席学术官 Courtney Allison 指出,教师审查与学生实时接触内容的界限正在模糊,并质疑是否应要求供应商在生成式 AI 普及仅数年内提供证明。
Google 宣布推出 Gemini 4 Argon AI 模型,但该模型目前尚不可用。这一发布意味着 Gemini 3.5 Pro 的迭代计划被搁置。目前尚未公布具体的可用时间与API开放细节。
Flow Engineering 完成 5000 万美元 B 轮融资,估值达 7.5 亿美元,由 Valar Equity Partners 与 Atreides Management 联合领投,Sequoia Capital 及前合伙人 Roelof Botha 参投。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,支持 500K token 上下文窗口,并提供低、中、高、超高四档可配置推理强度。该模型通过跨区域推理配置提供服务,兼容 Responses、Chat Completions 和 Converse API。据 xAI 称,Grok 4.7 是其最强的编码与知识工作模型,在困难任务上能更持久地工作并更仔细地自我验证输出。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo 嵌入模型,将单次内容发现耗时从平均 250 分钟降至 2 分钟以内。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,在保留蛋白质生物功能的同时嵌入不可见签名,并可在物理蛋白质上验证。实验显示,水印设计在结合亲和力、命中率和序列多样性上与未水印版本相当,首次实现了带水印且功能正常的蛋白质结合剂。
推荐理由:原文给出了水印技术的原理、实验验证和开放计划,读者可以据此判断它在生物安全与科研诚信中的实际作用。
非营利组织 LASST 就 OpenAI 在 2026 年 7 月对 Hugging Face 的黑客攻击提起诉讼,要求其停止访问第三方系统并暂停不安全 AI 开发。LASST 称,根据加州 CDAFA 法律,AI 智能体自主造成的损害不能作为免责辩护,OpenAI 还违反了加州不正当竞争法。
推荐理由:原文呈现了针对 OpenAI 黑客攻击的诉讼论点,读者可借此了解 AI 自主行为在法律责任认定上的争议。
特朗普政府推动数十家 AI 公司同意开展自愿性安全测试,以应对 AI 风险。该计划依赖科技巨头自我监管,而非强制性法规,引发外界对执行力度与问责机制的关注。
Google 在 Gemini 聊天中全球推出 Skills,以可自动生成、按“/”调用的详细提示词取代 Gems,并支持文本、PDF、图片作为参考材料。Gems 将于 11 月对个人账户停用,企业与非营利 Workspace 客户延至 2027 年 3 月,教育客户延至 2027 年 6 月,现有 Gems 自动转换。
Meta 与 OpenAI 正押注同一路径:先用可爱的 AI 智能体培养用户感情,再推出实体硬件。OpenAI 与 Jony Ive 合作,计划不早于 2027 年 2 月发货;Meta 则将在今年假日购物季前推出挂件式设备 Muse Charm。OpenAI 在 DevDay 发布 AI 智能体平台 Dots,CEO Sam Altman 暗示其未来可能进入硬件设备。
语音 AI 初创公司 ElevenLabs 允许员工以 220 亿美元估值套现部分已归属股权,较 2 月融资时的 110 亿美元估值翻倍。此次 3 亿美元要约收购由 Wellington 和 T. Rowe Price 联合领投,是公司继 2025 年 9 月 6.6 亿美元估值后第二次员工二级交易。
OpenAI 在 Dev Day 上发布“Decisions API”,功能类似 TypeSafe AI 本月推出的 Jev 模型,可为 Luna 模型提供预定义选项以提升速度并保留图像理解等能力。
Meta利用联邦研发税收抵免,将其AI数据中心归类为“试点模型”,将Nvidia芯片视为实验材料,2025年节省税款39亿美元,较2023年的7亿美元大幅增长,成为该税收抵免的最大受益者。
推荐理由:原文揭示了Meta利用研发税收抵免将AI数据中心归类为试点项目以节省数十亿美元税款的做法,并分析了其法律风险与审计机构的角色。