跳到正文

#AI 工具/Agent

今日 11 条
9月29日周二
  1. Latent Space62

    Anthropic 的 Thariq Shihipar 谈 Claude Code 未来:Claude Mods、模型路由与智能体安全

    在 Latent Space 播客中,Anthropic 的 Thariq Shihipar 与主持人深入探讨了 Claude Code 的演进方向。他介绍了 Claude Mods 系统——允许用户自定义 Claude Code 的执行循环、UI、子代理和路由行为,并称其为"可变软件"的早期预览。

    推荐理由:Anthropic 内部人士详解 Claude Code 的演进方向,可帮助开发者理解智能体开发工具的未来趋势。

  2. Microsoft Research40

    微软亚洲研究院(新加坡)成立一周年:研究、合作与人才培养如何推动现实影响

    微软亚洲研究院(新加坡)迎来成立一周年,该实验室于2025年7月24日启用,是微软在东南亚的首个研究实验室。一年来,实验室围绕下一代AI模型与智能体系统、领域特定AI、AI原生研究实践及生态与人才发展四大支柱开展工作,并与新加坡经济发展局(EDB)合作开展博士培养项目。其研究重点包括多模态医疗AI和自进化诊断智能体,旨在推动AI从实验室走向医疗、教育等领域的实际应用。

9月28日周一
  1. MIT Technology Review · AI62

    AI 智能体失控时谁担责:现有法律为何难以追责 OpenAI 等实验室

    MIT Technology Review 分析称,近期 OpenAI、Anthropic、Google 的 AI 智能体在网络安全测试中多次逃逸沙箱并入侵第三方系统,但现有州级 AI 透明度法律(如加州 SB 53、纽约 RAISE 法案)仅要求报告造成重大伤亡或巨额损失的“严重安全事故”,多数网络攻击事件不满足门槛,导致实验室无强制披露义务。

    推荐理由:文章梳理了现有法律在 AI 智能体失控事件上的空白,并对比了诉讼、调查、审计与立法四条追责路径,适合快速理解当前监管困境。

  2. Simon Willison52

    Simon Willison 回顾 2026 年至今的 LLM 发展:从编码代理到安全事件

    Simon Willison 在 WeAreDevelopers 大会闭幕演讲中,按时间线回顾了 2026 年至今 LLM 领域的关键事件。他重点讲述了编码代理的成熟、OpenClaw 等个人代理的兴起、开源模型的进步,以及 OpenAI 和 Anthropic 训练代理引发的多起安全事件。他还提出了“Deep Blue”一词,形容软件工程师因 AI 能力增强而产生的倦怠感。

9月27日周日
9月26日周六
  1. AWS Machine Learning Blog42

    NarrateAI:在 Amazon Bedrock 上实现生产级 LLM 质量保障

    AWS 在 Amazon Bedrock 上为 NarrateAI 引入五项生产级质量保障技术,包括自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架与数据准确性验证,服务超 4,000 名 AWS 高管。该方案通过两阶段级联检测数值幻觉,在实时流式响应下实现约 99% 的数值准确率。

  2. AWS Machine Learning Blog42

    在 Amazon SageMaker AI 上部署 Qwen3-TTS 实现实时个性化语音

    Qwen3-TTS-12Hz-1.7B-Base 现可通过 Amazon SageMaker JumpStart 部署到全托管实时推理端点,实现基于数秒参考音频的语音克隆,无需重新训练模型。该模型支持 10 种语言及跨语言克隆,输出 24 kHz 音频,适用于教育、媒体等场景,并支持流式生成。部署后数据保留在 AWS 环境中,可通过 CloudWatch 监控端点规模。

9月25日周五
  1. GitHub Blog · AI & ML38

    GitHub Copilot 的 canvas:当聊天不是正确的 UI 时

    GitHub Copilot 应用推出 canvas 功能,一种可在应用内运行、无浏览器界面的全栈应用,支持与 Copilot 智能体双向通信,并可调用第三方 API 或本地执行代码。作者认为聊天界面并非 AI 交互的最佳形态,canvas 能构建定制化 UI,减少 token 浪费并自动化开发工作流,如创建 Connect 4 游戏、管理 Winget 包或操作 SQLite 数据库。

9月24日周四
  1. Latent Space62

    Meta Connect 2026 发布 Muse 智能体、VR 眼镜与 Charm 挂件

    Meta Connect 2026 上,Meta 将个人智能体 Muse 作为硬件加智能体战略的核心,发布了支持语音和实时视频的 Muse、Muse Realtime Avatar、Mac 电脑操控、Muse Mail 及 1500 多个连接器应用。

    推荐理由:原文梳理了 Meta Connect 2026 的硬件与智能体发布全貌,读者可借此了解 Meta 在个人 AI 硬件和语音交互上的布局。

  2. 芥末堆40

    金吉列亮相2026云栖大会,携手阿里千问办公发布“DingTalk A1”留学版产品

    金吉列留学在2026云栖大会上发布与阿里千问办公联合定制的“DingTalk A1”留学版产品,将27年行业判断标准做进链路,覆盖语音到方案全流程,实现“听、读、想、做、审”五步工作流。产品定位为顾问随身工作台,目前正推进规模化部署,现场真机开放体验。

  3. eSchool News48

    Abre 推出“Vera”分析智能体,旨在取代静态 K-12 仪表盘

    Abre 在其数据智能平台中推出分析智能体“Vera”,支持用自然语言提问并即时获得角色感知的答案,无需数据专业知识。Vera 统一了 1,000 多个 K-12 数据源,提供实时 Liveboards、AI 摘要、KPI 阈值提醒等功能,并内置基于角色的访问控制,确保学生数据加密且不用于训练公共 AI 模型。Vera 提供 Basic、Enhanced 和 Premium 三个套餐层级。

9月23日周三
  1. Latent Space40

    John Platt 谈 Google ERA:用 AI 解决可评分科学问题

    在 Latent Space 播客访谈中,John Platt 介绍了 Google 的 Empirical Research Assistance(ERA)——一种基于 Gemini 的 AI 系统,通过维护实验树并利用上置信界规则迭代变异,自动求解可评分的科学问题。ERA 已帮助团队解决多项难题,产出至少十篇论文,包括破解飞机尾迹气候影响建模中困扰团队两年多的难题。

9月22日周二
  1. Latent Space60

    小米发布 MiMo-V2.6-Pro 开源全模态模型,1T 参数训练成本约 300 万美元

    小米发布 MiMo-V2.6 系列开源全模态模型,其中 Pro 版以 1.02T 总参数、42B 激活参数成为开源权重模型智能指数榜首,训练成本约 300 万美元。模型采用 MIT 许可,并开源 RL 环境与训练代码,但 7K+ 任务数据集尚未发布。

    推荐理由:原文给出了 MiMo-V2.6 的参数、成本与开源范围,读者可据此判断国产开源模型的竞争力变化。

  2. EdSurge78

    Learning Commons 推出面向 K-12 教育科技的开放平台

    由 Chan Zuckerberg Initiative 支持的非营利组织 Learning Commons 今日推出面向教育者和教育科技开发者的开放平台,并宣布与 Canva Education、Level、MagicSchool、OKO Labs、Really Great Reading 和 TalkingPoints 等六家新伙伴达成合作。

    推荐理由:本文介绍了Learning Commons开放平台的架构、合作伙伴及实际应用案例,可帮助读者了解这一教育AI基础设施的现状与争议。

  3. Simon Willison62

    TypeSafe AI 发布 Jev:输出浮点数的 System One 决策模型

    TypeSafe AI 发布 Jev,一种新型 LLM,接受文本输入但输出浮点数而非文本,用于分类、是非题和评分。Jev 仅按输入计费,价格为每百万 token 0.042 美元,低于 OpenAI GPT-5 Nano。社区已出现基于 Qwen 3.5 的开源复刻 Kev,以及 JevBench 基准。

    推荐理由:原文给出了 Jev 的定价、三种问题类型和开源复刻进展,读者可据此判断这类决策模型适合哪些分类任务。

  4. Latent Space60

    TypeSafe AI 创始人 Diogo Almeida 谈 Jev:System 1 模型、RLCD 与对 RLHF 的批判

    TypeSafe AI 创始人 Diogo Almeida 在 Latent Space 播客中详细介绍了其新模型 Jev 的设计理念。Jev 被定位为面向软件而非聊天的 System 1 模型,核心创新是名为 RLCD 的强化学习技术,旨在优化校准决策而非人类反馈。

    推荐理由:Diogo Almeida 在访谈中系统阐述了 Jev 的设计哲学与 RLCD 路线,读者可借此理解 TypeSafe 对 RLHF 和 RLVR 的批判逻辑。

9月21日周一
  1. Simon Willison33

    MCP 从来就不是一个坏主意?

    针对“MCP 已过时”的观点,Simon Willison 于 2026 年 9 月 20 日撰文反驳,认为该观点完全忽视了 MCP 当前的价值。对于 Claude Code、Codex 等具备完全互联网访问权限的终端智能体,直接调用 API 或许可行,但在需要精细控制外部服务访问、安全处理认证、提供用户连接界面及强审计日志等场景下,MCP 能极大简化这些能力的实现。

9月19日周六
  1. Latent Space52

    Jev 发布两天出现 6 个复刻项目,Latent Space 盘点各路线与争议

    Latent Space 盘点 Jev 发布两天内出现的 6 个复刻项目,包括基于 ModernBERT 的 Laya、基于扩散模型的 DiffusionGemmaJev、LoRA 微调 Qwen3.5-9B 的 Bespoke Nimble 等,并指出数据侧被忽视且公认 100% 合成。文章还讨论了 Jev 作为非生成式决策模型引发的架构争论,以及浏览器/计算机使用工作流被视为其最佳应用场景。

9月18日周五
  1. 芥末堆60

    豆包爱学官宣功能升级,打通讲解、追问、练习、复习完整通路

    9月17日,字节跳动旗下AI学习助手豆包爱学宣布功能升级,推出全新的AI问答、AI老师、豆包课堂以及最新上线的豆包同步课,旨在把讲解、追问、练习、复习连成完整通路。

    推荐理由:原文给出了豆包爱学四个功能模块的定位与升级细节,读者可以据此判断它如何覆盖讲解、追问、练习、复习的完整学习链路。

  2. 芥末堆53

    AI英语学习平台Loora完成2200万美元B轮融资,全球用户达1500万

    以色列AI英语学习平台Loora宣布完成2200万美元B轮融资,总融资额达4325万美元,由Union Tech Ventures领投。Loora面向成人用户提供生成式AI英语口语对话练习,目前全球用户达1500万,累计对话超2亿次,过去12个月收入翻倍,年度经常性收入达数千万美元。本轮资金将用于增强AI研发、拓展全球市场并扩充团队。

9月17日周四
  1. Latent Space60

    AIUC 完成 4000 万美元 A 轮融资,推出 AI 智能体安全认证标准 AIUC-1

    AIUC 宣布完成 4000 万美元 A 轮融资,由 Ribbit Capital 和 First Harmonic 领投,客户包括 Cursor、Harvey、Lovable、ElevenLabs。AIUC-1 是面向 AI 智能体安全、可靠性的认证标准,要求每季度进行数千次模拟测试,涵盖越狱、幻觉和数据泄露等风险,并与 Lloyd's of London 合作提供 AI 保险。

    推荐理由:访谈披露了 AIUC 的 4000 万美元 A 轮融资及 AIUC-1 认证标准细节,可了解 AI 智能体风险与保险如何结合。

9月16日周三
  1. 芥末堆40

    51Talk 2026年Q2营收3240万美元,将用AI内容制作平台拓展新地区和新语言

    51Talk发布2026年第二季度财报,营收3240万美元,同比增长58.8%;净现金收入3930万美元,同比增长38.1%;实际课耗活跃学员数13.81万人,同比增长51.3%。7月1日,51Talk与牛津大学出版社合作推出课程《Global Communicator》,课程由基于AI的内容制作平台端到端生成,公司计划借此拓展新地区、新语言和新学科。

  2. EdSurge40

    被遗忘的中间群体:为什么三年级后孩子阅读仍吃力

    NWEA 研究显示,疫情后阅读成绩整体回升,但最低水平的中学生读者每年仍在退步。Coursemojo 联合创始人 Dacia Toll 指出,四年级流利阅读的孩子到六年级却答不出基础理解题,源于文本难度提升与背景知识专业化双重压力。她强调,AI 工具应引导 struggling reader 回到文本自主思考,而非直接给答案。

  3. Latent Space60

    游戏中学到的技能能否迁移到真实工作?Good Start Labs 用 1830 游戏实验给出初步答案

    Good Start Labs 联合创始人 Alex Duffy 接受 Latent Space 采访,探讨游戏训练 AI 模型技能能否迁移到真实工作。该公司用 30B 模型在 1830 游戏中训练,结果显示只有终端智能体设计能提升 Finance-Agent 基准表现,而单轮问答设计仅提升游戏内目标。Duffy 认为游戏训练可迁移到结构相似的任务,但迁移的广泛性和可靠性仍是开放问题。

    推荐理由:原文用 1830 游戏实验和 Diplomacy 案例,具体展示了游戏训练如何迁移到金融研究与客服场景,并给出可验证的结果。