跳到正文

#大模型

今日 12 条
今天10月6日周二
  1. AWS Machine Learning Blog40

    GLM 5.3 登陆 Amazon Bedrock

    GLM 5.3 已上线 Amazon Bedrock,该模型为 Z.ai(智谱 AI)推出的 753B 参数混合专家模型,针对编码与长时智能体任务优化,并展现出突出网络安全能力。用户可通过完全托管的 API 调用,支持跨区域推理、提示词缓存与服务层级,无需管理基础设施。Z.ai 称其在 CyberGym 基准上取得 84.5 分,编码能力较 GLM 5.2 提升 50%。

  2. The Decoder62

    OpenAI 将在欧盟为 ChatGPT 文本加水印,API 用户全球可选关闭

    OpenAI 为满足欧盟 AI 法案要求,将在未来几周内为欧盟地区的 ChatGPT 和 Codex 用户启用 textGrain 隐形水印,API 用户全球可选开启,云合作伙伴如 Microsoft Azure 也将支持。内部测试显示,400 token 心理学文本检测率约 95%,数学内容显著降低,替换 25% 词汇后检测率降至 17%。检测器初期仅限受邀研究者和机构使用。

    推荐理由:原文给出了水印技术的检测率数据和编辑规避弱点,读者可以据此评估欧盟合规方案的实际效果与局限。

  3. MIT Technology Review · AI38

    连接 AI 智能体与企业知识:MIT Technology Review 报告解读

    MIT Technology Review 基于 300 位数据、AI 等技术高管的调查,发布报告探讨企业 AI 智能体的知识短板。调查显示,平均仅 34% 的智能体项目进入生产,数据碎片化(55% 提及)是扩大知识访问的首要挑战。报告建议通过知识层、检索技术(如 RAG)和知识图谱强化数据与智能体的连接。

10月5日周一
  1. TechCrunch · AI40

    OpenAI 在图像生成结果旁推出视觉展示广告

    OpenAI 为 ChatGPT 新增视觉展示广告,将出现在用户请求生成的图像旁,本月下旬率先在美国上线,初期仅面向一组测试广告商。广告会明确标注且不影响回答内容。OpenAI 同时扩展测量工具与合作伙伴生态,并正与 DoubleVerify、Integral Ad Science 合作开发品牌适配性评估试点,以推动广告业务支撑免费及低价订阅用户。

  2. The Verge · AI38

    OpenAI 在 ChatGPT 中增加更多广告

    OpenAI 将于本月晚些时候在美国测试新的视觉广告格式,在用户用 ChatGPT 生成图片时展示赞助产品和服务图像。广告将独立于生成的图片,且不会影响 ChatGPT 提供的答案;ChatGPT Plus、Pro 或 Enterprise 订阅用户不会看到广告。OpenAI 已设置护栏,避免在“情绪脆弱、敏感或不合适”的对话语境中展示广告。

  3. 芥末堆31

    与爱为舞AI技术助力《典籍里的中国》焕新呈现:让千年典籍“活”在舞台上

    10月4日,中央广播电视总台《典籍里的中国》焕新季开播,AI原生科技企业与爱为舞提供全链路AI技术支持,首次将AI深度融入舞台呈现。首期节目聚焦《资治通鉴》,运用AI技术还原“水淹晋阳”场景,通过文生图、图生视频等多模态技术及爱学大模型,形成“识读—复原—沉浸”的数字古籍技术栈。此前该技术曾亮相《2025开学第一课》及2026世界人工智能大会。

  4. 量子位40

    OpenAI Codex 负责人承诺未来 28 天每天二选一:交付明显改进或重置额度

    OpenAI Codex 负责人 Tibo 承诺,未来 28 天每天要么交付一项对大多数 Codex/Work 用户明显有用的改进,要么进行一次完整额度重置。此前他公开征集用户反馈,将工作锁定在简化产品、提高效率、突破性功能和新模型四个方向。用户对频繁重置、DevDay 更新过多及模型断连问题仍有不满。

10月4日周日
  1. The Decoder48

    Google 研究人员找到防止自我改进 AI 智能体记住测试任务的方法

    Google 研究人员提出 RRSI(正则化递归自我改进智能体框架),通过限制编辑预算和严格审查机制,防止 AI 智能体在自我优化过程中记忆测试任务。在 8 个基准测试中,RRSI 在未见过的任务上最高提升 4.7 分,运行时 token 消耗减少约 30%,且性能从未低于基线。相关代码已在 GitHub 开源。

10月3日周六
  1. The Decoder38

    Claude Code 推出 Mods 系统,开发者可从内部改写 AI 编程工具

    Anthropic 为 Claude Code 推出 Mods 系统,这是一种运行在工具内部的中间件,开发者可通过 JavaScript 或 TypeScript 函数挂钩事件,添加自定义面板、拦截工具调用或创建新命令。Mods 以用户权限运行且不设沙箱,官方提醒仅从可信来源安装;首个官方插件“You Should Know”可监控输出并提醒遗漏信息。

  2. 量子位44

    OpenAI安全团队持续地震:安全透明度负责人David Robinson离职,三名安全员工因泄密被开除

    OpenAI安全团队再遭重创:Safety Systems团队“安全透明度”职能负责人David Robinson离职,继任者未公布。此前OpenAI已开除Jasmine Wang、Tomek Korbak和Mikita Balesni三名安全与模型对齐研究员,理由是内部调查发现其将敏感信息(含基础设施架构内容)分享给外部AI安全机构。

  3. 36氪23

    谷歌搭载AI芯片测试卫星发射升空

    谷歌一颗搭载张量处理单元(TPU)芯片的原型卫星发射升空,以测试该芯片在太空环境中的运行性能,研究未来能否在太空部署人工智能(AI)基础设施。谷歌表示已与卫星建立通信,卫星目前运行正常。此次发射是一项长期研究的一部分,旨在探索未来能否在太空部署可扩展的机器学习基础设施。

  4. 量子位62

    Jev 估值 100 亿美元,创始人 Diogo Almeida 谈可靠性、benchmark 与预训练路线

    TypeSafe AI 联合创始人兼 CEO Diogo Almeida 在 Latent Space 访谈中表示,公开 benchmark 容易被操纵,更应重视产品体验与可靠性。他称 Jev 日处理量已突破一万亿 token,并强调可靠性是产品灵魂,目标是在五年内拉动 TFP 增长 3%。他还表示,即使有十亿美元也不会从零预训练大模型。

    推荐理由:访谈呈现了 Jev 创始人对可靠性、benchmark 和预训练路线的反主流判断,可帮助读者理解决策型模型的定位与行业分歧。

  5. MIT Technology Review · AI29

    自主 AI 如何重塑企业智能

    全球 AI 投资预计 2026 年达 2.5 万亿美元,同比增长 44%,但多数企业仍未通过 AI 实现营收增长。报告提出“智能体转型”需重构数据基础设施与可组合架构,并解决 AI 主权问题。领先企业将流程再造置于模型选择之前,数据就绪度而非数据量决定 AI 的复利效应。

  6. OpenAI News18

    GPT-6 家族模型选用指南

    OpenAI 发布 GPT-6 家族模型选用指南,面向初创企业讲解如何按需选择 GPT-6 系列模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备 AI 工作流。指南覆盖从模型选型到部署落地的完整路径,帮助开发团队在真实业务场景中更高效地使用 GPT-6。

  7. AWS Machine Learning Blog38

    在 Amazon SageMaker AI 上用多轮强化学习微调搜索智能体

    Amazon SageMaker AI 推出多轮强化学习(MTRL)能力,用于微调搜索智能体。该方法以 Qwen3.6-27B 为基座模型,通过 BM25 与向量搜索两种工具,在 FRAMES、BRIGHT 和 Enterprise RAG 数据集上训练,支持 PPO、CISPO 等算法及无服务器按 token 计费,旨在以小型模型的成本获得接近前沿模型的检索可靠性。

10月2日周五
  1. The Verge · AI40

    AI 音乐工具 Suno 新增语音生成功能

    Suno 推出 Speech 功能,可根据脚本或提示描述生成语音,并支持同时生成配音与背景音乐,现已面向网页和移动端开放公测。该功能提供 Simple 和 Advanced 两种模式,可调节音色、语音风格等,最长约八分钟。Suno 表示将根据用户反馈持续改进。