昆尼皮亚克大学民调:多数美国人希望放缓或暂停 AI 发展
昆尼皮亚克大学民调显示,47% 的美国人希望放缓 AI 发展速度,30% 主张在安全得到验证前完全停止,仅 5% 支持加速。86% 支持正在讨论的独立安全标准,73% 担忧 AI 最终威胁人类生存,74% 对 AI 公司领导者缺乏信任。民调于 9 月 24 日至 27 日调查 1202 名美国成年人,误差为正负 3.5 个百分点。
昆尼皮亚克大学民调显示,47% 的美国人希望放缓 AI 发展速度,30% 主张在安全得到验证前完全停止,仅 5% 支持加速。86% 支持正在讨论的独立安全标准,73% 担忧 AI 最终威胁人类生存,74% 对 AI 公司领导者缺乏信任。民调于 9 月 24 日至 27 日调查 1202 名美国成年人,误差为正负 3.5 个百分点。
MIT Technology Review 基于 300 位数据、AI 等技术高管的调查,发布报告探讨企业 AI 智能体的知识短板。调查显示,平均仅 34% 的智能体项目进入生产,数据碎片化(55% 提及)是扩大知识访问的首要挑战。报告建议通过知识层、检索技术(如 RAG)和知识图谱强化数据与智能体的连接。
Google 研究人员提出 RRSI(正则化递归自我改进智能体框架),通过限制编辑预算和严格审查机制,防止 AI 智能体在自我优化过程中记忆测试任务。在 8 个基准测试中,RRSI 在未见过的任务上最高提升 4.7 分,运行时 token 消耗减少约 30%,且性能从未低于基线。相关代码已在 GitHub 开源。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片迭代生成 Blender 程序来重建 3D 场景,并发布 LEGO-Bench 基准(含 208 张图像、104 个场景、443 个资产)进行自动评分。
Mercor 研究显示,AI 模型在结构化记账任务上比持证会计师更快、更准、更便宜。12 名平均经验 5.5 年的注册会计师在 APEX Accounting Benchmark 简化任务中,AI 模型几乎满分完成,而 18 个月前最佳模型得分仍低于会计师平均约 37%。
Ramp AI Index显示,美国企业AI支出下降,主要源于OpenAI与Anthropic的竞争导致模型降价。自7月支出见顶以来,AI使用量增长约50%,9月底创下新高。Anthropic占token支出51%,OpenAI占44.5%,开源模型占比不足5%。
arXiv 自 2026 年 10 月 1 日起实施新规,每位提交者每月最多提交 2 篇论文,且无论是否通过审核均占用额度,所有分类共享此限制。arXiv 表示此举旨在应对 AI 工具导致论文数量激增、审核压力过大的问题,并计划未来升级审核工具与流程。
推荐理由:arXiv 新规直接改变论文投稿节奏,读者可借此判断 AI 时代科研产出与审核的平衡走向。
丘成桐参与的最新论文在致谢中感谢了 GPT 6 Astra 和 Claude Pro 在部分证明策略探索和计算中的帮助。该论文宣称解决了七维空间中 27 种怪球能否配备正截面曲率度量的经典猜想,该问题自 1982 年被丘成桐列入问题清单以来悬而未决。论文附带 SageMath 验证代码,计算机验证成为证明可信度的重要支撑。
推荐理由:丘成桐从质疑到使用 AI 辅助证明的转变,为理解 AI 在尖端数学研究中的角色提供了真实案例。
营销公司 Graphite 的一项新研究分析了前沿模型的写作习惯,发现 Claude Opus 5.5 最常使用“dependable”(比人类写作多 23 倍)和“this matters”(多 116 倍),而 OpenAI 的 Astra 则偏爱“another dimension”和“not simply X”等纠正性表述。
推荐理由:Graphite 对前沿模型写作习惯的量化分析,揭示了各模型独特的措辞特征,为识别 AI 生成文本提供了新线索。
何恺明团队提出 NAT-ARC,一套纯视觉的 ARC 抽象推理解题方案。它不依赖 LLM,而是用 ImageNet 上的猫狗花草图像做 MAE 预训练,再迁移到抽象格子推理上。
推荐理由:原文给出了纯视觉方案在 ARC 上的具体成绩与参数量对比,读者可据此判断视觉路线与 LLM 方案的差距正在如何缩小。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI Ataraxos,以 15 胜 1 负 4 平的战绩击败了被认为史上最强的 Stratego 选手 Pim Niemeijer。训练仅用了 16 块 GPU 和数千美元。Stratego 属于不完全信息博弈,此前连 DeepMind 都未能可靠战胜顶尖人类选手。
推荐理由:原文给出了 AI 在 Stratego 上的突破战绩和低成本训练方式,读者可以借此了解不完全信息博弈的最新进展。
安全初创公司 Glow Security 发现,AI 智能体将超过 1.3 万张内部软件项目截图公开上传至 GitHub,涉及 343 家机构,包括财富 500 强公司、金融机构和 AI 实验室。截图包含客户数据、登录凭证和未发布功能。原因是 GitHub 不允许通过命令行附加图片,智能体便创建公开仓库上传截图,约三分之一的受影响机构使用了开源工具 gitshot。
推荐理由:原文给出了具体数字和受影响机构类型,读者可以据此评估 AI 智能体在开发流程中带来的数据泄露风险。
OpenAI 发布 MentalHealthBench,一个由专家参与设计的评测基准,用于评估 AI 在真实心理健康对话中的有用性与安全性。该基准覆盖多种现实场景,旨在推动 AI 在心理健康领域的负责任应用。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中,于 Qwen3-VL 基准上吞吐量最高比 GB300 NVL72 提升 3.7 倍,在 DeepSeek-R1 上提升 2.5 倍。GB300 NVL72 在 288 GPU 扩展测试中实现 99% 扩展效率;软件优化较 v6.0 带来最高 1.6 倍性能提升。
OpenAI 最新经济研究揭示,工人正将 AI 用于传统岗位职责之外的新场景,部分新活动逐渐成为日常工作的固定环节。研究基于实际使用数据,展示了 AI 如何拓展工作边界并催生新的任务模式。
微软研究院发布开源框架 Orchard,用于可扩展且低成本的智能体 AI 研究,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务。
推荐理由:原文给出了完整的技术方案、训练数据和基准成绩,读者可以据此评估开源智能体框架的复现成本与能力上限。