OpenAI 提出有效第三方评估的优先事项与原则
OpenAI 公布对前沿模型及其安全防护措施开展严格、安全且独立的第三方 AI 安全评估的优先事项与原则,强调评估需具备严谨性、安全性与独立性,以提升评估的有效性和可信度。
OpenAI 公布对前沿模型及其安全防护措施开展严格、安全且独立的第三方 AI 安全评估的优先事项与原则,强调评估需具备严谨性、安全性与独立性,以提升评估的有效性和可信度。
TypeSafe AI 发布 Jev,一种新型 LLM,接受文本输入但输出浮点数而非文本,用于分类、是非题和评分。Jev 仅按输入计费,价格为每百万 token 0.042 美元,低于 OpenAI GPT-5 Nano。社区已出现基于 Qwen 3.5 的开源复刻 Kev,以及 JevBench 基准。
推荐理由:原文给出了 Jev 的定价、三种问题类型和开源复刻进展,读者可据此判断这类决策模型适合哪些分类任务。
TypeSafe AI 创始人 Diogo Almeida 在 Latent Space 播客中详细介绍了其新模型 Jev 的设计理念。Jev 被定位为面向软件而非聊天的 System 1 模型,核心创新是名为 RLCD 的强化学习技术,旨在优化校准决策而非人类反馈。
推荐理由:Diogo Almeida 在访谈中系统阐述了 Jev 的设计哲学与 RLCD 路线,读者可借此理解 TypeSafe 对 RLHF 和 RLVR 的批判逻辑。
NVIDIA 推出 DSX Ready 认证计划,面向符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品与解决方案,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
ABI Research 预测到 2035 年将有 4900 万辆 L3-L5 自动驾驶汽车,Omdia 估计 2026 至 2035 年间将部署约 6000 万台工业机器人。
埃及 AI 生态活动在埃及大博物馆举行,NVIDIA 高管出席并展示该国 AI 建设进展:NVIDIA 深度学习学院学员一年增长超十倍,Hassan Allam Data Centers 获埃及国家电信监管局许可建设数据中心,预计投资 4 亿美元。
NVIDIA 提出,AI 安全本质是工程问题,需在智能体栈的每一层落实安全要求、可执行控制与明确责任人。NVIDIA 开源 OpenShell 安全运行时,在智能体可控范围外强制策略并提供沙箱执行;Cisco DefenseClaw 与 JFrog 已基于其构建治理与技能扫描方案。
OpenAI 正与独立数学与人工智能咨询小组合作,指导新兴 AI 成果的评审与传播工作。该小组将协助 OpenAI 对相关研究成果进行审查与沟通,确保 AI 进展的发布更具严谨性与透明度。
OpenAI 发布文章,呼吁通过协调评估、报告与治理机制,共建全球 AI 标准以提升安全性。文章提出分阶段推进路径,强调各国需在技术快速迭代中同步更新监管框架,并推动行业、政府与多边机构协作,确保 AI 发展兼顾创新与风险防控。
OpenAI Academy 推出面向员工、开发者、领导者、教育工作者和学生的全新学习路径,帮助各群体构建并展示实用 AI 技能。新路径覆盖从基础到进阶的实践内容,支持学习者通过动手项目验证能力,并面向不同角色提供针对性课程设计。
针对“MCP 已过时”的观点,Simon Willison 于 2026 年 9 月 20 日撰文反驳,认为该观点完全忽视了 MCP 当前的价值。对于 Claude Code、Codex 等具备完全互联网访问权限的终端智能体,直接调用 API 或许可行,但在需要精细控制外部服务访问、安全处理认证、提供用户连接界面及强审计日志等场景下,MCP 能极大简化这些能力的实现。
Simon Willison 发布 llm-keys-ui 0.1 插件,解决在 Codex Remote 会话中安全配置 API 密钥的问题。用户可通过 `uvx --with llm-keys-ui llm keys-ui --all` 启动本地界面,经局域网或 Tailscale 设备 IP 访问并保存密钥,随后用 `llm keys get anthropic` 等命令调用。
Latent Space 盘点 Jev 发布两天内出现的 6 个复刻项目,包括基于 ModernBERT 的 Laya、基于扩散模型的 DiffusionGemmaJev、LoRA 微调 Qwen3.5-9B 的 Bespoke Nimble 等,并指出数据侧被忽视且公认 100% 合成。文章还讨论了 Jev 作为非生成式决策模型引发的架构争论,以及浏览器/计算机使用工作流被视为其最佳应用场景。
OpenAI 推出澳大利亚青少年安全蓝图,这是一份六支柱路线图,旨在打造更安全的 AI 体验,保护并赋能青少年。
Anthropic 在 Claude Code 中推出 Projects,支持单次对话生成多个云端并行会话并跨线程传递上下文,本地工作流即将推出。TypeSafe 的 Jev 被开发者视为路由与结构化决策层,Cloudflare 已通过 AI Gateway 接入,开源复现 openjev-s 采用 Qwen3.6-35B-A3B 与 SGLang radix cache。
Steve Yegge 关停其仅用编码代理订阅构建的 Gas Town,承认此前高调推崇 tokenmaxxing 的代价。Databricks 向约 3,500 名工程师推广 GPT-6 Astra,称其在复杂长程任务上优于 Opus 5 与 Sol 5.6,但总编码支出增加约 60%,为此设立专项子预算以鼓励选择性使用。OpenAI 发布模型失对齐事件披露框架,并附六份近六个月案例报告。
GitHub 工程师 Stephen Toub 发文详述了使用 GitHub Copilot 将 Copilot agent 运行时从 TypeScript 重写为 Rust 的过程。
推荐理由:作者以第一手数据复盘了用 AI 重写核心运行时的全过程,读者可据此评估 AI 编程在大型工程中的实际成效与局限。
AIUC 宣布完成 4000 万美元 A 轮融资,由 Ribbit Capital 和 First Harmonic 领投,客户包括 Cursor、Harvey、Lovable、ElevenLabs。AIUC-1 是面向 AI 智能体安全、可靠性的认证标准,要求每季度进行数千次模拟测试,涵盖越狱、幻觉和数据泄露等风险,并与 Lloyd's of London 合作提供 AI 保险。
推荐理由:访谈披露了 AIUC 的 4000 万美元 A 轮融资及 AIUC-1 认证标准细节,可了解 AI 智能体风险与保险如何结合。
OpenAI 公布一套用于追踪、调查和披露模型失对齐的框架,并同步公开六份关于模型意外或令人担忧行为的报告。该框架旨在系统化处理模型行为偏离预期目标的问题,为行业提供可参考的失对齐事件上报与应对流程。
OpenAI 与 AARP 合作,在美国 10 个城市为 1000 名老年人提供免费 ChatGPT 实操工作坊,帮助其安全掌握日常 AI 应用技能。活动旨在通过面对面教学,提升老年群体的 AI 素养与数字包容性。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中,于 Qwen3-VL 基准上吞吐量最高比 GB300 NVL72 提升 3.7 倍,在 DeepSeek-R1 上提升 2.5 倍。GB300 NVL72 在 288 GPU 扩展测试中实现 99% 扩展效率;软件优化较 v6.0 带来最高 1.6 倍性能提升。
Emerald AI、Google 与 NVIDIA 联合成立 AI 能源管理联盟(AEMA),推动数据中心根据电网状况动态调整用电,以加速 AI 基础设施接入并降低环境影响。联盟聚焦可衡量的响应速度、时长、可预测性等性能指标,而非具体软硬件,并制定故障穿越、削减负荷等接入前义务规则。AEMA 将联合算力与电力全价值链,倡导认可电网响应型需求的政策,助力美国 AI 基础设施建设。
华为坤灵在2026年新品发布会上全面升级“4+10+N”一站式场景化方案,发布20款新品,覆盖智能办公、商业、教育、医疗四大核心场景。同期面向中国分销伙伴发布“经纬计划”,联动1.5万多家工程商伙伴构建覆盖全国300个城市的销售服务网络,并推出50个样板点。新品包括业界首个网络安防融合一体机AR281、酒店宝F1004、数字诊疗IT平台及“小灵智能体”等。
OpenAI 最新经济研究揭示,工人正将 AI 用于传统岗位职责之外的新场景,部分新活动逐渐成为日常工作的固定环节。研究基于实际使用数据,展示了 AI 如何拓展工作边界并催生新的任务模式。
在 Salesforce Dreamforce 大会上,NVIDIA CEO 黄仁勋与 Salesforce CEO Marc Benioff 共同宣布 Salesforce 首个 CRM 推理模型 Koa 发布。
推荐理由:原文给出了 Salesforce 首个 CRM 推理模型 Koa 的技术底座、训练方式与落地时间表,读者可据此判断企业级 AI 应用的新进展。
Good Start Labs 联合创始人 Alex Duffy 接受 Latent Space 采访,探讨游戏训练 AI 模型技能能否迁移到真实工作。该公司用 30B 模型在 1830 游戏中训练,结果显示只有终端智能体设计能提升 Finance-Agent 基准表现,而单轮问答设计仅提升游戏内目标。Duffy 认为游戏训练可迁移到结构相似的任务,但迁移的广泛性和可靠性仍是开放问题。
推荐理由:原文用 1830 游戏实验和 Diplomacy 案例,具体展示了游戏训练如何迁移到金融研究与客服场景,并给出可验证的结果。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音模型,前者面向规模化与成本效率,后者面向高复杂度任务。
推荐理由:原文给出了两款新模型的定位差异、评测成绩和开放入口,读者可以据此判断它们适合哪些语音交互场景。
Fyxer 借助 OpenAI 模型、微调、记忆机制和真实用户反馈,为用户整理收件箱并按个人语气起草邮件。该系统通过持续学习用户偏好,提升回复的个性化与可信度,让 AI 行政助理更贴合实际工作场景。
GitHub 日韩市场部负责人将活动运营流程改造成代码驱动:用 GitHub Issue 表单收集活动信息、标签触发 GitHub Actions 自动化工作流,并借助 GitHub Copilot 将人工操作手册转化为对话式自动化。活动从策划到会后 CRM 数据整理全程自动执行,无需编写代码,仅依赖事件平台的 API 或 CRM 的 CLI 即可实现。
GPT-6 Astra 提升了 Devin 的软件测试能力,使其能自主验证代码是否正常运行。这一改进旨在帮助工程师减少代码审查工作量,加快交付速度。
OpenAI 将存储系统 Habitat 从 Python 库演进为全球分布式平台,支撑 ChatGPT 10 亿用户及每秒 2200 万次请求。文章详解了其架构升级路径,包括数据分片、跨区域复制与容量弹性扩展等关键设计,以应对超大规模并发访问。
César de la Fuente 实验室利用 Codex 和 ChatGPT 搜索现存与灭绝生物的基因组,寻找抗菌候选分子以对抗耐药性感染。该方法将 AI 辅助的序列分析与自然语言交互结合,加速了新型抗菌肽的发现流程。
OpenAI 与美国总务管理局(GSA)合作,为符合条件的联邦、州、地方及部落政府提供 AI 服务:免除许可证费用、使用费减免 50%,并扩大网络防御支持。此举旨在降低政府机构采用 AI 的门槛,同时加强关键基础设施的安全防护。
OpenAI 发布 Agents API,这是一项托管服务,由 Codex harness 驱动,支持编排、长时间运行会话和工具调用,用于构建和部署云端 AI 智能体。该 API 面向开发者,提供开箱即用的基础设施,简化智能体的开发与上线流程。
Paul Christiano 加入 OpenAI 基金会董事会及其安全与安保委员会,为 OpenAI 带来 AI 对齐、安全与标准方面的经验。
OpenAI 高管 Chris Lehane 表示,更强的 AI 能力需要更强的安全证据、共同标准和持久政策行动,政策窗口目前仍然开放。他呼吁在窗口期内采取行动,以应对 AI 快速发展带来的治理挑战。
OpenAI 发布 GPT-6 Astra,定位其最具商业能力的模型,具备高级推理、计算机使用能力以及更强的写作与设计判断力。该模型面向企业工作场景,旨在提升复杂任务处理效率。
MIT 研究员借助 GPT-5.6 Sol 与 Codex,自主运行量子计算实验、分析结果并校准量子比特。该工作流展示了 AI 智能体在科研实验全流程中的自动化潜力,从实验设计到数据解析均由模型驱动完成。
OpenAI 扩大对新闻业的支持,面向学生、教育工作者、记者和新闻机构提供工具、培训与合作伙伴关系。相关举措覆盖从课堂学习到新闻编辑室实践的完整链条,旨在推动 AI 在新闻领域的应用与人才培养。
OpenAI 分享 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含书面论证与 Lean 形式化证明。