John Platt 谈 Google ERA:用 AI 解决可评分科学问题
在 Latent Space 播客访谈中,John Platt 介绍了 Google 的 Empirical Research Assistance(ERA)——一种基于 Gemini 的 AI 系统,通过维护实验树并利用上置信界规则迭代变异,自动求解可评分的科学问题。ERA 已帮助团队解决多项难题,产出至少十篇论文,包括破解飞机尾迹气候影响建模中困扰团队两年多的难题。
在 Latent Space 播客访谈中,John Platt 介绍了 Google 的 Empirical Research Assistance(ERA)——一种基于 Gemini 的 AI 系统,通过维护实验树并利用上置信界规则迭代变异,自动求解可评分的科学问题。ERA 已帮助团队解决多项难题,产出至少十篇论文,包括破解飞机尾迹气候影响建模中困扰团队两年多的难题。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,以不同的能力与成本组合将前沿智能带入日常工作。Sol 侧重更高性能,Luna 侧重更低成本,两者共同覆盖从复杂任务到高频应用的多元场景。
Simon Willison 发布 llm-anthropic 0.29,为 LLM 命令行工具新增 Anthropic 模型支持。该版本适配 llm 635 与 anthropic 343,用户可通过命令行调用 Claude 系列模型。
GPT-6 Astra 帮助 Parallel 的智能体以一半的时间和一半的成本完成劳动力市场数据的研究与综合。相比此前模型,效率与成本均实现显著优化。
小米发布 MiMo-V2.6 系列开源全模态模型,其中 Pro 版以 1.02T 总参数、42B 激活参数成为开源权重模型智能指数榜首,训练成本约 300 万美元。模型采用 MIT 许可,并开源 RL 环境与训练代码,但 7K+ 任务数据集尚未发布。
推荐理由:原文给出了 MiMo-V2.6 的参数、成本与开源范围,读者可据此判断国产开源模型的竞争力变化。
TypeSafe AI 发布 Jev,一种新型 LLM,接受文本输入但输出浮点数而非文本,用于分类、是非题和评分。Jev 仅按输入计费,价格为每百万 token 0.042 美元,低于 OpenAI GPT-5 Nano。社区已出现基于 Qwen 3.5 的开源复刻 Kev,以及 JevBench 基准。
推荐理由:原文给出了 Jev 的定价、三种问题类型和开源复刻进展,读者可据此判断这类决策模型适合哪些分类任务。
TypeSafe AI 创始人 Diogo Almeida 在 Latent Space 播客中详细介绍了其新模型 Jev 的设计理念。Jev 被定位为面向软件而非聊天的 System 1 模型,核心创新是名为 RLCD 的强化学习技术,旨在优化校准决策而非人类反馈。
推荐理由:Diogo Almeida 在访谈中系统阐述了 Jev 的设计哲学与 RLCD 路线,读者可借此理解 TypeSafe 对 RLHF 和 RLVR 的批判逻辑。
NVIDIA 推出 DSX Ready 认证计划,面向符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品与解决方案,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
ABI Research 预测到 2035 年将有 4900 万辆 L3-L5 自动驾驶汽车,Omdia 估计 2026 至 2035 年间将部署约 6000 万台工业机器人。
埃及 AI 生态活动在埃及大博物馆举行,NVIDIA 高管出席并展示该国 AI 建设进展:NVIDIA 深度学习学院学员一年增长超十倍,Hassan Allam Data Centers 获埃及国家电信监管局许可建设数据中心,预计投资 4 亿美元。
NVIDIA 提出,AI 安全本质是工程问题,需在智能体栈的每一层落实安全要求、可执行控制与明确责任人。NVIDIA 开源 OpenShell 安全运行时,在智能体可控范围外强制策略并提供沙箱执行;Cisco DefenseClaw 与 JFrog 已基于其构建治理与技能扫描方案。
OpenAI Academy 推出面向员工、开发者、领导者、教育工作者和学生的全新学习路径,帮助各群体构建并展示实用 AI 技能。新路径覆盖从基础到进阶的实践内容,支持学习者通过动手项目验证能力,并面向不同角色提供针对性课程设计。
Latent Space 盘点 Jev 发布两天内出现的 6 个复刻项目,包括基于 ModernBERT 的 Laya、基于扩散模型的 DiffusionGemmaJev、LoRA 微调 Qwen3.5-9B 的 Bespoke Nimble 等,并指出数据侧被忽视且公认 100% 合成。文章还讨论了 Jev 作为非生成式决策模型引发的架构争论,以及浏览器/计算机使用工作流被视为其最佳应用场景。
Anthropic 在 Claude Code 中推出 Projects,支持单次对话生成多个云端并行会话并跨线程传递上下文,本地工作流即将推出。TypeSafe 的 Jev 被开发者视为路由与结构化决策层,Cloudflare 已通过 AI Gateway 接入,开源复现 openjev-s 采用 Qwen3.6-35B-A3B 与 SGLang radix cache。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中,于 Qwen3-VL 基准上吞吐量最高比 GB300 NVL72 提升 3.7 倍,在 DeepSeek-R1 上提升 2.5 倍。GB300 NVL72 在 288 GPU 扩展测试中实现 99% 扩展效率;软件优化较 v6.0 带来最高 1.6 倍性能提升。
在 Salesforce Dreamforce 大会上,NVIDIA CEO 黄仁勋与 Salesforce CEO Marc Benioff 共同宣布 Salesforce 首个 CRM 推理模型 Koa 发布。
推荐理由:原文给出了 Salesforce 首个 CRM 推理模型 Koa 的技术底座、训练方式与落地时间表,读者可据此判断企业级 AI 应用的新进展。
Good Start Labs 联合创始人 Alex Duffy 接受 Latent Space 采访,探讨游戏训练 AI 模型技能能否迁移到真实工作。该公司用 30B 模型在 1830 游戏中训练,结果显示只有终端智能体设计能提升 Finance-Agent 基准表现,而单轮问答设计仅提升游戏内目标。Duffy 认为游戏训练可迁移到结构相似的任务,但迁移的广泛性和可靠性仍是开放问题。
推荐理由:原文用 1830 游戏实验和 Diplomacy 案例,具体展示了游戏训练如何迁移到金融研究与客服场景,并给出可验证的结果。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音模型,前者面向规模化与成本效率,后者面向高复杂度任务。
推荐理由:原文给出了两款新模型的定位差异、评测成绩和开放入口,读者可以据此判断它们适合哪些语音交互场景。
GitHub 日韩市场部负责人将活动运营流程改造成代码驱动:用 GitHub Issue 表单收集活动信息、标签触发 GitHub Actions 自动化工作流,并借助 GitHub Copilot 将人工操作手册转化为对话式自动化。活动从策划到会后 CRM 数据整理全程自动执行,无需编写代码,仅依赖事件平台的 API 或 CRM 的 CLI 即可实现。
GPT-6 Astra 提升了 Devin 的软件测试能力,使其能自主验证代码是否正常运行。这一改进旨在帮助工程师减少代码审查工作量,加快交付速度。
César de la Fuente 实验室利用 Codex 和 ChatGPT 搜索现存与灭绝生物的基因组,寻找抗菌候选分子以对抗耐药性感染。该方法将 AI 辅助的序列分析与自然语言交互结合,加速了新型抗菌肽的发现流程。
OpenAI 发布 Agents API,这是一项托管服务,由 Codex harness 驱动,支持编排、长时间运行会话和工具调用,用于构建和部署云端 AI 智能体。该 API 面向开发者,提供开箱即用的基础设施,简化智能体的开发与上线流程。
OpenAI 发布 GPT-6 Astra,定位其最具商业能力的模型,具备高级推理、计算机使用能力以及更强的写作与设计判断力。该模型面向企业工作场景,旨在提升复杂任务处理效率。
斑马儿童科教集团在2026服贸会展示覆盖2至12岁儿童的AI伴学体系,将AI嵌入英语、思维、阅读等具体学习任务,而非单点问答工具。其自主研发的儿童科教大模型依托万亿级Token教育文本语料训练,已通过国家网信办生成式人工智能服务备案,并建立覆盖数据层、训练层和应用层的全链路安全体系。斑马强调“每天15分钟”短时高频学习,通过能力G值和成长报告持续追踪儿童成长轨迹。
MIT 研究员借助 GPT-5.6 Sol 与 Codex,自主运行量子计算实验、分析结果并校准量子比特。该工作流展示了 AI 智能体在科研实验全流程中的自动化潜力,从实验设计到数据解析均由模型驱动完成。
OpenAI 分享 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含书面论证与 Lean 形式化证明。
OpenAI 启动 500 万美元资助计划,支持关于生成式 AI 对青少年发展、福祉与安全影响的独立研究。申请现已开放。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款模型。3.8 Flash 在 DeepSWE v1.1 等基准上超越多数更大规模前沿模型,HLE-Verified 得分 54.9%,定价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
微软研究院推出 GigaPath-Flash 与 GigaTIME-Flash,通过知识蒸馏将十亿参数模型压缩至 22M 参数的 ViT-S 骨干,在 PANDA 和 EBRAINS 基准上以约 50 倍更低的算力实现与原版相差 3% 以内的性能。GigaTIME-Flash 在脑、乳腺、结肠和肺癌的内外分布队列中匹配或超越原版预测质量,两者均以 Apache 2.0 协议开源,仅限研究用途。
Google DeepMind 推出 Gemini 3.5 Transcribe,提供更智能的语音转文字转录能力。该功能基于 Gemini 3.5 模型,旨在提升转录的准确性与智能化水平,适用于教育等场景中的音频内容处理。
微软研究院推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离与打结五类任务,并区分静态推理与交互规划两个认知层级。测试显示,当前闭源与开源模型在静态识别上明显强于交互规划,规划阶段常丢失结构关系或提出违反物理约束的动作,整体表现远低于人类水平。该基准旨在为机器人与交互环境中的 AI 系统提供诊断工具。
Google DeepMind 推出手语转文本(SL2T)模型,为聋人和听障用户提供全新手语功能。该模型可将手语实时转换为文本,帮助用户更便捷地沟通。
微软研究院发布开源框架 Orchard,用于可扩展且低成本的智能体 AI 研究,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务。
推荐理由:原文给出了完整的技术方案、训练数据和基准成绩,读者可以据此评估开源智能体框架的复现成本与能力上限。
伯克利 AI 研究(Berkeley AI Research)提出 ABBEL 框架,将交互历史压缩为自然语言信念状态并对其内容进行监督评分,以解决长程任务中上下文无限增长与递归摘要性能下降的问题。
推理成本正以每年9倍至900倍的速度下降,GPT-4级能力从2023年初每百万token约30美元降至1美元以下,部分供应商已压至0.10美元以下。UC Berkeley学者Aditya G. Parameswaran团队提出,数据系统需面向智能体重构:为智能体优化查询复用与近似结果,支撑数千智能体的状态管理与协调,并探索由智能体合成可信数据系统。
Gemini 3.5 Live Translate 为 Google AI Studio、Google Translate 和 Google Meet 带来近乎实时的自然语音翻译。该功能基于 Gemini 3.5 模型,支持多语言实时对话翻译,并已集成至上述三款 Google 产品中。
随机对照试验结果显示,Gemini 的 Guided Learning 功能有望提升学习参与度并加速学习进程。该研究在塞拉利昂开展,并计划将成果推广至更广地区。
Calico Life Sciences 借助 Co-Scientist 将零散的研究发现相互关联,并在衰老研究中生成新的线索。该工具帮助研究人员整合分散证据,提出可验证的新假设,从而加速衰老生物学领域的探索进程。
Google DeepMind 推出基于 Gemini 构建的多智能体 AI 伙伴 Co-Scientist,旨在帮助研究人员加速科学突破。该系统通过多智能体协作模式,辅助科研人员完成假设生成、实验设计等研究环节,提升科研效率。
Google DeepMind 推出 Gemini Robotics-ER 1.6,通过增强空间推理与多视角理解,提升自主机器人在真实世界任务中的表现。该模型聚焦具身推理能力,旨在帮助机器人更准确地感知环境、规划动作并完成复杂操作。