NVIDIA AI Day Singapore:NVIDIA 与合作伙伴展示东南亚 AI 进展
NVIDIA AI Day Singapore 于9月22-23日在新加坡莱佛士城会议中心举行,NVIDIA 与合作伙伴展示东南亚 AI 进展。
NVIDIA AI Day Singapore 于9月22-23日在新加坡莱佛士城会议中心举行,NVIDIA 与合作伙伴展示东南亚 AI 进展。
Airbnb 正扩大 GPT-6 Astra 及 OpenAI 前沿模型的使用范围,帮助工程团队解决 bug、设计系统并加快交付速度。此次扩展旨在让更多内部团队直接调用这些模型,提升开发效率。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,以不同的能力与成本组合将前沿智能带入日常工作。Sol 侧重更高性能,Luna 侧重更低成本,两者共同覆盖从复杂任务到高频应用的多元场景。
GPT-6 Astra 帮助 Parallel 的智能体以一半的时间和一半的成本完成劳动力市场数据的研究与综合。相比此前模型,效率与成本均实现显著优化。
NVIDIA 推出 DSX Ready 认证计划,面向符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品与解决方案,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
ABI Research 预测到 2035 年将有 4900 万辆 L3-L5 自动驾驶汽车,Omdia 估计 2026 至 2035 年间将部署约 6000 万台工业机器人。
埃及 AI 生态活动在埃及大博物馆举行,NVIDIA 高管出席并展示该国 AI 建设进展:NVIDIA 深度学习学院学员一年增长超十倍,Hassan Allam Data Centers 获埃及国家电信监管局许可建设数据中心,预计投资 4 亿美元。
NVIDIA 提出,AI 安全本质是工程问题,需在智能体栈的每一层落实安全要求、可执行控制与明确责任人。NVIDIA 开源 OpenShell 安全运行时,在智能体可控范围外强制策略并提供沙箱执行;Cisco DefenseClaw 与 JFrog 已基于其构建治理与技能扫描方案。
OpenAI Academy 推出面向员工、开发者、领导者、教育工作者和学生的全新学习路径,帮助各群体构建并展示实用 AI 技能。新路径覆盖从基础到进阶的实践内容,支持学习者通过动手项目验证能力,并面向不同角色提供针对性课程设计。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中,于 Qwen3-VL 基准上吞吐量最高比 GB300 NVL72 提升 3.7 倍,在 DeepSeek-R1 上提升 2.5 倍。GB300 NVL72 在 288 GPU 扩展测试中实现 99% 扩展效率;软件优化较 v6.0 带来最高 1.6 倍性能提升。
在 Salesforce Dreamforce 大会上,NVIDIA CEO 黄仁勋与 Salesforce CEO Marc Benioff 共同宣布 Salesforce 首个 CRM 推理模型 Koa 发布。
推荐理由:原文给出了 Salesforce 首个 CRM 推理模型 Koa 的技术底座、训练方式与落地时间表,读者可据此判断企业级 AI 应用的新进展。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音模型,前者面向规模化与成本效率,后者面向高复杂度任务。
推荐理由:原文给出了两款新模型的定位差异、评测成绩和开放入口,读者可以据此判断它们适合哪些语音交互场景。
GitHub 日韩市场部负责人将活动运营流程改造成代码驱动:用 GitHub Issue 表单收集活动信息、标签触发 GitHub Actions 自动化工作流,并借助 GitHub Copilot 将人工操作手册转化为对话式自动化。活动从策划到会后 CRM 数据整理全程自动执行,无需编写代码,仅依赖事件平台的 API 或 CRM 的 CLI 即可实现。
GPT-6 Astra 提升了 Devin 的软件测试能力,使其能自主验证代码是否正常运行。这一改进旨在帮助工程师减少代码审查工作量,加快交付速度。
César de la Fuente 实验室利用 Codex 和 ChatGPT 搜索现存与灭绝生物的基因组,寻找抗菌候选分子以对抗耐药性感染。该方法将 AI 辅助的序列分析与自然语言交互结合,加速了新型抗菌肽的发现流程。
OpenAI 发布 Agents API,这是一项托管服务,由 Codex harness 驱动,支持编排、长时间运行会话和工具调用,用于构建和部署云端 AI 智能体。该 API 面向开发者,提供开箱即用的基础设施,简化智能体的开发与上线流程。
OpenAI 发布 GPT-6 Astra,定位其最具商业能力的模型,具备高级推理、计算机使用能力以及更强的写作与设计判断力。该模型面向企业工作场景,旨在提升复杂任务处理效率。
MIT 研究员借助 GPT-5.6 Sol 与 Codex,自主运行量子计算实验、分析结果并校准量子比特。该工作流展示了 AI 智能体在科研实验全流程中的自动化潜力,从实验设计到数据解析均由模型驱动完成。
OpenAI 分享 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含书面论证与 Lean 形式化证明。
OpenAI 启动 500 万美元资助计划,支持关于生成式 AI 对青少年发展、福祉与安全影响的独立研究。申请现已开放。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款模型。3.8 Flash 在 DeepSWE v1.1 等基准上超越多数更大规模前沿模型,HLE-Verified 得分 54.9%,定价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
微软研究院推出 GigaPath-Flash 与 GigaTIME-Flash,通过知识蒸馏将十亿参数模型压缩至 22M 参数的 ViT-S 骨干,在 PANDA 和 EBRAINS 基准上以约 50 倍更低的算力实现与原版相差 3% 以内的性能。GigaTIME-Flash 在脑、乳腺、结肠和肺癌的内外分布队列中匹配或超越原版预测质量,两者均以 Apache 2.0 协议开源,仅限研究用途。
Google DeepMind 推出 Gemini 3.5 Transcribe,提供更智能的语音转文字转录能力。该功能基于 Gemini 3.5 模型,旨在提升转录的准确性与智能化水平,适用于教育等场景中的音频内容处理。
微软研究院推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离与打结五类任务,并区分静态推理与交互规划两个认知层级。测试显示,当前闭源与开源模型在静态识别上明显强于交互规划,规划阶段常丢失结构关系或提出违反物理约束的动作,整体表现远低于人类水平。该基准旨在为机器人与交互环境中的 AI 系统提供诊断工具。
Google DeepMind 推出手语转文本(SL2T)模型,为聋人和听障用户提供全新手语功能。该模型可将手语实时转换为文本,帮助用户更便捷地沟通。
微软研究院发布开源框架 Orchard,用于可扩展且低成本的智能体 AI 研究,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务。
推荐理由:原文给出了完整的技术方案、训练数据和基准成绩,读者可以据此评估开源智能体框架的复现成本与能力上限。
伯克利 AI 研究(Berkeley AI Research)提出 ABBEL 框架,将交互历史压缩为自然语言信念状态并对其内容进行监督评分,以解决长程任务中上下文无限增长与递归摘要性能下降的问题。
推理成本正以每年9倍至900倍的速度下降,GPT-4级能力从2023年初每百万token约30美元降至1美元以下,部分供应商已压至0.10美元以下。UC Berkeley学者Aditya G. Parameswaran团队提出,数据系统需面向智能体重构:为智能体优化查询复用与近似结果,支撑数千智能体的状态管理与协调,并探索由智能体合成可信数据系统。
Gemini 3.5 Live Translate 为 Google AI Studio、Google Translate 和 Google Meet 带来近乎实时的自然语音翻译。该功能基于 Gemini 3.5 模型,支持多语言实时对话翻译,并已集成至上述三款 Google 产品中。
随机对照试验结果显示,Gemini 的 Guided Learning 功能有望提升学习参与度并加速学习进程。该研究在塞拉利昂开展,并计划将成果推广至更广地区。
Calico Life Sciences 借助 Co-Scientist 将零散的研究发现相互关联,并在衰老研究中生成新的线索。该工具帮助研究人员整合分散证据,提出可验证的新假设,从而加速衰老生物学领域的探索进程。
Google DeepMind 推出基于 Gemini 构建的多智能体 AI 伙伴 Co-Scientist,旨在帮助研究人员加速科学突破。该系统通过多智能体协作模式,辅助科研人员完成假设生成、实验设计等研究环节,提升科研效率。
Google DeepMind 推出 Gemini Robotics-ER 1.6,通过增强空间推理与多视角理解,提升自主机器人在真实世界任务中的表现。该模型聚焦具身推理能力,旨在帮助机器人更准确地感知环境、规划动作并完成复杂操作。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,通过稀疏性和低阶性将交互发现转化为可解的稀疏恢复问题,实现大规模识别 LLM 中的关键交互。ProxySPEX 利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能。在情感分析任务中,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME 和 Banzhaf 等边际方法。
该文提出一种基于分治范式的强化学习算法,替代传统时序差分(TD)学习,可将贝尔曼递归次数从线性降至对数级,避免误差累积,适用于长时程任务。研究在目标条件强化学习中首次实现该方法的规模化应用,无需调节n步TD的超参数,且不引入高方差或次优性。
加州大学伯克利分校研究团队首次为 word2vec 提供了定量预测理论,证明在现实训练条件下其学习问题可简化为无权重最小二乘矩阵分解,最终表示由 PCA 给出。训练中嵌入向量按离散步骤逐次学习正交概念,每个概念对应可解释的主题特征,理论预测与数值实验高度吻合。