Claude Opus 5.5 发布:默认模型、降价 40% 与基准测试全面解析
Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首款模型,多数任务性能对标 Fable 5.1,运行成本较 Opus 5 低 40%,速度提升约 30%。
Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首款模型,多数任务性能对标 Fable 5.1,运行成本较 Opus 5 低 40%,速度提升约 30%。
Anthropic 发布 Claude Opus 5.5,OpenAI 随后发布 GPT-6 Sol 和 Luna。GPT-6 Luna 定价 $0.10/M 输入、$0.50/M 输出,为 GPT-5.6 Luna 的一半;Opus 5.5 输入降价 20% 至 $4/M,缓存读取降价 60%。
推荐理由:原文给出了 GPT-6 与 Opus 5.5 的定价对比和实测表现,读者可据此判断新一轮模型价格战的实际影响。
Simon Willison 发布 llm-anthropic 0.29,为 LLM 命令行工具新增 Anthropic 模型支持。该版本适配 llm 635 与 anthropic 343,用户可通过命令行调用 Claude 系列模型。
小米发布 MiMo-V2.6 系列开源全模态模型,其中 Pro 版以 1.02T 总参数、42B 激活参数成为开源权重模型智能指数榜首,训练成本约 300 万美元。模型采用 MIT 许可,并开源 RL 环境与训练代码,但 7K+ 任务数据集尚未发布。
推荐理由:原文给出了 MiMo-V2.6 的参数、成本与开源范围,读者可据此判断国产开源模型的竞争力变化。
由 Chan Zuckerberg Initiative 支持的非营利组织 Learning Commons 今日推出面向教育者和教育科技开发者的开放平台,并宣布与 Canva Education、Level、MagicSchool、OKO Labs、Really Great Reading 和 TalkingPoints 等六家新伙伴达成合作。
推荐理由:本文介绍了Learning Commons开放平台的架构、合作伙伴及实际应用案例,可帮助读者了解这一教育AI基础设施的现状与争议。
TypeSafe AI 发布 Jev,一种新型 LLM,接受文本输入但输出浮点数而非文本,用于分类、是非题和评分。Jev 仅按输入计费,价格为每百万 token 0.042 美元,低于 OpenAI GPT-5 Nano。社区已出现基于 Qwen 3.5 的开源复刻 Kev,以及 JevBench 基准。
推荐理由:原文给出了 Jev 的定价、三种问题类型和开源复刻进展,读者可据此判断这类决策模型适合哪些分类任务。
NVIDIA 推出 DSX Ready 认证计划,面向符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品与解决方案,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
ABI Research 预测到 2035 年将有 4900 万辆 L3-L5 自动驾驶汽车,Omdia 估计 2026 至 2035 年间将部署约 6000 万台工业机器人。
OpenAI Academy 推出面向员工、开发者、领导者、教育工作者和学生的全新学习路径,帮助各群体构建并展示实用 AI 技能。新路径覆盖从基础到进阶的实践内容,支持学习者通过动手项目验证能力,并面向不同角色提供针对性课程设计。
Simon Willison 发布 llm-keys-ui 0.1 插件,解决在 Codex Remote 会话中安全配置 API 密钥的问题。用户可通过 `uvx --with llm-keys-ui llm keys-ui --all` 启动本地界面,经局域网或 Tailscale 设备 IP 访问并保存密钥,随后用 `llm keys get anthropic` 等命令调用。
9月17日,字节跳动旗下AI学习助手豆包爱学宣布功能升级,推出全新的AI问答、AI老师、豆包课堂以及最新上线的豆包同步课,旨在把讲解、追问、练习、复习连成完整通路。
推荐理由:原文给出了豆包爱学四个功能模块的定位与升级细节,读者可以据此判断它如何覆盖讲解、追问、练习、复习的完整学习链路。
华为坤灵在2026年新品发布会上全面升级“4+10+N”一站式场景化方案,发布20款新品,覆盖智能办公、商业、教育、医疗四大核心场景。同期面向中国分销伙伴发布“经纬计划”,联动1.5万多家工程商伙伴构建覆盖全国300个城市的销售服务网络,并推出50个样板点。新品包括业界首个网络安防融合一体机AR281、酒店宝F1004、数字诊疗IT平台及“小灵智能体”等。
在 Salesforce Dreamforce 大会上,NVIDIA CEO 黄仁勋与 Salesforce CEO Marc Benioff 共同宣布 Salesforce 首个 CRM 推理模型 Koa 发布。
推荐理由:原文给出了 Salesforce 首个 CRM 推理模型 Koa 的技术底座、训练方式与落地时间表,读者可据此判断企业级 AI 应用的新进展。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音模型,前者面向规模化与成本效率,后者面向高复杂度任务。
推荐理由:原文给出了两款新模型的定位差异、评测成绩和开放入口,读者可以据此判断它们适合哪些语音交互场景。
9月10日,橙啦在北京发布覆盖大学四年的“保考留”(保研、考研、出国留学)全栈升学服务体系,并推出SPA引擎产品“考研英语AI全程班”及AI学习助手【AI橙啦阿志】。
讯飞星光2.0升级发布,定位教师超级智能体,旨在打通备课授课、课堂互动、学情评价、家校协同、教师专业成长全链条。新版本实现H5互动创编、生态资源联通、学生成长激励、家校协同共育、教师专业成长等多项能力迭代,推动AI从“回答问题”转向“完成完整教学业务”。
推荐理由:原文给出了讯飞星光2.0在备课、课堂互动、学情评价、家校协同等环节的具体能力变化,读者可以据此判断它如何落地教学全链路。
专升本经济学教师王易泽借助钉钉A1教育版与阿里千问办公,将课堂音频转为结构化笔记并沉淀为教研数据,打通从课堂采集到长期教研的闭环。课后整理教案、编写练习与汇总错题的时间从125分钟降至33分钟,单次课后减少约92分钟重复工作。千问办公可读取A1教育版听记链接,支持定时任务与两个Skill,实现教材和试卷的个性化生成。
9月10日,钉钉发布A1教育版,一款专为教育场景打造的AI硬件,能自动记录课堂内容、整理知识结构、一键出题并生成学情反馈。教师王易泽试用后表示,课后任务完成时间从一下午缩短至30分钟。A1教育版售价1099元,近期上架钉钉教育立升旗舰店。
推荐理由:原文给出了A1教育版的具体功能、售价和教师实测数据,读者可以据此判断它能否真正减轻课后负担。
OpenAI 发布 Agents API,这是一项托管服务,由 Codex harness 驱动,支持编排、长时间运行会话和工具调用,用于构建和部署云端 AI 智能体。该 API 面向开发者,提供开箱即用的基础设施,简化智能体的开发与上线流程。
斑马儿童科教集团在2026服贸会展示覆盖2至12岁儿童的AI伴学体系,将AI嵌入英语、思维、阅读等具体学习任务,而非单点问答工具。其自主研发的儿童科教大模型依托万亿级Token教育文本语料训练,已通过国家网信办生成式人工智能服务备案,并建立覆盖数据层、训练层和应用层的全链路安全体系。斑马强调“每天15分钟”短时高频学习,通过能力G值和成长报告持续追踪儿童成长轨迹。
猿力科技旗下飞象星球在2026服贸会展示飞象老师3.0、校园版、AI墨水屏平板及AI学习空间。飞象老师3.0新增教育应用生成能力,平台累计教育教学资源超1000万;AI墨水屏平板已在平谷区初一年级覆盖3000余名学生;AI学习空间落地全国100多所学校。
9月1日,字节跳动旗下海外教育应用 Gauth 宣布 AI 课程全面上线,在历史课基础上新增 200 多门数学课,覆盖代数1、代数2、几何等美国高中必学内容。课程以体系化形式呈现,包含学习进度、讲解、文字同步和 AI 辅导入口。
推荐理由:原文给出了 Gauth AI 课程全面上线的功能细节与 UGC 路径,读者可以据此判断它如何改变个性化数学学习方式。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款模型。3.8 Flash 在 DeepSWE v1.1 等基准上超越多数更大规模前沿模型,HLE-Verified 得分 54.9%,定价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
9月2日,腾讯WorkBuddy开放平台正式上线,高顿自主研发的“大学生实习就业助手”作为标杆产品首发亮相。该产品覆盖职业测评规划、智能选岗、简历优化、网申投递到面试模拟的完整服务链路,所有能力封装为WorkBuddy生态中的Skill,并配套专属MCP连接器。腾讯同步启动2026开学季AI普惠专项行动,面向全国高校学生开放免费积分福利。
9月1日,千问App学习功能全面升级,新增教材同步单元作文辅导和初中语文数学教材精讲,并将数理化拍题讲解扩展到高中和大学,功能免费开放。此次升级强调少给答案、多讲“为什么”,通过分步提问和随时追问引导学生理解思路。
推荐理由:原文给出千问学习功能从直接给答案转向分步引导提问的具体变化,可帮助读者了解AI学习辅导产品的设计思路。
OpenAI 于 8 月 18 日推出面向 13 至 17 岁用户的 ChatGPT for Teens,包含 Study Mode、作业提醒、测验与学习可视化、学习时段等安全功能。一位小学校长和一位高中生分别实测后认为,该工具能帮助缺乏家庭辅导的学生学习基础概念,但校长指出它无法替代教师的显性教学,学生仍可能走捷径抄袭。
推荐理由:校长与学生分别实测了 ChatGPT for Teens 的 Study Mode 等新功能,读者可借此了解该产品在真实课堂中的适用性与局限。
微软研究院推出 GigaPath-Flash 与 GigaTIME-Flash,通过知识蒸馏将十亿参数模型压缩至 22M 参数的 ViT-S 骨干,在 PANDA 和 EBRAINS 基准上以约 50 倍更低的算力实现与原版相差 3% 以内的性能。GigaTIME-Flash 在脑、乳腺、结肠和肺癌的内外分布队列中匹配或超越原版预测质量,两者均以 Apache 2.0 协议开源,仅限研究用途。
Google DeepMind 推出全球首个针对专有前沿 AI 模型的双盲评测,将外部评测置于加密环境中,防止模型提前看到测试题导致基准污染。该评测与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,使用 Gemini Flash Lite 模型在隐私保护环境中测试机密基准。
Google DeepMind 推出 Gemini 3.5 Transcribe,提供更智能的语音转文字转录能力。该功能基于 Gemini 3.5 模型,旨在提升转录的准确性与智能化水平,适用于教育等场景中的音频内容处理。
Google DeepMind 推出手语转文本(SL2T)模型,为聋人和听障用户提供全新手语功能。该模型可将手语实时转换为文本,帮助用户更便捷地沟通。
Google 与 AIM 联合推出 ATL Saathi,一款由 Gemini 驱动的 AI 工具,旨在赋能印度机器人实验室中的教育工作者。该工具面向印度下一代创新者,助力其在机器人教育领域的教学与实践。
Gemini 3.5 Live Translate 为 Google AI Studio、Google Translate 和 Google Meet 带来近乎实时的自然语音翻译。该功能基于 Gemini 3.5 模型,支持多语言实时对话翻译,并已集成至上述三款 Google 产品中。
Google DeepMind 推出基于 Gemini 构建的多智能体 AI 伙伴 Co-Scientist,旨在帮助研究人员加速科学突破。该系统通过多智能体协作模式,辅助科研人员完成假设生成、实验设计等研究环节,提升科研效率。