Qwen3.8 27B 用英文单词做加法:本地模型基准测试
一项基准测试检验本地模型 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达正整数加法结果。在 5,070 个禁用推理的用例中,其数字准确率为 23.57%,操作数从 1-3 位增至 10-13 位时准确率由 97.04% 降至 6.44%,格式合规率达 96.17%。启用中等推理后,169 次尝试中答对 167 次。
一项基准测试检验本地模型 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达正整数加法结果。在 5,070 个禁用推理的用例中,其数字准确率为 23.57%,操作数从 1-3 位增至 10-13 位时准确率由 97.04% 降至 6.44%,格式合规率达 96.17%。启用中等推理后,169 次尝试中答对 167 次。
MIT 2026 年 6 月发布报告指出,AI 正在削弱大学体验的核心环节:学生减少参加答疑时间,线上讨论参与度下降,宿舍和图书馆的学习小组变少,教师越来越难判断学生的真实学习情况。
推荐理由:报告用 MIT 内部数据与多校研究对照,呈现 AI 对师生信任和真实学习的冲击,适合作为高校制定 AI 政策的参考。
Geoffrey Hinton 等 22 位研究者发布首篇关于递归自我改进(RSI)的论文《What if automating AI R&D triggers an intelligence explosion?
推荐理由:论文用头部实验室数据和模型推演,把递归自我改进从科幻概念落到可评估的工程路径,适合关注 AI 研发自动化趋势的读者。
9月23—24日,数字生态指数2026发布会暨成都科学城人工智能产业生态大会在成都举行,由北京大学大数据分析与应用技术国家工程实验室等联合主办。张平文发布《数字生态指数2026》报告,提出人工智能生态以“数、模、算、电”为核心底座,国际指数覆盖159个国家,城市数字生态第一梯队由6个扩容至12个。同期举办2026国产科学计算软件大会,发布北太天元2026版本。
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 客座期间开发了开源工具 BootLoops,用于驱动 Claude 进行精确科学计算。三个月内团队在 18 个领域产出 36 篇论文,包括解决生态学中 20 年未解的方程、分析 57 亿对突变等。Schwartz 同时指出模型会过早宣布完成、计算正确但结论错误等局限,强调人类专家仍不可或缺。
推荐理由:原文给出了开源工具 BootLoops 的实际产出与局限,读者可据此判断 AI 在科研中的真实边界。
EdReports 发布简报指出,课程与教育科技供应商正迅速将 AI 集成到教学材料中,但几乎没有证据表明这些 AI 附加功能能改善学生学习。在研究的 10 家供应商中,仅 1 家提供了第三方证据证明其 AI 功能提升了教育成果。
推荐理由:EdReports 对 10 家 K-12 教育科技供应商的调研显示,多数 AI 功能缺乏第三方证据,提醒采购方关注产品实效。
美国进步中心(Center for American Progress)的新报告分析美国数学成绩下滑的原因,并提出5项全国性政策策略。美国学业成绩自2013年以来持续下降,最近一次PISA评估显示其数学成绩降至历史新低,男生数学成绩比女生高24分。
National Parents Union 与 EdChoice 今年的家长民调显示,多数家长支持课堂使用一定程度的技术,同时希望设置使用限制。
推荐理由:民调呈现了家长对课堂技术使用与使用边界的不同态度,为理解限制屏幕时间和保留学生接触技术机会之间的平衡提供参考。
慕尼黑CESifo经济研究所新论文《AI对近期大学毕业生就业的早期影响》直接反驳斯坦福大学此前研究,称“没有证据表明AI对近期大学毕业生就业造成显著、广泛的替代或减少”。研究者Robert Fairlie和Jane Wu聚焦应届生,因劳动力需求变化或先体现在招聘减少上。论文同时指出,人口普查调查显示越来越多企业正用AI替代大量员工任务。
沃尔顿家族基金会与盖洛普联合发布的报告显示,59%的教师认为数字工具有助于学生学习,但仅10%强烈认同;52%认为设备弊大于利。教师希望在选择技术时有更大发言权,仅29%曾被征询意见。报告指出,监督而非屏幕时间限制是改善课堂技术使用的关键杠杆。
推荐理由:报告呈现教师对课堂技术的真实态度,可帮助理解设备使用争议背后的关键因素。
9月19日,2027版高考蓝皮书学术成果在北京大学发布,全系列共48本、覆盖9大学科,紧扣人工智能时代高考改革方向。丛书提出“点—链—网”命题模型,新增SOLO分类理论与AI辅助命题内容,并系统阐释复习理念与关键能力培养,帮助一线教师从“会做题”转向“会命题”。
微软研究院研究显示,将物理 AI 推理从机器人板载 GPU 卸载至边缘或云端 GPU,可显著提升任务成功率、支持更大模型并延长电池寿命。在移动操作测试中,板载 GPU 使导航障碍检测延迟降低 30%、VLA 模型准确率下降 50%,而 Jetson Thor 等 GPU 耗电最高达 160%。
作者引用一项覆盖约2.7万名中国中学生的研究指出,2023至2025年间约80%学生开始使用生成式AI,其中约50%在五个月内完全外包作业,导致闭卷考试成绩平均下降20%,中考和高考成绩分别下降24%和18%,且未发现任何学习收益。作者认为AI是认知自动化工具,呼吁教育者关注其实际危害而非想象潜力。
推荐理由:作者基于一项覆盖近两万七千名中国中学生的大样本研究,给出了AI导致学习下降的具体数据,并回应了常见反驳观点。
讯飞教育技术研究院/认知智能全国重点实验室智能教育研究中心与中国教育技术协会智能教育专业委员会联合发布《2026智能教育发展蓝皮书——人工智能助力打造未来课堂》,9月19日在第八届智能教育论坛上正式亮相。蓝皮书共8章,基于366个实践案例,系统梳理元宇宙学习空间、智能教室、数字教材、教学智能体等新型课堂要素,并研判风险挑战,为未来课堂建设提供参考。
NWEA 研究显示,疫情后阅读成绩整体回升,但最低水平的中学生读者每年仍在退步。Coursemojo 联合创始人 Dacia Toll 指出,四年级流利阅读的孩子到六年级却答不出基础理解题,源于文本难度提升与背景知识专业化双重压力。她强调,AI 工具应引导 struggling reader 回到文本自主思考,而非直接给答案。
Eric S. Taylor基于田纳西州教师数据发现,2011—12学年实施的多指标评价与更严格任期规则,使新教师早期增值绩效提升4.7%的标准差。研究显示,单独的评价改革带来2.4%的标准差提升,任期激励额外带来2.3%的提升;新教师前六年的累计增值绩效增长达到7.9%,且教师获得任期后绩效没有明显下降。
推荐理由:这项田纳西州教师数据研究区分了评价改革与任期激励,呈现早期绩效提升及任期后的持续效果,为理解教师激励政策提供了可比较证据。
美国国家经济研究局(NBER)新工作论文发现,雇主对社区学院幼儿教育学士学位求职者与传统四年制大学学士学位持有者看法大致相同,没有证据表明存在系统性歧视。研究基于虚构求职申请的回复比较;自 2024 年以来,提供学士学位的社区学院从 187 所增至 214 所,项目从 678 个增至 763 个。
微软研究院推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离与打结五类任务,并区分静态推理与交互规划两个认知层级。测试显示,当前闭源与开源模型在静态识别上明显强于交互规划,规划阶段常丢失结构关系或提出违反物理约束的动作,整体表现远低于人类水平。该基准旨在为机器人与交互环境中的 AI 系统提供诊断工具。
Turnitin 发布的《学习诚信洞察报告 Q2》显示,48% 的受访者认为教师和管理者是学校 AI 实施的主要负责人,远超技术负责人(17%)和跨职能委员会(16%)。
伯克利 AI 研究(Berkeley AI Research)提出 ABBEL 框架,将交互历史压缩为自然语言信念状态并对其内容进行监督评分,以解决长程任务中上下文无限增长与递归摘要性能下降的问题。
推理成本正以每年9倍至900倍的速度下降,GPT-4级能力从2023年初每百万token约30美元降至1美元以下,部分供应商已压至0.10美元以下。UC Berkeley学者Aditya G. Parameswaran团队提出,数据系统需面向智能体重构:为智能体优化查询复用与近似结果,支撑数千智能体的状态管理与协调,并探索由智能体合成可信数据系统。
随机对照试验结果显示,Gemini 的 Guided Learning 功能有望提升学习参与度并加速学习进程。该研究在塞拉利昂开展,并计划将成果推广至更广地区。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,通过稀疏性和低阶性将交互发现转化为可解的稀疏恢复问题,实现大规模识别 LLM 中的关键交互。ProxySPEX 利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能。在情感分析任务中,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME 和 Banzhaf 等边际方法。
该文提出一种基于分治范式的强化学习算法,替代传统时序差分(TD)学习,可将贝尔曼递归次数从线性降至对数级,避免误差累积,适用于长时程任务。研究在目标条件强化学习中首次实现该方法的规模化应用,无需调节n步TD的超参数,且不引入高方差或次优性。
加州大学伯克利分校研究团队首次为 word2vec 提供了定量预测理论,证明在现实训练条件下其学习问题可简化为无权重最小二乘矩阵分解,最终表示由 PCA 给出。训练中嵌入向量按离散步骤逐次学习正交概念,每个概念对应可解释的主题特征,理论预测与数值实验高度吻合。