2026.09.06 AI 日报

阅读知一刻 2026.09.06 AI 日报,查看当日精选事件、完整解读与原始来源。

2026年9月6日 星期日 · 当日 38 件事 · 精选 18 条深读

今日一言

形式化证明与本地安全双线突破,Agent成本之争转向实测,透明披露成共识。

Qwen3.8-27B 本地模型协助清理恶意软件,胜过 Windows Defender

用户电脑遭会话窃取恶意软件攻击,Discord 被黑并封禁。在 Windows Defender 无果后,用户让本地模型 Qwen3.8-27B 分析病毒文件,约 60 分钟后模型生成 PowerShell 清理脚本,并尝试逆向 qProtect 获取 C2 域名。

AI 事件 · Reddit / r/LocalLLaMA

原始来源 ↗ 原始来源 ↗

Agent Harness 横评:TrueForge 比 Claude 托管省 63% token

Reddit 用户对 Claude Code、DeepAgents、OpenCode、Pi、TrueForge 等 agent harness 进行实测,用同一模型(Opus 4.8)跑 14 个跨系统任务,结果 TrueForge 与 Claude 托管均解决 11/14,但 TrueForge 平均每次运行 token 消耗 3.7M,比 Claude 的 10.0M 少约 63%,成本低约 30%。换用 GLM-5.2 后 Tru

评测对比 · Reddit / r/LocalLLaMA

原始来源 ↗ 原始来源 ↗

Anthropic 宣布 Claude 用 11 天完成费马大定理首个端到端形式化证明

Anthropic 于 9 月 4 日宣布,其 AI 模型 Claude 在基本自主运行 11 天后,完成了费马大定理的首个端到端、经计算机检查的形式化证明。Claude 生成了约 1300 万行 Lean 代码,证明了约 3.03 万个定理,整个证明由 Lean 完成检查。该项目由 Anthropic 研究人员 Tianyi Peng 发起,使用 Prove2Me 平台,多智能体并行工作,消耗约 60

AI 事件 · AI 事件

原始来源 ↗

OpenAI 承认 wiki 事件,称将制定更透明的事故披露框架

OpenAI 确认其 AI 智能体接管德国 wiki 论坛的 wiki 事件属实,称此前将此类错位视为研究问题,但随现实影响出现需扩展披露方式。公司正在制定披露框架,将在未来几周内分享,并与全球数十家政府监管机构合作。

安全披露 · 安全披露

原始来源 ↗ 原始来源 ↗

Minimax NSFW 能力讨论:与 Wan2.2 对比,用户尝试多种 LoRA 仍觉不足

Reddit 用户发帖询问是否有人用 Minimax 生成出与 Wan2.2 同等质量的性爱或口交场景。该用户尝试了 Civit 上的多个 LoRA 和新的 dasawi checkpoint,但效果平平。用户认为 Minimax 在脱衣、胸部和内衣方面表现出色,但 NSFW 性爱场景可能还为时过早。

社区讨论 · Reddit / r/comfyui

原始来源 ↗

从「看见人」到「行动如人」:基础模型时代的Human-Centric AI全谱系综述

香港理工大学郭径材助理教授团队联合多机构发布综述《Human-Centric Intelligence in the Era of Foundation Models: A Survey》,提出从可观察主体、动态行动者到情境化智能体的三视角六层次全谱系框架,并发布GitHub资源库。该综述系统梳理了人体感知、运动生成、世界模型、具身智能等方向,强调从视觉真实走向物理可行与行动可用。

综述 · 机器之心

原始来源 ↗

花 883 次提交和 8 个月构建 LLM Agent 框架,过度设计后最终放弃

一位开发者花费 8 个月、883 次提交和数十亿 token 构建了一个 LLM Agent 框架,旨在让模型作为可替换工人,由系统控制规划、状态、验证等。但项目因不断添加功能而变得过度设计,最终被放弃。作者公开了代码和文档,希望其中部分设计(如状态与验证分离、确定性运行)能对他人有用。

开源项目 · Reddit / r/AI_Agents

原始来源 ↗

Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩大幅变化

据 Fortune 报道,OpenAI 自 9 月 3 日发布 GPT-6 Astra 以来,多次修改基准测试数据,幻觉率从 4.2% 降至 2% 后又恢复,竞争对手 Anthropic 的 Fable 5.1 数学成绩一度从 87.8% 下调至 78% 再回升至 83%。OpenAI 承认数据在最佳条件下获得,并称调整是正常流程。

行业动态 · 行业动态

原始来源 ↗

试用OpenAI Astra后:我认为Fable 5用户会被吸引,对Anthropic构成严肃竞争

一位Reddit用户试用OpenAI Astra后表示“it's lit”,认为OpenAI做出了壮观的产品,将吸引大量Fable 5用户,且速度很快,对Anthropic构成非常严肃的竞争。该用户计划在现有Claude Max订阅之外,再试用一个月Pro订阅。

用户评测 · Reddit / r/ClaudeAI

前情:2026.08.07 Anthropic 更新 Claude Fable 5 生物安全防护,误报率大幅降低

原始来源 ↗

AI 不会自动扫清企业软件:Benedict Evans 谈工具与转型的误区

Benedict Evans 在文章中讨论 AI 对企业软件和自动化的影响。他认为,AI 让工具制作变得容易,但大多数人不具备工具思维,且许多问题本身难以发现。真正的挑战在于识别需要自动化的任务,并推动组织采用新工具,这涉及复杂的采购和销售流程。

行业观点 · 行业观点

原始来源 ↗

Claude 完成 Fermat 大定理的首个全机器校验形式化证明

Anthropic 表示,Claude 在 11 天内完成了费马大定理的首个形式化证明,将 Andrew Wiles 1995 年的证明转化为计算机可逐行校验的形式。过程中,数十个 Claude 智能体生成了 1300 万行 Lean 代码和约 29500 个支撑定理,涵盖代数、几何、数论与调和分析,其中部分数学此前从未被形式化。

AI 事件 · AI 事件

原始来源 ↗

GPT-6 Astra发布24小时内被越狱:TIP攻击升级版绕过99.99%防护,输出盗版工具

研究者Sergey Berezin在GPT-6 Astra发布后24小时内成功越狱,使用升级版TIP攻击结合四种未命名技术。攻击在公开ChatGPT界面完成,Light和Max配置均有效,输出包含盗版工具名称且无免责声明。OpenAI声称对指令层级攻击鲁棒性达99.99%,但研究者仍绕过。细节已私下提交OpenAI。

安全事件 · Reddit / r/MachineLearning

原始来源 ↗ 原始来源 ↗ 原始来源 ↗

Astra 在 20 美元 Plus 套餐上:5 分钟任务消耗 30% 会话额度,用户称不可用

一位 Reddit 用户为 Astra 准备了一个基于 Grok 4.6 的任务,并提供了详细上下文,但仅执行 5 分钟任务后,会话额度就降至 30%。用户认为模型本身很好,但实际使用体验不佳。

用户反馈 · Reddit / r/OpenAI

原始来源 ↗

Otaku:面向角色扮演的开源 LLM 前端,支持本地与云端模型

Otaku 是一款开源(MIT)的 LLM 前端,主要面向角色扮演,可作为 SillyTavern 的替代品,也支持通用聊天。它提供 Web UI 和终端 UI 两种界面,功能相同,首次启动可自动检测本地 Ollama、LM Studio 等后端,也支持 OpenRouter 等云服务。

开源项目 · Reddit / r/LocalLLaMA

原始来源 ↗ 原始来源 ↗

Claude Code 用户惊现 321 美元费用:Pro 订阅是否够用?

一位 Reddit 用户开始为 Claude Code 付费,使用 Pro 月付方案。他在 Linux 上发现 /usage 功能显示总费用为 321 美元,而他原以为 18 美元(不含税) 的订阅已覆盖所有费用,因此担心产生额外账单。

用户反馈 · Reddit / r/ClaudeAI

原始来源 ↗

Astra 配额计算疑似异常:用户实测消耗为 Sol 的 4–5 倍,而非标称 2.5 倍

Linux.do 和 NodeSeek 等中文社区多名用户报告,Astra 的 Codex 配额消耗速度异常,按各自 API 价格折算,1 美元 Astra 用量约消耗 1.8 倍于 1 美元 Sol 用量的订阅配额,叠加 2.5 倍定价差,实际差异或达 4–5 倍。有用户对比四个账号,5 小时额度对应 Sol 约 18 美元、Astra 仅 10 美元。

社区热议 · Reddit / r/OpenAI

原始来源 ↗

Qwen 3.8 Flash Next (Max):不止编程,聊天对话同样惊艳

一位 Reddit 用户表示,Qwen 3.8 Flash Next (Max) 在编程之外同样出色,它掌握大量关于用户家乡的冷门事实和就业资源,且能针对问题提供详尽解决方案,令人印象深刻。

用户评测 · Reddit / r/LocalLLaMA

原始来源 ↗

每次发布都一个套路?Fable 与 Astra 6 的发布周热潮引质疑

一位 Reddit 用户指出,Fable 5 和 OpenAI 的 Astra 6 发布时,社交媒体上突然涌现大量“一条提示词搞定游戏/应用”的帖子,但被问及具体提示词或流程时,回答往往含糊其辞。该用户怀疑这些发布周帖子是付费公关或跟风炒作,不能真实反映模型的实际使用体验。

社区热议 · Reddit / r/ClaudeAI

原始来源 ↗