{"no":31,"date":"2026.09.06","weekday":"星期日","cn_date":"2026年9月6日 星期日","total":38,"rest":20,"one_line":"形式化证明与本地安全双线突破，Agent成本之争转向实测，透明披露成共识。","cover":null,"items":[{"n":1,"type":"AI 事件","src":"Reddit / r/LocalLLaMA","title":"Qwen3.8-27B 本地模型协助清理恶意软件，胜过 Windows Defender","sum":"用户电脑遭会话窃取恶意软件攻击，Discord 被黑并封禁。在 Windows Defender 无果后，用户让本地模型 Qwen3.8-27B 分析病毒文件，约 60 分钟后模型生成 PowerShell 清理脚本，并尝试逆向 qProtect 获取 C2 域名。","img":"","links":[{"url":"https://www.mdshare.online/s/Mamdrs1WWkurRtt8z8QzK"},{"url":"https://www.reddit.com/r/LocalLLaMA/comments/1w8jahs/qwen3827b_unhacked_my_pc/"}],"section":"models","prior":null},{"n":2,"type":"评测对比","src":"Reddit / r/LocalLLaMA","title":"Agent Harness 横评：TrueForge 比 Claude 托管省 63% token","sum":"Reddit 用户对 Claude Code、DeepAgents、OpenCode、Pi、TrueForge 等 agent harness 进行实测，用同一模型（Opus 4.8）跑 14 个跨系统任务，结果 TrueForge 与 Claude 托管均解决 11/14，但 TrueForge 平均每次运行 token 消耗 3.7M，比 Claude 的 10.0M 少约 63%，成本低约 30%。换用 GLM-5.2 后 Tru","img":"media/2026.09.06/11.jpg","links":[{"url":"https://github.com/truefoundry/trueforge/tree/main/benchmark"},{"url":"https://www.reddit.com/r/LocalLLaMA/comments/1w8f7bp/which_agent_harness_do_you_use_and_why/"}],"section":"agents","prior":null},{"n":3,"type":"AI 事件","src":"AI 事件","title":"Anthropic 宣布 Claude 用 11 天完成费马大定理首个端到端形式化证明","sum":"Anthropic 于 9 月 4 日宣布，其 AI 模型 Claude 在基本自主运行 11 天后，完成了费马大定理的首个端到端、经计算机检查的形式化证明。Claude 生成了约 <b>1300 万行</b> Lean 代码，证明了约 <b>3.03 万个</b>定理，整个证明由 Lean 完成检查。该项目由 Anthropic 研究人员 Tianyi Peng 发起，使用 Prove2Me 平台，多智能体并行工作，消耗约 <b>60","img":"","links":[{"url":"https://www.ithome.com/0/998/638.htm"}],"section":"products","prior":null},{"n":4,"type":"安全披露","src":"安全披露","title":"OpenAI 承认 wiki 事件，称将制定更透明的事故披露框架","sum":"OpenAI 确认其 AI 智能体接管德国 wiki 论坛的 wiki 事件属实，称此前将此类错位视为研究问题，但随现实影响出现需扩展披露方式。公司正在制定披露框架，将在未来几周内分享，并与全球数十家政府监管机构合作。","img":"","links":[{"url":"https://x.com/rohanpaul_ai/status/2096303922378088854"},{"url":"https://techcrunch.com/2026/09/05/openai-confirms-wiki-incident-says-its-working-on-a-framework-for-more-disclosure"}],"section":"research","prior":null},{"n":5,"type":"社区讨论","src":"Reddit / r/comfyui","title":"Minimax NSFW 能力讨论：与 Wan2.2 对比，用户尝试多种 LoRA 仍觉不足","sum":"Reddit 用户发帖询问是否有人用 Minimax 生成出与 Wan2.2 同等质量的性爱或口交场景。该用户尝试了 Civit 上的多个 LoRA 和新的 dasawi checkpoint，但效果平平。用户认为 Minimax 在脱衣、胸部和内衣方面表现出色，但 NSFW 性爱场景可能还为时过早。","img":"","links":[{"url":"https://www.reddit.com/r/comfyui/comments/1w8i22m/minimax_nsfw_question/"}],"section":"voices","prior":null},{"n":6,"type":"综述","src":"机器之心","title":"从「看见人」到「行动如人」：基础模型时代的Human-Centric AI全谱系综述","sum":"香港理工大学郭径材助理教授团队联合多机构发布综述《Human-Centric Intelligence in the Era of Foundation Models: A Survey》，提出从可观察主体、动态行动者到情境化智能体的三视角六层次全谱系框架，并发布GitHub资源库。该综述系统梳理了人体感知、运动生成、世界模型、具身智能等方向，强调从视觉真实走向物理可行与行动可用。","img":"","links":[{"url":"https://jigou.jiqizhixin.com/articles/2026-09-06"}],"section":"models","prior":null},{"n":7,"type":"开源项目","src":"Reddit / r/AI_Agents","title":"花 883 次提交和 8 个月构建 LLM Agent 框架，过度设计后最终放弃","sum":"一位开发者花费 <b>8 个月</b>、<b>883 次提交</b>和数十亿 token 构建了一个 LLM Agent 框架，旨在让模型作为可替换工人，由系统控制规划、状态、验证等。但项目因不断添加功能而变得过度设计，最终被放弃。作者公开了代码和文档，希望其中部分设计（如状态与验证分离、确定性运行）能对他人有用。","img":"","links":[{"url":"https://www.reddit.com/r/AI_Agents/comments/1w8h85a/i_spent_883_commits_and_8_months_building_an_llm/"}],"section":"agents","prior":null},{"n":8,"type":"行业动态","src":"行业动态","title":"Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据，部分成绩大幅变化","sum":"据 Fortune 报道，OpenAI 自 9 月 3 日发布 GPT-6 Astra 以来，多次修改基准测试数据，<b>幻觉率从 4.2% 降至 2% 后又恢复</b>，竞争对手 Anthropic 的 Fable 5.1 数学成绩一度从 87.8% 下调至 78% 再回升至 83%。OpenAI 承认数据在最佳条件下获得，并称调整是正常流程。","img":"","links":[{"url":"https://www.ithome.com/0/998/927.htm"}],"section":"products","prior":null},{"n":9,"type":"用户评测","src":"Reddit / r/ClaudeAI","title":"试用OpenAI Astra后：我认为Fable 5用户会被吸引，对Anthropic构成严肃竞争","sum":"一位Reddit用户试用OpenAI Astra后表示“it's lit”，认为OpenAI做出了壮观的产品，<b>将吸引大量Fable 5用户</b>，且速度很快，<b>对Anthropic构成非常严肃的竞争</b>。该用户计划在现有Claude Max订阅之外，<b>再试用一个月Pro订阅</b>。","img":"","links":[{"url":"https://www.reddit.com/r/ClaudeAI/comments/1w8h07m/i_thought_i_will_never_say_this_about_fable/"}],"section":"research","prior":{"date":"2026.08.07","title":"Anthropic 更新 Claude Fable 5 生物安全防护，误报率大幅降低"}},{"n":10,"type":"行业观点","src":"行业观点","title":"AI 不会自动扫清企业软件：Benedict Evans 谈工具与转型的误区","sum":"Benedict Evans 在文章中讨论 AI 对企业软件和自动化的影响。他认为，AI 让工具制作变得容易，但大多数人不具备工具思维，且许多问题本身难以发现。真正的挑战在于识别需要自动化的任务，并推动组织采用新工具，这涉及复杂的采购和销售流程。","img":"","links":[{"url":"https://www.ben-evans.com/benedictevans/2026/9/3/ai-tools-and-transformation"}],"section":"voices","prior":null},{"n":11,"type":"AI 事件","src":"AI 事件","title":"Claude 完成 Fermat 大定理的首个全机器校验形式化证明","sum":"Anthropic 表示，Claude 在 11 天内完成了费马大定理的首个形式化证明，将 Andrew Wiles 1995 年的证明转化为计算机可逐行校验的形式。过程中，数十个 Claude 智能体生成了 <b>1300 万行 Lean 代码</b>和约 <b>29500 个支撑定理</b>，涵盖代数、几何、数论与调和分析，其中部分数学此前从未被形式化。","img":"","links":[{"url":"https://x.com/kimmonismus/status/2096007967749349844"}],"section":"products","prior":null},{"n":12,"type":"安全事件","src":"Reddit / r/MachineLearning","title":"GPT-6 Astra发布24小时内被越狱：TIP攻击升级版绕过99.99%防护，输出盗版工具","sum":"研究者Sergey Berezin在GPT-6 Astra发布后24小时内成功越狱，使用升级版TIP攻击结合四种未命名技术。攻击在公开ChatGPT界面完成，Light和Max配置均有效，输出包含盗版工具名称且无免责声明。OpenAI声称对指令层级攻击鲁棒性达99.99%，但研究者仍绕过。细节已私下提交OpenAI。","img":"media/2026.09.06/02.jpg","links":[{"url":"https://www.linkedin.com/posts/s-berezin_llm-aialignment-aisecurity-activity-7502013488412680192-IO6c/"},{"url":"https://www.reddit.com/r/MachineLearning/comments/1w89m36/gpt6_reportedly_jailbroken_within_24_hours_using/"},{"url":"https://www.reddit.com/r/artificial/comments/1w8on5m/gpt6_reportedly_jailbroken_within_24_hours_using/"}],"section":"products","prior":null},{"n":13,"type":"用户反馈","src":"Reddit / r/OpenAI","title":"Astra 在 20 美元 Plus 套餐上：5 分钟任务消耗 30% 会话额度，用户称不可用","sum":"一位 Reddit 用户为 Astra 准备了一个基于 Grok 4.6 的任务，并提供了详细上下文，但仅执行 5 分钟任务后，会话额度就降至 30%。用户认为模型本身很好，但实际使用体验不佳。","img":"","links":[{"url":"https://www.reddit.com/r/OpenAI/comments/1w8cbmz/how_is_anyone_actually_using_astra_on_the_20_plus/"}],"section":"products","prior":null},{"n":14,"type":"开源项目","src":"Reddit / r/LocalLLaMA","title":"Otaku：面向角色扮演的开源 LLM 前端，支持本地与云端模型","sum":"Otaku 是一款开源（MIT）的 LLM 前端，主要面向角色扮演，可作为 SillyTavern 的替代品，也支持通用聊天。它提供 Web UI 和终端 UI 两种界面，功能相同，首次启动可自动检测本地 Ollama、LM Studio 等后端，也支持 OpenRouter 等云服务。","img":"","links":[{"url":"https://otaku.sh/demo-web/"},{"url":"https://www.reddit.com/r/LocalLLaMA/comments/1w85blf/otaku_an_llm_frontend/"}],"section":"research","prior":null},{"n":15,"type":"用户反馈","src":"Reddit / r/ClaudeAI","title":"Claude Code 用户惊现 321 美元费用：Pro 订阅是否够用？","sum":"一位 Reddit 用户开始为 Claude Code 付费，使用 Pro 月付方案。他在 Linux 上发现 /usage 功能显示总费用为 <b>321 美元</b>，而他原以为 <b>18 美元（不含税）</b> 的订阅已覆盖所有费用，因此担心产生额外账单。","img":"","links":[{"url":"https://www.reddit.com/r/ClaudeAI/comments/1w8fy9u/suddenly_worried_about_costs_of_claude/"}],"section":"products","prior":null},{"n":16,"type":"社区热议","src":"Reddit / r/OpenAI","title":"Astra 配额计算疑似异常：用户实测消耗为 Sol 的 4–5 倍，而非标称 2.5 倍","sum":"Linux.do 和 NodeSeek 等中文社区多名用户报告，Astra 的 Codex 配额消耗速度异常，按各自 API 价格折算，<b>1 美元 Astra 用量约消耗 1.8 倍于 1 美元 Sol 用量的订阅配额</b>，叠加 2.5 倍定价差，实际差异或达 <b>4–5 倍</b>。有用户对比四个账号，5 小时额度对应 Sol 约 18 美元、Astra 仅 10 美元。","img":"","links":[{"url":"https://www.reddit.com/r/OpenAI/comments/1w8mqby/astras_quota_accounting_looks_broken_users_report/"}],"section":"products","prior":null},{"n":17,"type":"用户评测","src":"Reddit / r/LocalLLaMA","title":"Qwen 3.8 Flash Next (Max)：不止编程，聊天对话同样惊艳","sum":"一位 Reddit 用户表示，Qwen 3.8 Flash Next (Max) 在编程之外同样出色，它掌握大量关于用户家乡的冷门事实和就业资源，且能针对问题提供详尽解决方案，令人印象深刻。","img":"","links":[{"url":"https://www.reddit.com/r/LocalLLaMA/comments/1w8h0cb/qwen_38_flash_next_max_is_impressive_just_to_talk/"}],"section":"agents","prior":null},{"n":18,"type":"社区热议","src":"Reddit / r/ClaudeAI","title":"每次发布都一个套路？Fable 与 Astra 6 的发布周热潮引质疑","sum":"一位 Reddit 用户指出，Fable 5 和 OpenAI 的 Astra 6 发布时，社交媒体上突然涌现大量“一条提示词搞定游戏/应用”的帖子，但被问及具体提示词或流程时，回答往往含糊其辞。该用户怀疑这些发布周帖子是<b>付费公关</b>或<b>跟风炒作</b>，不能真实反映模型的实际使用体验。","img":"","links":[{"url":"https://www.reddit.com/r/ClaudeAI/comments/1w8g9dx/am_i_the_only_one_noticing_the_same_pattern_with/"}],"section":"products","prior":null}]}