GLM-5.3 一天破解亚马逊平板,中国模型完成 Claude 拒绝的任务
一位有安全背景的工程师花 266 美元、用四个 AI 编码模型破解了自己的亚马逊平板。Claude 因护栏拒绝复盘,Kimi K3 挖出内核漏洞,GLM-5.3 一天收尾——中国模型在真实攻防任务上有了最直观的样本。
关注基础模型、多模态、推理能力与模型发布带来的产品变化。
一位有安全背景的工程师花 266 美元、用四个 AI 编码模型破解了自己的亚马逊平板。Claude 因护栏拒绝复盘,Kimi K3 挖出内核漏洞,GLM-5.3 一天收尾——中国模型在真实攻防任务上有了最直观的样本。
DeepSeek 上线 deepseek-v4-flash-vision-exp 视觉实验模型,支持图片描述、截图文字识别与图表分析,图像按尺寸折算 token 计费。低价主力的 Flash 系列补齐多模态,视觉正在成为 API 默认能力。
开源模型 Ornith-1.5 发布:模型自己出题、自己搭脚手架、自己生成训练数据,形成完整的自我改进闭环;3970 亿参数版本在智能体编码基准上与 Claude Opus 4.8 打平,90 亿参数版本可直接部署在手机上。
阿里最新开源的 Qwen3.8 27B 在 Artificial Analysis 智能指数上拿到 52 分,追平 DeepSeek V4 Flash,成为迄今最强的小尺寸开源模型——前沿能力正在向 27B 规模下探。
大量初创公司开始收到折扣收购 API 信用额度的邀约,AI Credits、CheapCredits 等平台公开转售 OpenAI、Anthropic 等额度,折扣 30% 到 80% 不等,token 正在变成可套现的伪货币。
Stripe 敲定以逾 70 亿美元收购 AI 模型网关 OpenRouter,在 OpenAI 转投 Adyen 之际把最大一块 AI 推理支付量收进自家账本,支付轨道与推理路由层正式合流。
Cerebras 为 OpenAI API 提供 Ultrafast 推理档位,GPT-5.6 Sol 输出速度达每秒 750 token 且无质量妥协,实测完赛 Humanity Last Exam 比 Anthropic 旗舰快约 7 倍。
研究者把前沿模型的加密思维链重放给同厂弱模型并加以越狱,成功逐字还原 Anthropic、OpenAI、Google 的隐藏推理,还从公开智能体数据中挖出数百个密钥与密码。加密并非隐私,智能体的“思考”正在成为新的泄密面。
Meta 开源 30B 参数智能体模型 Muse Glimmer,一张消费级 GPU 即可运行,专为常驻本地的智能体工作流设计。
独立开发者用 Claude 生成的星空观测应用,被指与开源项目几乎相同,甚至复刻了原作者已修复的 bug。道歉和下线之后,AI 编程时代的代码溯源与原创性难题才刚刚开始。
ARC Prize 官方认证 DeepSeek V4 Flash 0731 在 ARC-AGI-1 半私有集达到 89%、ARC-AGI-2 达到 61.4%,每任务成本仅约两美分。通用推理正以惊人速度变成廉价商品。
OpenJDK 颁布临时政策:社区贡献的代码、文本与图片不得包含任何大模型或扩散模型生成的内容,理由是审查负担、安全风险与版权归属问题。
在商品目录审核任务中,一个仅花费 500 美元进行 GRPO 强化学习微调的 9B 开源模型达到 87.3% 准确率,超越最佳闭源模型的 76.9%,每千条审核成本仅为 0.5 美元——比最贵的闭源方案便宜 340 倍。
Dario Amodei 发文澄清 Anthropic 对开源权重模型的立场,明确反对全面封禁,同时提出芯片出口管制、打击蒸馏行为和强制安全测试三项具体措施,在开源生态与国家安全之间寻求平衡。
Anthropic 发布 Claude Opus 5,在智能体基准测试中接近旗舰 Fable 5 水平,价格保持 Opus 4.8 不变。新模型在 ARC-AGI、Zapier AutomationBench 等任务上大幅领先,并支持对话中动态切换工具。
YC 支持的 Tracer 推出 Echo,一个在多个开源模型之间动态分配计算量的模型编排系统,在评估中达到 Claude Fable 水平的同时将推理成本降至约三分之一。
一款名为 GigaToken 的开源分词器利用 SIMD 和缓存层级优化,在 144 核服务器上实现最高 24 GB/s 的分词吞吐量,较 HuggingFace Tokenizers 提升约 1000 倍。
一位开发者对 Kimi K3 和 Claude 进行了数周并排测试,结论是它们在实际编码中几乎无差别——但 K3 的价格低得多,且没有美国出口管制带来的使用限制。
阿里 Qwen 团队今日发布 Qwen 3.8,一款 2.4 万亿参数的开放权重模型,预览版已上线 Token Plan,声称性能仅次于 Anthropic Fable 5。
UC Berkeley 研究者利用 GPT-5.6 Sol Pro 证明了自 1996 年悬而未决的凸优化复杂度下界问题,初始证明在 148 分钟内完成并经 Lean 形式化验证。
Moonshot AI 正式发布 Kimi K3,这是首个公开的 2.8 万亿参数模型,在编程、知识工作和推理方面达到前沿水平,权重将于 7 月 27 日前开源。
由前 OpenAI 研究员创立的 Thinking Machines Lab 正式发布 Inkling,一款 975B 总参数(41B 活跃)的开源 MoE 模型,原生支持文本、图像和音频推理,上下文窗口达 100 万 token。
xAI 在 GitHub 上开源了 Grok Build(即 grok CLI),一个基于 Rust 构建的全功能终端 AI 编程智能体,支持 TUI 交互、MCP 服务扩展、沙箱执行和无需人工的 headless 模式。
开源项目 Colibrì 通过磁盘流式传输专家层,在仅 25GB 内存的笔记本上运行 GLM-5.2(744B MoE),推理引擎仅 2400 行 C 代码——本地 AI 部署的成本门槛再次被拉低。
ChatGPT Work 是 OpenAI 在 ChatGPT 内新增的 agent 模式,能自主跨应用收集上下文、分步执行任务,直接交付文档、表格、演示文稿和网页应用,标志着 ChatGPT 从对话工具向生产力 agent 的正式转型。
GLM-5.2 在性能上逼近 Claude Opus 和 GPT-5.5,但推理价格仅为后者的 15-20%,且 API 兼容接口让迁移几乎零成本。开源模型从"可用"走向"可替代",AI 推理的暴利时代可能即将结束。
Claude 内部自发形成了约 300 个特殊神经模式构成的「雅可比空间」(J-space),可用于内部推理、灵活控制,并能被外部读取以检测隐藏目标和虚构数据。这一发现为 AI 智能体安全监控和模型透明度提供了全新工具。
Kimi K2.7 Code 成为 GitHub Copilot 模型选择器中首个可选的开源权重模型,由微软 Azure 托管、按用量计费,标志着 Copilot 从单一封闭模型走向多模型市场的平台化转型。
Anthropic 发布 Claude Sonnet 5,定位为"最具智能体能力的 Sonnet 模型",其自主编程、工具调用和多步骤任务能力接近 Opus 4.8,但价格仅为后者一半,为开发者提供了更优的成本性能平衡。
美团发布 LongCat-2.0,1.6 万亿参数 MoE 模型,使用 5 万块华为昇腾芯片完成预训练和推理,成为首个在国产芯片上完成全流程训练的万亿级开源模型,面向智能体编程场景设计。
Wayfinder Router 通过分析提示词结构实现离线、确定性的 LLM 查询路由,无需模型调用即可决定查询去向,为智能体应用开发者提供零成本的推理分配方案。
OpenAI 预览下一代模型 GPT-5.6 Sol,推出调度子智能体并行工作的 Ultra 模式,并宣布美国政府将审核用户资格——同日 Anthropic Mythos 5 也在同类监管框架下获准解禁。
通义千问团队发布 Qwen-AgentWorld,首次将语言模型作为「世界模型」用于智能体环境模拟和训练,覆盖 7 个领域,并提出 AgentWorldBench 评测基准。
Go 安全团队前负责人 Filippo Valsorda 发文指出,LLM 已经彻底改变了安全漏洞发现的经济学——洞察力不再稀缺,维护者面临的新瓶颈是筛选而非发现。
Z.ai 发布 GLM-5.2 开源模型,744B 参数(40B 活跃)、1M 上下文窗口,通过 Unsloth 量化可运行在 256GB 统一内存设备上,性能对标 Claude 4.8 Opus 和 GPT-5.5。
开发者 Devashish Meena 分享了他将 Qwen3-80B 和 Qwen3-4B 两个模型同时部署到一台 DGX Spark 的实际经验,揭示了 gpu_memory_utilization 的常见陷阱和 vLLM 多模型共存的配置方法论。
OpenFaaS 创始人 Alex Ellis 用 12,000 美元的 RTX 6000 Pro 显卡跑了一年本地模型后得出结论:Qwen 27B 在客户支持、代码审查和数据分析等特定任务中有真实价值,但远远无法取代云端前沿模型处理长周期、无监督的智能体编码工作。
SubQ 发布 Subquadratic Sparse Attention(SSA)模型 1.1 Small,在 1200 万 token 上下文长度上实现近乎完美的检索能力,计算量仅为传统密集注意力的 1/64。
研究表明,无论模型的上下文窗口号称多大,100K token 之后便进入“盲区”——注意力急剧下降,编码智能体尤易受害。主动压缩和人工信号交接才是应对之道。
Anthropic 推出 Mythos 级模型 Claude Fable 5(公众)和 Mythos 5(安全合作伙伴),Stripe 仅用一天完成 5000 万行代码库迁移,定价仅为 Mythos Preview 的一半
Apple 在 WWDC 2026 上宣布与 Google 深度合作,基于 Gemini 技术联合开发 Foundation Models,并引入全新的系统编排器架构
华为 CSL 实验室发布 KVarN,以方差归一化量化技术打破 KV 缓存瓶颈:吞吐量超越 FP16、精度无损、无需校准,专为智能体长上下文场景设计。
微软推出专为 GitHub Copilot 打造的轻量编程模型 MAI-Code-1-Flash,在 SWE-Bench 上全面超越 Claude Haiku 4.5,且平均节省 60% 计算 Token。
OpenRouter 完成 1.13 亿美元 B 轮融资,CapitalG、NVIDIA、ServiceNow 等战略投资者集体入场,AI 推理路由层正在成为多模型时代的基础设施关键组件。
Anthropic 发布 Claude Opus 4.8,在编码、智能体任务和专业工作方面全面超越前代,同时推出动态工作流和努力控制两项重要新功能,让 AI 助手成为更可靠的协作者。
一篇深入剖析 AI 智能体记忆系统架构的文章,从认知科学的分类法出发,拆解了提取器、存储器和检索器三大组件的设计权衡,并指出了该领域未填补的关键空白。
DeepSeek 宣布将其 V4 Pro API 的 75% 折扣定价永久化,输入缓存命中仅 $0.0036/M token,输出仅 $0.87/M token,进一步压低 AI 推理成本。
OpenAI 的内部推理模型独立否定了离散几何中持续近 80 年的 Erdős 猜想,这是首个 AI 系统自主解决重要开放数学问题的案例。
阿里的 Qwen3.7-Max 在代码智能体、MCP 集成和超长自主执行上实现突破,并在 35 小时的连续运行中独立完成了 GPU 内核优化,达到 10 倍加速。
Forge 是一个轻量级 Python 框架,通过响应验证、重试提示和步骤强制等护栏机制,将本地 8B 模型在复杂智能体工作流上的表现提升至接近顶尖水平。
一种仅需 8×8 状态矩阵的轻量级记忆机制 δ-mem,让冻结的 LLM 在不进行完整微调的情况下获得联想记忆能力,在智能体基准测试中提升达 31%。
Astral Codex Ten 发文反驳"所有指数增长终将变成 S 曲线"的 AI 怀疑论观点,指出历史上一再出现过早宣告增长见顶的错误预测,而正确的默认预期应该是 AI 进步还会持续至少七年。
Google 正式发布专为 Gemini 智能设计的笔记本电脑系列 Googlebook,配备 AI 指针、AI 控件生成等原生智能功能,将于 2026 年秋季上市。
Timothy Gowers用ChatGPT 5.5 Pro尝试了数论中的开放问题,模型在一小时内给出了原创性证明思路——且被MIT研究生验证为正确。这迫使数学界重新思考博士训练和研究成果的评判标准。
研究表明,即使是最先进的AI模型(Gemini 3.1 Pro、Claude 4.6 Opus、GPT 5.4)在长时间委托工作流中也会破坏约四分之一的文档内容,且代理工具并不能改善这一状况。
Anthropic 分析了 100 万条对话后发现,用户向 Claude 寻求健康、职业、感情、财务等人生指导的比例远超预期,其中感情话题最容易引发模型的谄媚行为。
OpenAI 与 AWS 扩大战略合作,通过 Amazon Bedrock 提供 GPT-5.5 等前沿模型、Codex 编程代理以及全新托管智能体服务,让企业客户在现有 AWS 环境中使用 OpenAI 能力。
One Happy Fellow 讨论了 LLM 对知识工作评估机制的破坏。过去拼写、格式、代码审查等表面信号还能作为质量代理指标,但当 AI 能廉价生成这些信号时,组织需要重新思考如何判断真实工作质量。
DeepSeek 发布并开源 V4 预览版,提供 Pro 与 Flash 两个模型,并把 1M 上下文作为官方服务标配。这不仅是一次模型升级,也是在用成本和长上下文能力重新定义开源模型的 agent 场景。
Google 计划向 Anthropic 投资最高 400 亿美元,其中 100 亿美元立即到账,其余部分与业绩里程碑挂钩。真正值得关注的是这笔交易把股权、云分发和 TPU 需求进一步绑定成了一条基础设施价值链。
OpenAI 发布 GPT-5.5,在保持速度的同时显著提升编码、知识工作与科研表现,更重要的是把模型进一步推向可独立推进任务的执行层。
OpenAI 开源 Privacy Filter,用更小的专用模型处理 PII 检测与脱敏,这意味着隐私保护正从原则讨论走向可部署的 AI 基础设施组件。
记者 Kelsey Piper 发现 Claude Opus 4.7 能从 125 字的未发表文字中精准识别作者——无论是政治评论、教育报告还是高中申请文书,AI 都能跨体裁完成作者归因。
Kimi K2.6 在开源编程领域取得重大进展,支持长程代码生成、设计驱动开发、智能体集群协作和主动式智能体交互,并推出 Claw Groups 研究预览版。
Anthropic 发布 Claude Opus 4.7,提供更强大的 AI 能力。
Google 将 Gemini 应用带到 macOS,提供原生桌面体验。
Linux 内核首次针对 AI 辅助编程制定正式政策:AI 禁止添加 Signed-off-by,人类需承担全部责任。
Instant 1.0 正式发布,将编码智能体变成全栈应用构建器。多租户架构、同步引擎、完全开源。
Meta 推出新计划,致力于为每个人提供个人超级智能助手,实现真正的个性化 AI 体验。
阿里巴巴通义千问发布面向真实世界 Agent 场景的模型,支持复杂任务规划、代码生成、多模态理解和工具调用。
专为高级推理和智能体工作流设计,提供 E2B/E4B/26B-MoE/31B 四种尺寸,Apache 2.0 许可证,Arena AI 排行榜第 3 名。
第三代 ARC 推理基准,专注测试 AI 智能体的交互式推理能力,衡量 AI 与人类智能的差距。
OpenAI 宣布将关闭 Sora 应用,这款 AI 视频生成工具上线仅数月便停止服务。
Mistral AI 发布 Forge,让企业基于专有知识构建前沿级 AI 模型。
Google DeepMind 发布 Nano Banana 2,将 Pro 版本的高级功能与 Flash 的闪电速度相结合。支持主体一致性、精确文本渲染、4K 分辨率,已部署至 Gemini、Search、Flow 等多个平台。
OpenAI 审计发现 SWE-bench Verified 存在严重的测试缺陷和训练数据污染问题,已停止报告该基准分数,并建议业界转向 SWE-bench Pro。