1. Anthropic 扔了个大炸弹,Claude Apps Gateway 开源了
今天早上最炸的新闻,Anthropic 发布了 Claude Apps Gateway。这玩意其实就是一个自托管的控制面板,让你在 Amazon Bedrock 或者 Google Cloud 上跑 Claude Code 智能体集群。
我第一反应是,哇,Anthropic 这次是真要把企业市场拿下了。它不是简单地给个 API,而是给你完整的 SSO(OIDC 支持 Google Workspace、Microsoft Entra ID、Okta)、权限管理、路由容错、用量限额,按 org 按组按用户设置每日每周每月的消耗上限。其实就是那种大企业采购之前一定会问「你有这个吗」的功能清单,现在全给了。
而且更骚的是这玩意是一个单 stateless Linux 容器加 PostgreSQL 后端,Telemetry 走 OTLP 到你自己配的收集器。没有任何推理流量被送到 Anthropic(除非你用 Claude API),想怎么部署怎么部署。我刚看到这条消息的时候愣了一下,开源一个企业级的 AI gateway,这想法太狠了。竞争对手要么跟进,要么掉队。
同一天 Claude 在 Microsoft Foundry 也正式可用了。双管齐下,一边 AWS 和 GCP,一边 Azure。Anthropic 的企业份额超过 OpenAI 那可不是偶然。
说到这块我多说一句,Anthropic 最近的动作密度真的大到离谱。从 Mythos 和 Fable 系列到现在的 gateway,再到传闻已经秘密提交了 IPO 申请,感觉他们正在从一个 AI 研究公司变成一个完整的企业基础设施公司。
2. 美团训练了一个国产 ASIC 模型,结果成了 OpenRouter 最火
今天另一个让我反复确认了好几遍的新闻。美团搞的 LongCat Owl Alpha,1.6 万亿参数的 MoE 模型,完全用 5 万块国产 ASIC 芯片训练出来的,成了 OpenRouter 上最流行的模型,消耗了超过 10 万亿个 token。
对,你没看错。不是 NVIDIA GPU,是国产 ASIC。在当前这个 GPU 到处缺货而且被限购的背景下,这个新闻的重量你可能需要停下来想一下。
性能方面,LongCat Owl Alpha 跟 Gemini/Opus 4.6 相当,训练用了 35 万亿个 token。而且它现在的每日调用量排全球前三,排在 Hermes Agent 和 Claude Code 之后。30 万亿 token 训练,纯国产 ASIC,没有一块 NVIDIA GPU,却达到了全球最强闭源模型的水准。这事让我觉得有点恍惚。
还有一条消息也在说同一个方向。因为 AI 账单失控,越来越多的美国企业开始把工作负载切换到 DeepSeek V4。有些企业甚至直接 100% 切了过去。DeepSeek 那边也开源了 DSpark 投机解码框架,能把 DeepSeek-V4 的生成速度再拉高 60-85%。成本优势这个东西,有时候是能改写市场格局的。
3. NVIDIA 那边出了坏消息,Rubin Ultra 被砍了
SemiAnalysis 那边爆出来的,NVIDIA 取消了 Rubin Ultra 项目。新版尺寸和性能直接减半。
这条消息在行业里引起的震动其实挺大的。整个 AI 算力市场的预期是建立在一个假设上的,NVIDIA 会保持一年一代的迭代节奏,每一代性能翻倍。如果这个节奏被打断了,市场格局就可能发生变化。
你想想,一边是 NVIDIA 的旗舰项目被砍,一边是美团用国产 ASIC 训出了全球顶级的模型。这两个放在一起看,真的很难不让人想多一点。
4. 智能体上手机了,OpenClaw 和 Cursor 都要
今天移动端也有两个大消息。OpenClaw 正式发布了 iOS 和 Android 原生应用。你可以理解为,那个以前只能在电脑上跑的 AI 智能体,现在揣口袋里随身带了。channels、tasks、replies 这些核心功能在手机上全能用。
Cursor 也不甘示弱,iOS 公测版同时上线。所有付费计划的用户都能用,支持语音输入、斜杠命令,还可以远程控制桌面上的 agent。甚至有个很骚的功能是锁屏 Live Activities 和推送通知告诉你 agent 状态。cloud agents 跑在隔离的虚拟机上,自动生成合并好的 PR,连 demo 和日志都给你配齐了。
而且 Cursor 还搞了个半价优惠,Mobile Composer 2.5 打 75 折,到 7 月 5 号截止。这波促销时间很短,明显是想快速拉一波移动端用户数据。
另外还有一个叫 Herdr 的开源工具,干的事也挺有意思,在同一个终端里管理和切换多个 AI 智能体会话。不是那种取代 Cursor 或 Claude Code 的产品,而是一个让你在终端里同时跑多个 agent 会话还能方便切来切去的工具。我觉得这个方向挺对的,很多开发者的工作流里已经不是一个 agent 在跑了,是一群。
5. Qwen 3.6 27B,可能是目前最好的本地模型
今天有一条让我特别兴奋的消息。Qwen 3.6 27B,一个纯 Dense 架构的模型,原生支持 256K 上下文。有人实测在 Macbook Max M5 上跑 llama.cpp Q8_0 量化版本大概是每秒 30 个 token,RTX 5090 上跑 Q6_K 大概每秒 50 个 token。
有个人用它生成了一个七言律诗和一个六边形扫雷游戏(用 pnpm),全部只靠一个 prompt 搞定。有个作者甚至说这是「第一个真正意义上通用的本地模型」。
我跟你说我读到这句话的时候,是真的有点激动。我不是那种追求本地模型参数多少多少的人,但一个 27B 的模型能跑到这个水平,说明我们离「在自己的电脑上跑一个够用的 AI」这件事越来越近了。还有 35B A3B 的 MoE 变体,但作者更推荐 27B 的 dense 版本。
6. 3B 参数的小模型,在数学上打平了 200 倍大的 DeepSeek V3.2
新浪开源了一个叫 VibeThinker-3B 的模型,只有 3B 参数,但是在 AIME26 数学和编程基准上跟 200 到 333 倍大的 DeepSeek V3.2 打成了平手。LiveCodeBench 上更是吊打了所有 20B 以下的模型。LeetCode 128 道题里解对了 123 道,超过了 GPT-5.2 和 Kimi K2.5。
不过它也有明显的短板,在知识密集型任务上表现不佳。GPQA-Diamond 这个需要大量事实性知识的基准上就比较弱。这个可以理解,参数就那么多,推理能力可以靠训练技巧压缩,但事实知识这种东西确实需要参数规模来承载。
但它给了一个很重要的启示,推理能力是可以压缩到小模型里的,但知识不行。
7. SpaceX xAI 合并,Grok 4.5 私测
Musk 那边今天也有动作。SpaceX 注册了 SpaceXAI 的商标,并且要把 xAI 整个合并进来。同时 Grok 4.5 已经开始在 SpaceX 和 Tesla 内部私测了,据说性能接近 Opus 水平。
这条消息跟 SpaceX 之前收购 Cursor 的新闻放在一起看,意思就很清楚了。Musk 在搞一个从芯片到模型到应用的全栈 AI 帝国。从 Grok 到 Cursor 到 SpaceXAI,这哥们是真的想把所有拼图都凑齐。
8. 还有一堆,我快速过一遍
今天消息实在太多,剩下的我快速串一遍。
EverOS 开源了,一个 Markdown 优先的智能体记忆运行时。Apache 2.0 许可,SQLite 状态管理,LanceDB 混合检索(BM25 + 向量 + 标量过滤),每个任务记录为一个 Case,离线蒸馏成可复用的 Skill,自进化。LoCoMo 93.05%,LongMemEval 83%,HaluMem 93.04%,p95 检索延迟不到 500ms。支持 OpenAI 协议兼容的端点。做 agent 记忆层的朋友可以重点看一下。
Wayfinder Router 和 Weave 今天同时发布了模型路由方案。Wayfinder 走的是确定性路由路线,微秒级决策,完全离线,通过分析 prompt 结构来决定走本地还是托管模型。Weave 则用了 Avengers-Pro 1 集群打分器做智能选择。两个思路完全不同。但我自己的感受是,确定性路由的方案在大规模生产环境中可能更靠谱,因为可控。
Adrafinil 是一个很细的产品但我觉得很有意思。一个 Mac 菜单栏工具,只在你跑 AI agent(Claude Code、Codex、Cursor、Gemini CLI、Aider、Hermes、OpenCode 这些)的时候阻止电脑休眠,包括合盖。你说它有多大用?不大。但就是这种小东西,能让整天跑 agent 的人不用再一直惦记着电脑别睡着。
Meta 那边发了 Brain2Qwerty v2,非侵入式的实时句子解码。简单说就是读脑电波转文字,准确率比 v1 大幅提升。这个方向如果有突破,影响力可能比任何人都想象的要大。
小红书开源了它们的 RedKnot 推理引擎,把 KV Cache 按注意力头拆解来做长文本加速。
还有一条让我不知道该说什么的消息。美军用 AI 选目标,结果误炸了伊朗的一所学校。Anthropic 的 Claude 嵌入 Palantir 系统后第一天就建议了约 1000 个目标。这事太复杂了,我不好多评论,但你想想,AI 选目标炸学校这个问题,人类到底准备好面对了吗?
另外纽约时报修订了诉讼,指控微软为 OpenAI 建造了一个专门用来侵犯版权的超级计算机。
Runway API 出了广告本地化的 Recipe,一个 API 调用就能翻译和本地化静态广告素材。
Qwen 输入法也出 macOS 版了,AI 语音输入最快 300 字/分,支持 9 种方言自动润色,无广告。iOS、Android、Windows 版后续跟上。
还有阿里的千问不是那个千问,是 Qwen 的中文名。这个消息其实也说明一件事,AI 输入法这个赛道比大多数人想象的更大,语音输入才是真正的交互革命,打字只是过渡。
9. AI 账单失控后,DeepSeek 成了香饽饽
今天有一条消息我觉得是很多大公司现在正在经历的真实疼痛。AI 账单失控,部分美国企业已经 100% 切换到 DeepSeek。我为什么单独拎出来说,因为这不是一个技术问题,这是经济问题。
当你的 Copilot Cowork 用户每周执行数百项任务导致成本激增,当微软都在考虑给 Copilot 换 DeepSeek V4 的时候,你就知道「AI 太贵」这件事不是一个段子。OpenAI 和 Anthropic 的 API 价格在涨,但 DeepSeek 的价格却在降。
Tomer Tunguz 那边有一篇分析,算了一笔账,当 AI 成本超过工程师薪酬的时候,企业会怎么选?答案已经很明显了。企业不会无限为 AI 付费,他们会找更便宜的替代方案。而 DeepSeek 就是那个替代方案。
10. 读脑的 Meta,和读心的未来
最后说一个让我觉得既兴奋又有点毛骨悚然的消息。Meta 的 Brain2Qwerty v2,非侵入式实时句子解码。你不需要做开颅手术,不需要植入芯片,戴个设备就能把你的脑电波翻译成文字。
v1 的时候准确率其实还挺粗糙的,但 v2 的提升幅度很大。我自己的感觉是这个东西一旦跨过某个准确率阈值,应用场景会爆炸。无障碍沟通、意念打字、甚至以后的「不用开口就能发消息」,这些都不再是科幻。
当然隐患也很明显。你的脑子在想什么,别人也能知道。这个隐私问题如果不从一开始就设计好,后患无穷。
— 全文完 —
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标~
谢谢你看我的文章,我们,下次再见。
/ 作者 卡兹克
/ 投稿或爆料请联系 wzglyay@virxact.com