AI 日报 2026.06.30,Claude Apps Gateway 开源与美团国产 ASIC 模型登顶
1. Anthropic 扔了个大炸弹,Claude Apps Gateway 开源了
今天早上最炸的新闻,Anthropic 发布了 Claude Apps Gateway。这玩意其实就是一个自托管的控制面板,让你在 Amazon Bedrock 或者 Google Cloud 上跑 Claude Code 智能体集群。
我第一反应是,哇,Anthropic 这次是真要把企业市场拿下了。它不是简单地给个 API,而是给你完整的 SSO(OIDC 支持 Google Workspace、Microsoft Entra ID、Okta)、权限管理、路由容错、用量限额,按 org 按组按用户设置每日每周每月的消耗上限。其实就是那种大企业采购之前一定会问「你有这个吗」的功能清单,现在全给了。
而且更骚的是这玩意是一个单 stateless Linux 容器加 PostgreSQL 后端,Telemetry 走 OTLP 到你自己配的收集器。没有任何推理流量被送到 Anthropic(除非你用 Claude API),想怎么部署怎么部署。我刚看到这条消息的时候愣了一下,开源一个企业级的 AI gateway,这想法太狠了。竞争对手要么跟进,要么掉队。
同一天 Claude 在 Microsoft Foundry 也正式可用了。双管齐下,一边 AWS 和 GCP,一边 Azure。Anthropic 的企业份额超过 OpenAI 那可不是偶然。
说到这块我多说一句,Anthropic 最近的动作密度真的大到离谱。从 Mythos 和 Fable 系列到现在的 gateway,再到传闻已经秘密提交了 IPO 申请,感觉他们正在从一个 AI 研究公司变成一个完整的企业基础设施公司。
2. 美团训练了一个国产 ASIC 模型,结果成了 OpenRouter 最火
今天另一个让我反复确认了好几遍的新闻。美团搞的 LongCat Owl Alpha,1.6 万亿参数的 MoE 模型,完全用 5 万块国产 ASIC 芯片训练出来的,成了 OpenRouter 上最流行的模型,消耗了超过 10 万亿个 token。
对,你没看错。不是 NVIDIA GPU,是国产 ASIC。在当前这个 GPU 到处缺货而且被限购的背景下,这个新闻的重量你可能需要停下来想一下。
性能方面,LongCat Owl Alpha 跟 Gemini/Opus 4.6 相当,训练用了 35 万亿个 token。而且它现在的每日调用量排全球前三,排在 Hermes Agent 和 Claude Code 之后。30 万亿 token 训练,纯国产 ASIC,没有一块 NVIDIA GPU,却达到了全球最强闭源模型的水准。这事让我觉得有点恍惚。
还有一条消息也在说同一个方向。因为 AI 账单失控,越来越多的美国企业开始把工作负载切换到 DeepSeek V4。有些企业甚至直接 100% 切了过去。DeepSeek 那边也开源了 DSpark 投机解码框架,能把 DeepSeek-V4 的生成速度再拉高 60-85%。成本优势这个东西,有时候是能改写市场格局的。
3. NVIDIA 那边出了坏消息,Rubin Ultra 被砍了
SemiAnalysis 那边爆出来的,NVIDIA 取消了 Rubin Ultra 项目。新版尺寸和性能直接减半。
这条消息在行业里引起的震动其实挺大的。整个 AI 算力市场的预期是建立在一个假设上的,NVIDIA 会保持一年一代的迭代节奏,每一代性能翻倍。如果这个节奏被打断了,市场格局就可能发生变化。
你想想,一边是 NVIDIA 的旗舰项目被砍,一边是美团用国产 ASIC 训出了全球顶级的模型。这两个放在一起看,真的很难不让人想多一点。
4. 智能体上手机了,OpenClaw 和 Cursor 都要
今天移动端也有两个大消息。OpenClaw 正式发布了 iOS 和 Android 原生应用。你可以理解为,那个以前只能在电脑上跑的 AI 智能体,现在揣口袋里随身带了。channels、tasks、replies 这些核心功能在手机上全能用。
Cursor 也不甘示弱,iOS 公测版同时上线。所有付费计划的用户都能用,支持语音输入、斜杠命令,还可以远程控制桌面上的 agent。甚至有个很骚的功能是锁屏 Live Activities 和推送通知告诉你 agent 状态。cloud agents 跑在隔离的虚拟机上,自动生成合并好的 PR,连 demo 和日志都给你配齐了。
而且 Cursor 还搞了个半价优惠,Mobile Composer 2.5 打 75 折,到 7 月 5 号截止。这波促销时间很短,明显是想快速拉一波移动端用户数据。
另外还有一个叫 Herdr 的开源工具,干的事也挺有意思,在同一个终端里管理和切换多个 AI 智能体会话。不是那种取代 Cursor 或 Claude Code 的产品,而是一个让你在终端里同时跑多个 agent 会话还能方便切来切去的工具。我觉得这个方向挺对的,很多开发者的工作流里已经不是一个 agent 在跑了,是一群。
5. Qwen 3.6 27B,可能是目前最好的本地模型
今天有一条让我特别兴奋的消息。Qwen 3.6 27B,一个纯 Dense 架构的模型,原生支持 256K 上下文。有人实测在 Macbook Max M5 上跑 llama.cpp Q8_0 量化版本大概是每秒 30 个 token,RTX 5090 上跑 Q6_K 大概每秒 50 个 token。
有个人用它生成了一个七言律诗和一个六边形扫雷游戏(用 pnpm),全部只靠一个 prompt 搞定。有个作者甚至说这是「第一个真正意义上通用的本地模型」。
我跟你说我读到这句话的时候,是真的有点激动。我不是那种追求本地模型参数多少多少的人,但一个 27B 的模型能跑到这个水平,说明我们离「在自己的电脑上跑一个够用的 AI」这件事越来越近了。还有 35B A3B 的 MoE 变体,但作者更推荐 27B 的 dense 版本。
6. 3B 参数的小模型,在数学上打平了 200 倍大的 DeepSeek V3.2
新浪开源了一个叫 VibeThinker-3B 的模型,只有 3B 参数,但是在 AIME26 数学和编程基准上跟 200 到 333 倍大的 DeepSeek V3.2 打成了平手。LiveCodeBench 上更是吊打了所有 20B 以下的模型。LeetCode 128 道题里解对了 123 道,超过了 GPT-5.2 和 Kimi K2.5。
不过它也有明显的短板,在知识密集型任务上表现不佳。GPQA-Diamond 这个需要大量事实性知识的基准上就比较弱。这个可以理解,参数就那么多,推理能力可以靠训练技巧压缩,但事实知识这种东西确实需要参数规模来承载。
但它给了一个很重要的启示,推理能力是可以压缩到小模型里的,但知识不行。
7. SpaceX xAI 合并,Grok 4.5 私测
Musk 那边今天也有动作。SpaceX 注册了 SpaceXAI 的商标,并且要把 xAI 整个合并进来。同时 Grok 4.5 已经开始在 SpaceX 和 Tesla 内部私测了,据说性能接近 Opus 水平。
这条消息跟 SpaceX 之前收购 Cursor 的新闻放在一起看,意思就很清楚了。Musk 在搞一个从芯片到模型到应用的全栈 AI 帝国。从 Grok 到 Cursor 到 SpaceXAI,这哥们是真的想把所有拼图都凑齐。
8. 还有一堆,我快速过一遍
今天消息实在太多,剩下的我快速串一遍。
EverOS 开源了,一个 Markdown 优先的智能体记忆运行时。Apache 2.0 许可,SQLite 状态管理,LanceDB 混合检索(BM25 + 向量 + 标量过滤),每个任务记录为一个 Case,离线蒸馏成可复用的 Skill,自进化。LoCoMo 93.05%,LongMemEval 83%,HaluMem 93.04%,p95 检索延迟不到 500ms。支持 OpenAI 协议兼容的端点。做 agent 记忆层的朋友可以重点看一下。
Wayfinder Router 和 Weave 今天同时发布了模型路由方案。Wayfinder 走的是确定性路由路线,微秒级决策,完全离线,通过分析 prompt 结构来决定走本地还是托管模型。Weave 则用了 Avengers-Pro 1 集群打分器做智能选择。两个思路完全不同。但我自己的感受是,确定性路由的方案在大规模生产环境中可能更靠谱,因为可控。
Adrafinil 是一个很细的产品但我觉得很有意思。一个 Mac 菜单栏工具,只在你跑 AI agent(Claude Code、Codex、Cursor、Gemini CLI、Aider、Hermes、OpenCode 这些)的时候阻止电脑休眠,包括合盖。你说它有多大用?不大。但就是这种小东西,能让整天跑 agent 的人不用再一直惦记着电脑别睡着。
Meta 那边发了 Brain2Qwerty v2,非侵入式的实时句子解码。简单说就是读脑电波转文字,准确率比 v1 大幅提升。这个方向如果有突破,影响力可能比任何人都想象的要大。
小红书开源了它们的 RedKnot 推理引擎,把 KV Cache 按注意力头拆解来做长文本加速。
还有一条让我不知道该说什么的消息。美军用 AI 选目标,结果误炸了伊朗的一所学校。Anthropic 的 Claude 嵌入 Palantir 系统后第一天就建议了约 1000 个目标。这事太复杂了,我不好多评论,但你想想,AI 选目标炸学校这个问题,人类到底准备好面对了吗?
另外纽约时报修订了诉讼,指控微软为 OpenAI 建造了一个专门用来侵犯版权的超级计算机。
Runway API 出了广告本地化的 Recipe,一个 API 调用就能翻译和本地化静态广告素材。
Qwen 输入法也出 macOS 版了,AI 语音输入最快 300 字/分,支持 9 种方言自动润色,无广告。iOS、Android、Windows 版后续跟上。
还有阿里的千问不是那个千问,是 Qwen 的中文名。这个消息其实也说明一件事,AI 输入法这个赛道比大多数人想象的更大,语音输入才是真正的交互革命,打字只是过渡。
9. AI 账单失控后,DeepSeek 成了香饽饽
今天有一条消息我觉得是很多大公司现在正在经历的真实疼痛。AI 账单失控,部分美国企业已经 100% 切换到 DeepSeek。我为什么单独拎出来说,因为这不是一个技术问题,这是经济问题。
当你的 Copilot Cowork 用户每周执行数百项任务导致成本激增,当微软都在考虑给 Copilot 换 DeepSeek V4 的时候,你就知道「AI 太贵」这件事不是一个段子。OpenAI 和 Anthropic 的 API 价格在涨,但 DeepSeek 的价格却在降。
Tomer Tunguz 那边有一篇分析,算了一笔账,当 AI 成本超过工程师薪酬的时候,企业会怎么选?答案已经很明显了。企业不会无限为 AI 付费,他们会找更便宜的替代方案。而 DeepSeek 就是那个替代方案。
10. 读脑的 Meta,和读心的未来
最后说一个让我觉得既兴奋又有点毛骨悚然的消息。Meta 的 Brain2Qwerty v2,非侵入式实时句子解码。你不需要做开颅手术,不需要植入芯片,戴个设备就能把你的脑电波翻译成文字。
v1 的时候准确率其实还挺粗糙的,但 v2 的提升幅度很大。我自己的感觉是这个东西一旦跨过某个准确率阈值,应用场景会爆炸。无障碍沟通、意念打字、甚至以后的「不用开口就能发消息」,这些都不再是科幻。
当然隐患也很明显。你的脑子在想什么,别人也能知道。这个隐私问题如果不从一开始就设计好,后患无穷。
今天先聊到这
今天的信息量是真的顶。从 Anthropic 开源企业级 Claude Gateway 到美团国产 ASIC 模型登顶 OpenRouter,从 NVIDIA Rubin Ultra 被砍到智能体全面上手机,从 Qwen 3.6 27B 这个最佳本地模型到 3B 的小模型靠推理打平 200 倍大的对手。
每条单独拿出来都是值得深度聊的大新闻,但在 2026 年 6 月的最后一天,它们全挤在一起了。这个行业的速度已经快到让人有点恍惚,但说实话,这种感觉挺爽的。你永远不知道第二天早上醒来会看到什么。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标~
谢谢你看我的文章,我们,下次再见。