MCP一周年:从“AI世界的USB-C”到行业集体倒戈

一、背景与核心事件

MCP(Model Context Protocol) 由 Anthropic 于 2024 年 11 月推出,旨在统一大模型与外部工具、数据源的连接方式,被比喻为“AI 世界的 USB-C”。

一年后(2026年),MCP 并未迎来庆祝,而是被多家头部公司放弃或拒绝。

关键转折点:

  • Perplexity CTO Denis Yarats 于 2026 年 3 月宣布放弃 MCP,转向 API 和 CLI。
  • OpenClaw(GitHub 上全球第一的开源 AI Agent 项目,创始人已加入 OpenAI)从一开始就不支持 MCP,改用 Skills 系统 + CLI。

网友评论普遍支持这一转向,认为“早该如此”。

二、MCP 的三个致命缺陷

1. 线性上下文成本

MCP 将每个工具的名称、描述、参数 Schema 全部注入 Agent 的上下文窗口。连接 10 个服务、每个 5 个工具,数千 Token 在任务开始前已被消耗。

  • 社区反馈:仅一个 Playwright MCP Server 就占用 200K 上下文窗口的 8%。
  • Anthropic 自己的工程博客也在探索用代码交互代替工具调用,Token 使用量从 150,000 降至 2,000。

2. 使用摩擦大

  • 初始化地狱:配置错误、环境变量遗漏、端口冲突,需反复重启和清空。
  • 认证疲劳:需频繁处理 GitHub Token、数据库密码、云服务 Key,且常失效。
  • 权限粗糙:缺乏细粒度控制,如“只读”或“只查某张表”。

3. 安全黑天鹅

MCP 引入新的攻击面:Prompt Injection 可通过工具返回的数据注入恶意指令。相比之下,CLI 沙箱执行的命令完全可审计,安全性更高。

三、行业倒戈案例

1. Perplexity(估值 180 亿美元的 AI 独角兽)

在实际使用中遭遇上述所有问题,最终选择“止损”,放弃 MCP。

2. OpenClaw(GitHub 第一 AI Agent 项目)

从一开始就拒绝 MCP,采用 Skills 系统 + CLI。核心区别对比:

维度 MCP OpenClaw Skills
加载方式 预加载所有工具定义 按需加载
上下文成本 线性增长 最小化
知识注入 只定义工具接口 还包含领域知识
底层执行 JSON-RPC CLI/API

一句话总结:MCP 解决了“能连接”,Skills 解决了“会使用”。

3. 三巨头全部拥抱 CLI

2025 年,Anthropic Claude Code、Google Gemini CLI、OpenAI Codex CLI 几乎同时发布。它们都直接执行 Shell 命令,没有一个选择 MCP。

四、CLI 凭什么赢

1. 透明与可组合

CLI 下的每条命令清晰可见,例如:

kubectl logs -n prod deployment/api --since=1h | grep ERROR | sort | uniq -c | sort -rn | head -20

五个简单命令通过管道串联,完成复杂日志分析。管道是数据在进程间直接流动,MCP 是数据在模型上下文里反复折叠。

2. LLM 天生会用

主流 LLM 在大量 man 手册、Shell 脚本、Stack Overflow 中训练过,天生擅长使用 git、curl、grep 等命令。调用 MCP 的 jira_get_issue 类工具(可能不在训练数据中),不如直接给模型一个 jira issue view 命令。

3. 执行即理解

  • MCP:把工具能力描述给模型看。
  • CLI:让模型直接执行。

描述永远有损,执行是最好的理解——模型跑一条命令,看输出,再调整下一步,形成高效的 REPL 循环。

五、MCP 的未来:不会死,但会下沉

类比历史演变:

类比 “协议层” “直接操作层”
Web 服务 SOAP/WSDL REST/HTTP
容器编排 Mesos/DCOS Docker CLI + K8s
AI 工具 MCP CLI + Skills

每次,更简单、更直接的方案都赢了开发者市场。MCP 仍可能在企业 IT 集成、统一鉴权审计、跨组织边界标准等场景中发挥作用。但对于开发者日常工具交互,CLI 已胜出。

六、建议

  • 工具开发者:优先提供 CLI,写好 –help 和文档,支持管道。
  • AI 应用开发者:终端优先,考虑 Skills 模式,MCP 作为后备。
  • 普通开发者:学好 Shell,拥抱 CLI Agent,别囤 MCP Server。

七、总结观点

技术世界有一条规律:看起来“落后”的方案,往往比看起来“先进”的活得更久。REST 活过 SOAP,Docker CLI 活过 Mesos,原因相同:不需要你学习新东西,只是让你已经会的东西变得更强。

不需要 JSON-RPC,不需要 Schema,不需要 Server。你说一句话,Agent 在终端里帮你搞定。

终端,是人类与计算机对话的第一个界面。当 AI 真正成熟的那天,它可能也是最后一个。

DeepSeek-V4-Flash 正式发布

🎉 DeepSeek-V4-Flash 正式版 API 已上线公测,Agent 能力大幅增强;V4-Pro 暂未变动。

一、核心变化速览

项目变化
API 状态正式版上线公测 ✅
Agent 能力大幅增强,基准测试远超 V4-Pro-Preview
API 格式原生支持 Responses API,针对性适配 Codex
V4-Pro暂未变动
模型版本V4-Flash-0731

二、Agent 能力大幅增强

正式版 V4-Flash 在 Agent 任务上表现显著提升,基准测试远超 V4-Pro-Preview

基准测试得分
Terminal Bench 2.182.7
NL2Repo54.2
Cybergym76.7
DeepSWE54.4
Toolathlon verified70.3
Agent Last Exam25.2
Automation Bench (Public)25.1
DSBench-FullStack68.7
DSBench-Hard59.6

测试说明
注1:对于公开基准测试集中的 Code Agent 任务,正式版 V4-Flash 使用 DeepSeek Harness 极简模式(即将发布)作为测试框架,采用 max 档位,topp=0.95temperature=1.0
注2:DSBench-FullStack 为内部全栈开发测试集;DSBench-Hard 为内部 Coding Agent 难题测试集。

三、接口与集成支持

正式版 V4-Flash 原生支持 Responses API 格式,并针对 Codex 做了针对性适配。具体配置方法请参考官方文档:DeepSeek 官方配置文档

四、版本说明

DeepSeek-V4-Flash-0731 的模型结构、尺寸与 V4-Flash-Preview 保持一致,仅重新进行了后训练

⚠️ 重要提醒

本次仅升级了 V4-Flash 的 API 接口,以下内容未做任何更改

  • DeepSeek-V4-Pro API
  • APP / WEB 端模型

Kimi K3 正式发布

月之暗面今日凌晨正式推出其迄今能力最强的模型 —— Kimi K3,一个 2.8 万亿参数的开源模型,面向长程编程、知识工作和推理等前沿智能场景设计。这是全球首个开源的 3 万亿级别模型。

Kimi K3 发布公告

核心要点

  • 2.8 万亿参数,全球首个开源 3 万亿级别模型
  • KDA 混合线性注意力机制 + 注意力残差技术
  • 原生支持视觉理解,100 万 token 上下文窗口
  • MoE 稀疏度扩大:896 个专家中激活 16 个
  • 相比 K2 整体扩展效率提升约 2.5 倍
  • 从 SFT 阶段采用量化感知训练(MXFP4/MXFP8)
  • 擅长长程编程、视觉推理和端到端知识工作
Kimi K3 架构

架构创新

Kimi K3 基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建。KDA 为注意力扩展提供高效基础,AttnRes 有选择地跨深度检索表示,二者共同使模型能扩展到万亿参数以上规模。

MoE 架构

结合 Stable LatentMoE 框架,模型可在 896 个专家中高效激活 16 个。Quantile Balancing 和 Per-Head Muon 让大规模训练更自适应。

评测对比

性能表现

虽然 Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但在整套评测中展现出前沿水平的能力,并稳定超过了其他所有模型。

评测数据
能力展示

可用性

  • 用户可通过 kimi.com、Kimi 手机 App、Kimi Work 桌面客户端、Kimi Code 和 Kimi API 使用
  • 当前默认思考强度为 max(极致),后续增加 low 和 high 模式
  • 完整模型权重将于 2026 年 7 月 27 日前发布
  • 已向 vLLM 社区贡献 KDA 实现

来源:开源中国(OSCHINA)

GLM-5.2:Z.ai 发布旗舰开源模型,1M 可用上下文挑战闭源长程任务

Z.ai 发布 GLM-5.2,1M 可用上下文 + 多级思考力度控制,开源模型首次挑战闭源旗舰长程任务能力


一、GLM-5.2 是什么

GLM-5.2 是 Z.ai 面向长程任务时代的旗舰模型。核心亮点是一个真正可用的 1M token 上下文窗口——不是在评测指标上好看,而是在真实的工程场景中能稳定工作。它能在单次任务中处理项目级别的工程上下文、可靠执行长时间运行的任务、一致性遵循工程规范,并且完成从需求到多平台部署的完整开发工作流。

二、三大新特性

  • Solid 1M 上下文:1M token 的前置上下文,能稳定支撑长程工作,不只是接受更多 token,而是在混乱的代码轨迹中保持质量。
  • 多级思考力度控制:更强的编程能力,提供 High 和 Max 两个思考努力级别,让用户在性能、延迟和计算成本之间自由平衡。
  • 纯粹开源:MIT 开源许可证——技术无国界。

三、长程任务能力:开源最强,紧追闭源旗舰

GLM-5.2 在三个长程编码基准测试中表现亮眼,全部位列开源模型第一:

基准测试说明GLM-5.2 表现排名
FrontierSWE衡量 Agent 完成数小时到数十小时的开放式技术项目落后 Opus 4.8 仅 1%,领先 GPT-5.5 1%,领先 Opus 4.7 11%开源第一,整体第二
PostTrainBench给 Agent 一块 H100 GPU,评判其对小模型的后训练改进能力超越 Opus 4.7 和 GPT-5.5仅次于 Opus 4.8
SWE-Marathon超长程任务,包括构建编译器、优化内核、开发生产级服务落后 Opus 4.8 13%仅次于 Opus 系列

这三个基准的共性在于:它们测试的不是模型能接受多少 token,而是模型在数万 token 的真实工程轨迹中能否持续保持高质量输出——这正是 GLM-5.2 的 1M 上下文训练的落脚点。


四、更强编程能力:开源标杆

在标准编程基准上,GLM-5.2 大幅领先前代 GLM-5.1,并显著缩小了与闭源前沿的差距:

基准测试GLM-5.2GLM-5.1Claude Opus 4.8Gemini 3.1 Pro
Terminal-Bench 2.181.062.085.0低于 GLM-5.2
SWE-bench Pro62.158.4

Terminal-Bench 2.1 上 81.0 的成绩距离 Claude Opus 4.8 的 85.0 仅差 4 分,而 Gemini 3.1 Pro 已被甩在身后。

GLM-5.2 benchmark table

GLM-5.2 引入的 effort level 控制是一大亮点。在同等 token 预算下,GLM-5.2 的 Agent 编程能力显著强于 GLM-5.1,能力定位大致介于 Claude Opus 4.7 和 Opus 4.8 之间。当你遇到高难度任务时,切换到 Max 力度级别可分配更多计算资源,换取更高性能。


五、总结判断

GLM-5.2 是截至目前 开源模型在长程 Agent 任务上的最强选手。它的 1M 上下文不是噱头,而是在 FrontierSWE、PostTrainBench、SWE-Marathon 三个真实工程场景中验证过的能力。在标准编程能力上,它稳坐开源第一把交椅,并首次让开源模型与闭源旗舰的差距缩小到个位数百分比。

对于 AI Agent 开发者、长程自动化场景和需要高质量代码生成的团队,GLM-5.2 是目前开源阵营中最值得关注的选择。配合 MIT 开源协议和 Ollama 一键部署,上手几乎没有门槛。

小米 MiMo-V2.5 系列 vs DeepSeek V4 性价比分析

Pro 旗舰级定价完全一致,标准级小米凭多模态实现差异化优势

小米 5 月 27 日降价与 DeepSeek 5 月 22 日宣布的永久降价!!!


一、降价后完整定价对比

计费项MiMo-V2.5-ProDeepSeek V4-ProMiMo-V2.5(标准版)DeepSeek V4-Flash
输入(缓存命中)0.025 元0.025 元0.020 元0.02 元
输入(缓存未命中)3 元3 元1 元1 元
输出6 元6 元2 元2 元
上下文窗口1M1M1M1M
多模态纯文本纯文本图像/音频/视频纯文本
开源协议MITMITMITMIT

数据来源:MiMo 官方调价公告 DeepSeek 官方定价页

两个层级的定价几乎完全镜像:Pro 级别三项单价完全一致,标准/Flash 级别也完全一致。但这里有一个关键差异——MiMo-V2.5 标准版是原生全模态模型(支持图像、音频、视频理解),而 DeepSeek V4-Flash 只是轻量级纯文本模型。同样的价格,小米给了多模态能力。


二、小米独有的成本优化机制

Token Plan 计费体系升级是小米本次降价的隐性加分项,很容易被忽略:

  • 同等价格下可用 tokens 提升至原方案的 5-8 倍
  • 引入 Credits 统一计量,计费规则”所见即所得”
  • 所有有效期内的 Token Plan 用户 Credits 于 5 月 27 日 0:00 全量重置
  • 北京时间 00:00~08:00 期间,所有模型 Credits 消耗速率再打 8 折

这意味着如果你使用 Token Plan 订阅制,小米的实际单位成本还会进一步降低。DeepSeek 目前没有同等规模的订阅优惠体系。

上下文窗口不再区分定价也是重要改进。此前小米对 256K 以上的长上下文窗口收取双倍价格,现在一律同价,这对 Agent 场景(经常需要长上下文)是直接利好。


三、性能与能力对比

根据独立第三方 Artificial Analysis Intelligence Index v4.0(截至 2026 年 5 月 6 日)的数据:

评测维度MiMo-V2.5-ProDeepSeek V4-Pro优势方
AA Intelligence Index54 分(并列开源第 1)52 分(并列第 2)MiMo
GDPval-AA Agent并列开源第 1并列开源第 1持平
ClawEval(长程 Agent)63.8%59.8%MiMo
τ³-bench(跨任务协作)72.9%71.8%MiMo
SWE-bench Verified78.9%80.6%DeepSeek
SWE-bench Pro(复杂工程)57.2%55.4%MiMo
LiveCodeBench Pass@193.5%DeepSeek
Codeforces Rating3206(人类第 23)DeepSeek
Terminal-Bench 2.068.4%67.9%MiMo
幻觉率(AA-Omniscience)暂无数据94%(极高)MiMo 无数据但 DS 确认高

数据来源:CSDN 技术博客 搜狐

Token 效率是 MiMo 的重要差异化优势。MiMo-V2.5-Pro 在 Agent 长程任务中比 Kimi K2.6 节省约 42% Token,在 ClawEval 评测中比 Claude Opus 4.6、Gemini 3.1 Pro 节省 40%~60%。由于 Agent 任务 token 消耗指数级增长,省 token 直接等于省真金白银——在相同定价下,MiMo 完成同等任务的实际花费更低。


四、场景化性价比结论

场景 1:Agent 自动化与长程工作流(多步工具调用、代码工程 Agent)
推荐 MiMo-V2.5-Pro。Agent 能力在第三方评测中领先,Token 效率更高意味着实际成本更低,响应速度更快。小米取消上下文窗口差异化定价后,Agent 场景的长上下文调用不再有价格惩罚。

场景 2:竞赛编程与深度数学推理
推荐 DeepSeek V4-Pro。LiveCodeBench 93.5% 和 Codeforces 3206 分是开源最强,思考时间更长但推理深度更深。不过需要注意 94% 的幻觉率在可靠性要求高的场景中是硬伤。

场景 3:多模态任务(图像理解、音视频处理、办公自动化)
推荐 MiMo-V2.5(标准版)。DeepSeek V4 全系为纯文本模型,而 MiMo-V2.5 标准版原生支持图像/音频/视频理解,输出价格仅 2 元/百万 tokens,同等价位下 DeepSeek V4-Flash 只能处理文本。

场景 4:高频轻量调用与批量处理
MiMo-V2.5 标准版与 DeepSeek V4-Flash 定价完全相同(0.02 / 1 / 2),但 MiMo-V2.5 多模态能力覆盖更广,且 Token Plan 订阅可进一步压低成本。如果纯文本且高频调用,V4-Flash 也是可靠选择。

场景 5:订阅制与大用量部署
MiMo 占优。Token Plan 体系下同等价格可用 tokens 提升 5~8 倍,加上凌晨 8 折优惠和 Credits 全量重置,大规模部署的实际单位成本显著低于按量计费的 DeepSeek。


五、总结判断

在 Pro 级别,两家定价完全相同,性价比之争完全回归到能力差异:MiMo-V2.5-Pro 综合评分更高(54 vs 52),Agent 和 Token 效率领先;DeepSeek V4-Pro 在纯编程和数学推理上更强,但幻觉率是重大隐患。

在标准级,同样是相同定价,但 MiMo-V2.5 标准版凭多模态能力实现了真正的差异化——同样的 2 元输出价格,小米给的是图像/音频/视频全模态模型,DeepSeek V4-Flash 只是轻量纯文本模型。

叠加 Token Plan 5~8 倍加量、取消上下文窗口差异化定价、凌晨 8 折等优惠机制,小米 MiMo-V2.5 系列在整体性价比上略胜一筹,尤其对于 Agent 场景、多模态需求和订阅制用户。但如果你是竞赛编程或需要极致数学推理深度的用户,DeepSeek V4-Pro 仍然是更专业的工具。

DeepSeek-V4-Pro 2.5折

模型 & 价格

下表所列模型价格以“百万 tokens”为单位。Token 是模型用来表示自然语言文本的的最小单位,可以是一个词、一个数字或一个标点符号等。我们将根据模型输入和输出的总 token 数进行计量计费。

模型细节

模型deepseek-v4-flash(1)deepseek-v4-pro
BASE URL (OpenAI 格式)https://api.deepseek.com
BASE URL (Anthropic 格式)https://api.deepseek.com/anthropic
模型版本DeepSeek-V4-FlashDeepSeek-V4-Pro
思考模式支持非思考与思考模式(默认)
切换方式详见思考模式
上下文长度1M
输出长度最大 384K
功能Json Output支持支持
Tool Calls支持支持
对话前缀续写(Beta)支持支持
FIM 补全(Beta)仅非思考模式支持仅非思考模式支持
价格百万tokens输入(缓存命中)(2)0.02元0.025元(限时2.5折(3)0.1元
百万tokens输入(缓存未命中)1元3元(限时2.5折(3)12元
百万tokens输出2元6元(限时2.5折(3)24元

(1) deepseek-chat 与 deepseek-reasoner 两个模型名将于日后弃用。出于兼容考虑,二者分别对应 deepseek-v4-flash 的非思考与思考模式。
(2) 全系列模型,输入缓存命中的价格已降至首发价格的 1/10。
(3) 当前 deepseek-v4-pro 模型限时 2.5 折,优惠期至北京时间 2026/05/31 23:59。

扣费规则

扣减费用 = token 消耗量 × 模型单价,对应的费用将直接从充值余额或赠送余额中进行扣减。 当充值余额与赠送余额同时存在时,优先扣减赠送余额。

产品价格可能发生变动,DeepSeek 保留修改价格的权利。请您依据实际用量按需充值,定期查看此页面以获知最新价格信息。