
DeepSeek V4 Pro正式版上线后,官方宣称性能逼近Fable 5,但很快遭用户质疑实测不佳,并在不到24小时内被悄悄撤下,引发外界猜测。AI摘要
文章摘要整理:
中国AI公司「深度求索」(DeepSeek)12日深夜在万众期待中,低调上线DeepSeek V4 Pro正式版,官方公布的基准测试分数一度直逼Fable 5等顶级大模型,引发全网狂欢。但官网没多久又突然悄悄地撤下了V4 Pro正式版,距离发布时间前后不到24小时,让全网炸锅。据网友和多个自媒体猜测,应是许多用户实测发现其实际性能远逊于宣传,不仅出现低级逻辑错误和绘制翻车,实测表现甚至不如轻量版的V4 Flash,嘲讽DeepSeek V4 Pro是史上最短命大模型。
DeepSeek 12日深夜推出旗舰模型V4 Pro正式版,版本更新为DeepSeek-V4-Pro-813,并已在App、Web及API上线。据DeepSeek公布测试数据,新模型在多项智能体(或称AI代理,Agent)测试中逼近美国Anthropic旗下旗舰模型Claude Fable5,部分项目甚至反超;价格方面,每百万Token输出价格为6元人民币(约0.88美元),约为Fable 5的六十分之一。
测试数据显示,在衡量模型于终端环境自主操作与问题排查能力的Terminal Bench2.1测试中,V4 Pro取得87.9分,与Fable5的88分仅差0.1分。在AI安全智能体基准测试CyberGym,以及智能体基准测试AutomationBench中,V4 Pro的成绩则超越Fable5。
DeepSeek V4 Pro正式版上线,官方还宣基准测试分数直逼Fable 5等顶级大模型,立即引发全网狂欢。然而不到24小时便口碑大逆转,有许多用户实测发现其实际性能远逊于宣传,所谓对标Fable 5等顶级模型实际得分与中端模型持平,部分场景甚至不如Flash版本,更遑论对标行业顶尖水平。且在部分前端图像与经典极简基准测试(如「鹈鹕骑车」SVG或部分图形渲染 Demo)出现低级逻辑错误或绘制翻车。
不过也有用户说,实测后在复杂全栈、多风格卡片及长周期Agent工程任务上,其整体表现与跑分大幅提升仍有一定水准。
据报导,疑似是官方看到了用户实测反应, DeepSeek官网又悄悄地撤回了V4 Pro正式版,官网首页的发布横幅被悄然撤下,唯模型列表页仍保留着「DeepSeek-V4-Pro-0813」的名称与定价信息。截至13日,DeepSeek官方未发布任何说明或回应,全程沉默。
有自媒体猜测,可能是部署环节出错,在线实际调用的仍是Flash模型而非Pro正式版;也有人担心V4 Pro本身能力就如此了。有网友嘲讽DeepSeek梁文锋在一天之内从「梁圣」又变成了「梁子」,「是V4 Pro自己把自己发布出来了吗?」、「发错版了?」。
因为它在12日深夜低调发布后,不到24小时就从官网撤下,发布横幅也被移除,只剩模型列表仍保留名称与定价,因而被网友称为史上最短命大模型。 DeepSeek宣称V4 Pro在多项Agent测试中逼近Claude Fable5,部分项目甚至反超,像Terminal Bench2.1仅差0.1分,并以每百万Token输出6元的低价吸引用户。 网友与自媒体推测,可能是实际调用出错,在线跑的其实是Flash模型;也有人认为V4 Pro本身表现不如宣传,因而在逻辑、绘图与部分基准测试上出现翻车。精华 FAQ

