- 48小时新闻排行
- 7天新闻排行
|
DeepSeek V4 Pro正式版突遭撤回。(取材自界面新闻) 中国AI公司“深度求索”(DeepSeek)12日深夜在万众期待中,低调上线DeepSeek V4 Pro正式版,官方公布的基准测试分数一度直逼Fable 5等顶级大模型,引发全网狂欢。但官网没多久又突然悄悄地撤下了V4 Pro正式版,距离发布时间前后不到24小时,让全网炸锅。据网友和多个自媒体猜测,应是许多用户实测发现其实际性能远逊于宣传,不仅出现低级逻辑错误和绘制翻车,实测表现甚至不如轻量版的V4 Flash,嘲讽DeepSeek V4 Pro是史上最短命大模型。 DeepSeek 12日深夜推出旗舰模型V4 Pro正式版,版本更新为DeepSeek-V4-Pro-813,并已在App、Web及API上线。据DeepSeek公布测试数据,新模型在多项智能体(或称AI代理,Agent)测试中逼近美国Anthropic旗下旗舰模型Claude Fable5,部分项目甚至反超;价格方面,每百万Token输出价格为6元人民币(约0.88美元),约为Fable 5的六十分之一。 测试数据显示,在衡量模型于终端环境自主操作与问题排查能力的Terminal Bench2.1测试中,V4 Pro取得87.9分,与Fable5的88分仅差0.1分。在AI安全智能体基准测试CyberGym,以及智能体基准测试AutomationBench中,V4 Pro的成绩则超越Fable5。 DeepSeek V4 Pro正式版上线,官方还宣基准测试分数直逼Fable 5等顶级大模型,立即引发全网狂欢。然而不到24小时便口碑大逆转,有许多用户实测发现其实际性能远逊于宣传,所谓对标Fable 5等顶级模型实际得分与中端模型持平,部分场景甚至不如Flash版本,更遑论对标行业顶尖水平。且在部分前端图像与经典极简基准测试(如“鹈鹕骑车”SVG或部分图形渲染 Demo)出现低级逻辑错误或绘制翻车。 不过也有用户说,实测后在复杂全栈、多风格卡片及长周期Agent工程任务上,其整体表现与跑分大幅提升仍有一定水准。 据报导,疑似是官方看到了用户实测反应, DeepSeek官网又悄悄地撤回了V4 Pro正式版,官网首页的发布横幅被悄然撤下,唯模型列表页仍保留著“DeepSeek-V4-Pro-0813”的名称与定价信息。截至13日,DeepSeek官方未发布任何说明或回应,全程沉默。 有自媒体猜测,可能是部署环节出错,线上实际调用的仍是Flash模型而非Pro正式版;也有人担心V4 Pro本身能力就如此了。有网友嘲讽DeepSeek梁文锋在一天之内从“梁圣”又变成了“梁子”,“是V4 Pro自己把自己发布出来了吗?”、“发错版了?”。 |
美国 7 分钟前
温哥华 半小时前
美国 半小时前
加拿大 1 小时前
温哥华 1 小时前
加拿大 1 小时前
DeepSeek V4 Pro发布不到24小时撤下 疑低级错误、绘制翻车
科技 1 小时前
炸锅! 白宫报告称 加拿大是中国规避美国关税“最大帮凶”之一 每年损失上百亿!
加拿大 1 小时前
美国 1 小时前
路透:苹果携手阿里巴巴 秘密打造中国专属AI模型 双轨战略突破监管
科技 1 小时前

关注获得及时、准确、全方位的新闻消息
