


A | 当地时间7月21日,谷歌DeepMind发布三款轻量的新模型,主打“更快、更智能、更具成本效益”,但因智能程度没有满足外界的期待,评价两极分化。 7月21日下午,北京海淀知春路月之暗面总部,在一个充满摇滚风格的会议室里,月之暗面企业业务负责人黄震昕接受了新京报贝壳财经记者的采访,这也是Kimi K3大模型发布后Kimi首次公开接受媒体采访。

B | 月之暗面企业业务负责人黄震昕回答新京报贝壳财经记者问题。

C | 罗亦丹 摄 K3大模型参数量达2.8 万亿,是目前全球参数规模最大的开源权重模型,在多个权威榜单上拿到第一,受到了国际上的广泛关注。连马斯克都在K3评测报道的评论区留言称“令人印象深刻”,并表示后续将推出2万亿参数的模型“可能超越Kimi”。 与此同时,旗舰模型Gemini 3.5 Pro依然没有露面成为此次焦点,从排行榜来看,谷歌的模型已经排在十名开外。 根据谷歌官方博客,此次发布的三款模型定位不同。

D | Gemini 3.6 Flash是主力模型,与上一代相比能使用更少的token,在相同成本下提供更高质量的工作;而Gemini 3.5 Flash-Lite则是快速、成本效益高的选项,适用于日常任务,如处理文档和搜索;Gemini 3.5 Flash Cyber是一种网络安全模型,专为发现和修补关键软件漏洞而构建。 但根据评测来看,此次谷歌的新模型在智能上并不出色。K3的火爆程度也导致需求量激增,7月19日,月之暗面暂停了C端新用户订阅。

E | 对于算力紧缺的现状以及未来企业的发展。

F | AI模型评测平台Arena.ai的研究显示,Gemini 3.6 Flash 在前端代码竞技场中以1537分排名第12位。 第三方评测机构Artificial Analysis的结论则是,Gemini 3.6 Flash 在智能方面较3.5 Flash没有提升,智能指数得分50,但任务效率有所提高,Gemini 3.6 Flash的平均每任务时间为 1.3 分钟,较上一代减少超过50%,同时每任务成本略有降低。黄震昕坦言“K3过于火爆,我们其实已经做了预案,但挡不住用户热情,有人说这和去年的‘DeepSeek时刻’一样,最后我们选择优先保证老客户的体验。

G | ” 而对于马斯克的“挑战”,黄震昕笑言,可能这次的表现(让他们)得到一点震撼的感觉,现在拭目以待,希望他们出来跟我们掰一掰手腕,“我们的技术有很多都开源给了全世界,我们也不担心技术会马上被别人学走,我们有这样的胸襟和气度,希望马斯克也能做出2万亿的模型,我们一起共同进步。

H | ” “其实已经做了比较充分的准备,但挡不住用户热情” 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 7月17日凌晨,Kimi K3正式对外发布。 这意味着,谷歌优化的更多是速度和成本,而不是模型能力本身。消息传开后的48小时内,全球开发者的使用请求涌入了月之暗面的服务器,远超团队此前的预估,用户量迅速逼近现有算力集群的承载极限。 更值得关注的是,在Artificial Analysis最新智能指数排行榜中,谷歌目前已经没有任何一款模型进入前十。7月19日晚间,Kimi官方发布说明称“收获了远超预期的支持,但也面临始料未及的算力挑战”,随即暂停C端新用户订阅。 “我们提前做了充分的算力储备预案,但用户和客户的热情还是超出了预估。”黄震昕在采访中坦言。排名靠前的是Anthropic、OpenAI等海外厂商,也包括国内月之暗面的Kimi K3、智谱GLM-5.2等模型。他表示,目前公司的优先级是保障存量付费用户的使用体验,“不愿为了扩大用户规模牺牲存量用户体验”。与此同时,团队正通过两条路径缓解供需矛盾——一是模型效能的持续优化,二是算力供给的快速扩容。

I | 这种“幸福的烦恼”并非没有先兆。这与去年Gemini一度站上全球第一梯队形成了鲜明反差。 除了排行榜,开发者社区的反馈同样出现明显分化。不少开发者用谷歌新模型做任务时未看到很好的表现,“前端能力糟糕、空间推理也很差,我安慰自己这其实不是在高思考水平上运行的,但我不确定。” 有开发者评论道,“谷歌就像龟兔赛跑里的兔子,领先一段时间后就开始睡觉。”也有人直言,Gemini 团队需要引入真正关心交付前沿模型的人。

J | 在关于谷歌新模型发布的评论中,相比Flash模型,大家更关注的是,旗舰模型Gemini 3.5 Pro什么时候发布? 在5月的谷歌I/O 大会上,谷歌发布了Gemini 3.5 Flash,当时曾预告Pro版本已在内部使用,预期一个月内推出。

K | K3的技术实力在发布前就已引起业内关注。

L | 然而两个月过去了,Gemini 3.5 Pro依然没有公开亮相。其核心支撑技术之一“Attention Residuals”(注意力残差)早在2026年3月就以技术报告形式开源,该技术方案可让模型训练与推理效率提升25%。据外媒报道,由于模型始终未达到内部预期性能,谷歌推迟了发布计划。马斯克当时就在社交媒体上公开称赞,评价其为“非常令人印象深刻的工作”。 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 当K3的完整性能数据在发布后揭晓,行业反应剧烈。 面对外界质疑,谷歌DeepMind技术负责人洛根·基尔帕特里克(Logan Kilpatrick)也在社交媒体上回应称,Gemini 3.5 Pro正在与合作伙伴进行测试,计划在准备就绪后立即广泛提供。在被业内视为最贴近真实工程开发的编程“金标准”Frontend Code Arena 榜单上,K3以1679分登顶。

M | K3的上一代模型K2.6在同一榜单上排第18位,一代之间跃升17个位次。Vercel的CEO Guillermo Rauch发帖称,K3在Next.js官方综合Web工程基准(nextjs.org/evals)评测中领先Fable,“这是开源模型首次在该综合Web工程评测上全面超过闭源模型。

N | 但他未给出具体的时间节点。

o | 与此同时,谷歌在这次博客中提到,团队已经开始着手构建下一代模型,“启动了迄今为止规模最大的 Gemini 4 预训练工作,并对目前的进展感到振奋”。” 和DeepSeek-R1推出后英伟达一度大跌类似,K3也影响到了美股表现,美东时间7月17日,CNBC报道美股半导体板块走出今年以来最差单周行情,跌幅创下2025年4月之后新低,而导火索是“中国月之暗面发布全新AI大模型。这一表态,也让不少业内人士猜测,谷歌是否正在把更多资源转向下一代模型,而非继续打磨3.5 Pro。 针对现阶段谷歌模型的表现,很多人认为,并不是谷歌的能力不行,而是内部的策略方向问题,优先级放在产品上,而不是像Anthropic、OpenAI等厂商专注将AI做好。 从谷歌这次的更新来看,团队在大模型上的策略似乎是“速度胜过智慧”。有开发者认为,让任务时间缩短是很好,但停滞的智能意味着他们优先考虑了错误的指标。” 对于K3在全球的影响,黄震昕表示,“我们在全球市场上真正做出了SOTA级别的模型,定价不是朝便宜去定的,我们也摆脱了‘开源模型就是要做便宜的、低价的’这样的印象。“创新也需要深度,而不仅仅是秒表”。” “模型公司一定要做模型” 面对用户的热情与海外广受关注的表现,Kimi显得颇为低调。 不过,也有开发者认为,如果模型是为了赚钱,从这个商业角度看,谷歌是聪明的,毕竟现在新兴公司都是在烧钱运营,一旦钱烧完直接就倒闭,而谷歌是将模型降智节省成本。 “不做高性价比的标准化业务,而是聚焦‘难而正确’的前沿探索。”黄震昕这样解释公司的核心理念。 相比Anthropic和OpenAI持续围绕模型能力竞争,谷歌拥有Android、Chrome、Workspace、搜索、云服务等庞大的产品生态,因此这一年其AI战略一直更偏向产品落地,而不是单纯追逐模型能力和榜单。 但另一方面,开发者更倾向于将智能作为评价AI公司的第一标准。如果模型能力长期停滞,即便商业化领先,也难免影响开发者生态和市场预期。 遥想去年11月,谷歌发布Gemini 3模型时曾引发业界震动,反超OpenAI、坐稳第一梯队,股价一路飙升。

p | 如同登月一般,一旦实现突破,将为全人类创造巨大价值——这并非一句口号,而是贯穿在月之暗面从技术研发到商业布局的每一个决策之中。而进入2026年以来,AI竞争的风向再次发生变化。

q | OpenAI依靠持续推出新模型重新夺回行业关注度,Anthropic依旧保持着模型能力领先的位置,而谷歌更多展示的是成本优化和产品整合能力。 在当前,越来越多的AI企业开始聚焦落地和Agent时,月之暗面却一直保有对基础模型的执念,“模型公司一定要做模型。 截至7月21日收盘,谷歌(GOOGL.US)跌超1%,股价收于347.15美元/股,较5月中旬高点累计回落近15%,当前谷歌总市值约4.2万亿美元,也从全球市值榜第二退居第三,被苹果赶超。 (本文来自第一财经)。

r | ”黄震昕说。 基础模型的强度是所有上层应用的前提,Agent、C端产品、行业解决方案都是模型能力提升到一定阶段后的自然产物。只有持续打磨最强模型,才能构建长期竞争壁垒。 这种执念在K3身上得到了集中体现。根据月之暗面公布的技术文档,K3基于月之暗面自研的KDA混合线性注意力机制和Attention Residuals技术构建,采用MoE(混合专家)架构,在896个专家中高效激活16个,扩展效率较前代K2提升约2.5倍。更关键的是,月之暗面是Scaling Law(缩放定律)的坚定信仰者——模型参数量、训练数据量、计算量三者同步提升,模型性能就会持续增强——但传统Scaling Law面临指数级成本的硬约束:算力投入扩大100倍,模型性能仅提升10倍。 月之暗面的解法不是简单的工程效率优化,而是底层架构创新。 黄震昕透露,过去8到11年间,大模型领域的三大核心基础技术从未出现本质迭代,而公司在2025至2026年完成了对这三项底层技术的突破,这也是K3能够实现SOTA性能的核心支撑。其中,Moon Clip二阶优化器是行业首次在万亿级大模型训练中应用该新型优化器,大幅提升Token效率,可让20TB训练数据发挥出相当于40TB的效果。K2系列曾在过去12个月中保持9个月的参数量领先,K3也将在参数量与性能上保持一段时间的领先优势。 黄震昕告诉记者,Kimi现阶段暂不提供私有化部署服务,商业模式对标海外成熟头部AI企业,核心发力打磨模型基础能力,他也明确了行业参数规模趋势,表示Kimi的大模型参数规模会持续向上拓展,不会止步于当前2.8万亿规模。 Kimi的“审美”:不做娱乐性场景,聚焦生产力 技术突破只是起点,商业化落地才是检验模型价值的关键。 K3在编程能力上的表现已经为它赢得了开发者生态的初步认可,其在多项评测中展现出与顶级闭源模型抗衡的实力。在Program Bench评测中,K3得分77.8,以0.2分的微弱优势超过GPT-5.6 Sol的77.6;在FrontierSWE上得分81.2,大幅领先GPT-5.6 Sol的71.3,但次于Fable 5的86.6。

s | 在实际应用中,K3展示了长程工程能力——在计算天体物理“I-Love-Q”普适关系复现任务中,K3用约两小时完成了通常需要资深研究人员一到两周才能完成的工作。

t | 但月之暗面的商业化视野不止于此。黄震昕在采访中透露,公司即将推出Kimi Hosted Agent企业级服务,开放Agent编排调度(Harness)能力,将沙箱环境与智能体调度框架整合为标准化平台,向企业客户提供PPT生成等场景的API接口,支持嵌入企业内部系统,可自定义内容风格,适配投研分析、内容生产、办公自动化等多元场景。

u | 谈及与海外头部模型公司的竞争,黄震昕表示,全球模型公司在商业化方面已找到一条可行路径,Kimi在产品创新上持续投入,包括AgentSwarm路由在行业做Agent之前就已经做出来。“我们还是希望从产品驱动,然后设计不同的商业模式,打造出非常有竞争力的产品。

v | ” 黄震昕在采访中强调了Kimi一贯的“产品审美”,“我们不会做娱乐性的场景,也不做生图、生视频,我们一直的定位就是生产力场景,包括编程、金融、法律、科学研究等领域,这就是我们的审美,我们会一直按照这个价值观去努力奋斗。” 在北京,从海淀知春路到清华校门口,短短一段路程聚集了智谱、Kimi等多家国内头部AI企业。黄震昕说,这里的产业集聚并非偶然——“人才密度高、政策支持完善,端一杯咖啡就能找到对应领域的专业人才”。

w | 这片被业内称为中国AI“卧龙池”的土地上,蛰伏的故事远不止一个。

x | 而K3的全球爆火和随之而来的算力告急,或许只是月之暗面“登月计划”的一个阶段性注脚。 新京报贝壳财经首席记者 罗亦丹 视频 罗亦丹 陈蜜蜜 实习生 彭紫桐 编辑 杨娟娟 校对 杨利。
Current article:http://a04k3h.xiaqingzhuangdaminnan.cyou/r2w8q9r/vvhf.html
Published on:16:39:33