行业分类:
加载中...
头条分类:
加载中...
半年狂赚432.8亿!宁德时代年中分红 豪掷61.8亿回馈股东
快科技8月3日消息,宁德时代发布2026年中期分红公告,向全体股东每10股派发现金分红14.11元(含税),实际派发现金分红总额约61.8亿元。 股权登记日为2026年8月7日,除权除息日为2026年8月10日。 回看2025年全年经营与分红数据,去年宁德时代全年净利润722亿元,日均净赚接近2亿元。 当年分红分成两笔,先是发放45.68亿元中期分红,年末再派发315.32亿元年度分红,全年累计分红361亿元,刚好占到全年净利润的一半,刷新企业自身分红纪录。 仅去年一年,董事长曾毓群凭借持股,单独拿到分红约81亿元。 对比两年数据不难发现,宁德时代已经形成稳定的年中分红习惯。 2025年上半年利润304.85亿元,中期分红45.68亿元;2026上半年净利润大幅增长至432.84亿元,同比涨幅超41%,中期分红金额同步提升至61.8亿元,盈利规模上涨的同时,分给股东的现金也同步增加。 2026上半年宁德时代营收2769.17亿元,同比增长54.8%,动力电池搭配储能两条业务线同步发力,储能板块增速接近90%,产能保持高利用率,充足的现金流是支撑大额中期分红的基础。 不同于多数A股企业只在年末分红,宁德时代选择年中提前兑现收益,能够稳定长期持股投资者的信心。 按照公司过往分红政策,今年年末大概率还会推出年度分红方案。持续大手笔分红,也向市场传递出明确信号,全球动力电池龙头盈利稳定、现金流充裕,不需要把全部利润投入扩产,愿意持续拿出收益回馈股东。
AI生图骗哭小男孩!官方声明:大连海底隧道看不到鱼
快科技8月3日消息,近期,一组大连湾海底隧道的图片在社交平台广泛传播,引发非常多的关注。 画面里隧道配有透明穹顶,头顶海水清澈,鲸鱼、鱼群自在游弋,不少网友被梦幻场景吸引,计划专程前往打卡,然而这震撼画面,实际上是网友利用AI工具生成的虚假图片。 有家长带着孩子慕名前往,小朋友一路上满心期待,一心想在隧道里观赏海洋生物,可车辆驶入隧道后,眼前只有普通水泥内壁与照明路灯,不存在任何透明观景顶棚,更看不到海水与鱼群,巨大落差让小男孩十分失望,当场在车上崩溃大哭。 谣言还持续发酵,评论区甚至衍生出新说法,有人声称隧道顶棚可以定时切换透明模式,特定时段才能看见海底景观,误导更多准备出行的游客。 针对不断扩散的不实信息,大连市城市管理局正式作出辟谣声明: 大连湾海底隧道属于跨海沉管快速路,隧道主体为钢筋水泥结构,全程看不到海水,更不可能观测到海洋生物,隧道同时通行机动车与地铁,从工程安全、抗压防水角度,根本无法采用玻璃管道设计,网传海底景观全部为AI合成、后期修图产物。 工作人员还提醒游客,如果想要观赏海底观景通道,可以前往大连本地海洋馆, 据了解,大连湾海底隧道为我国北方首条大型跨海沉管隧道,全长5098米,采用双向六车道标准建设,设计标准为城市快速路,项目2017年3月开工建设,2023年5月1日建成通车运营。
存储芯片又崩了!2400亿巨头,跌停
8月3日,三大指数集体收跌。截至收盘,沪指跌0.59%,深成指跌0.96%,创业板指跌1.24%。 存储芯片概念震荡调整,兆易创新跌停,普冉股份、德明利、香农芯创纷纷下挫。 此外,韩国KOSPI指数收跌5.13%,报6257.41点。其中,SK海力士和三星电子均跌近9%。 兆易创新是中国领先的、全球化布局的芯片设计公司,专注于存储器、微控制器、传感器和模拟芯片的研发与销售。兆易创新目前所经营的存储产品属于利基存储产品,即主要供给的下游为除手机、PC、服务器以外的广泛且分散的市场,如消费、工业、网通、汽车等领域。 兆易创新曾是一家备受资金追捧的公司。2024年9月18日,兆易创新盘中股价为64.13元/股,此后,股价一路震荡上行。2025年8月开始,股价开始加速上涨模式,股价由120元/股左右飙升至2026年6月29日的846.66元/股的高位。在这期间,股价涨幅为6倍左右,市值最高达5943.55亿元。 值得注意的是,在股价涨至巅峰846.66元/股时,兆易创新曾提示风险称,公司所处存储芯片行业历史上呈现显著的周期性波动特征,目前产品价格已处于历史高位,继续大幅上涨的趋势不可持续,行业供给与需求终将走向再平衡。 未来,随着宏观经济环境、行业周期、市场供需关系等多重因素的变化,主要产品价格可能出现相当幅度的回落,届时对公司存储业务的产品售价、毛利率均将产生较大负面影响,从而导致公司整体盈利能力下降,存在公司经营业绩下降的风险。 正是从兆易创新提示风险开始,兆易创新的股价大幅回调。 7月29日晚,兆易创新连发多份公告,释放出强烈的救市信号。公告显示,董事长朱一明未来12个月不减持,并拟不低于10亿元增持公司股份。朱一明还提议公司不低于10亿元(含)、不超过20亿元回购公司股份。 7月30日、31日,兆易创新分别上涨1.94%、2.02%,而在7月30日,股价一度涨停。
腾讯、阿里、字节的AI办公大战:赛马与变阵内幕
三家公司在办公上重新站回了起跑线。 文丨高洪浩 赵梓昕 编辑丨管艺雯 7 月初,阿里巴巴的 QTeam 团队收到通知:以后周末不用加班了。当时,他们正在为办公智能体(Agent) QoderWork 半个月后的重要发布冲刺,多项功能已进入上线前的最后阶段。按照原本的规划,QTeam 还计划至少再集中投入几个月资源,与腾讯 WorkBuddy 正面竞争。 突如其来的调整打断了所有节奏。QoderWork 连同十余名员工被划出 QTeam,与钉钉孵化的悟空、阿里云内部创业的 MuleRun 合并成一款面向企业生产力场景的 AI 产品,后被命名为千问办公,负责人是 1992 年出生的钉钉一号位陈宇森。 调整当晚,部分员工便搬到了位于杭州未科的钉钉总部园区;一周内,千问办公团队完成了全部人员的线下办公区迁移。 不到一个月,字节跳动也开启了相似的整合。被整合的是飞书 —— 产品团队并入豆包,销售、市场和客户服务团队并入火山引擎。大多数员工几乎与外界同一时刻才知晓了变动,飞书负责人谢欣对他们承认,“调整来得很仓促。” 接下来,他将向豆包负责人赵祺汇报。 过去一年,飞书力推的 AI 智能体 Aily 售卖情况并不理想。豆包的处境也不轻松。据我们了解,6 月豆包专业版上线后,付费用户只有小几十万。截至上半年,豆包超过 70% 的使用场景来自视频生成,PPT、文档等办公场景占约 15%。豆包方面表示数据不实,和实际数字差异较大。 今年 7 月初,飞书的销售们突然接到通知,除了卖飞书,还要同时售卖豆包的企业版。 字节对飞书的这次调整,正处于它状态最好的时刻 —— 2025 年飞书的收入增速仍在增长,而钉钉已经出现下滑。但这些都不重要了。“智能体出现后,钉钉、飞书、企业微信已经是上一代的产物了。” 一位钉钉人士说。 更何况,他们的对手已经跑到了前面。今年 3 月,腾讯便已决定,全力押注办公智能体产品,并将资源逐渐归拢至 WorkBuddy 身上。与许多自上而下立项的战略级产品不同,它最初是由一个小团队自己跑出来的。 五个月时间里,WorkBuddy 与公司内多个业务打通,混元大模型负责人姚顺雨与他们紧密合作,腾讯甚至前所未有地做起了线下推广,把广告铺满了深圳和上海的一列列地铁车厢里。团队定下的迭代节奏是:每日更新。 据我们了解, WorkBuddy 的日活跃用户数在周中与周末波动明显,但平均已达百万量级,超过所有国内的对手。 2025 年 11 月,Claude Code 上线半年,年化收入已达 10 亿美元,增速超过同期的 ChatGPT,编程由此成为 AI 最先跑通商业化的场景。今年初,OpenClaw 又把智能体带出程序员圈层。模型在编程中练出的任务拆解、工具调用和多步执行能力,开始迁移到文档、表格等办公场景,用户也从开发者扩展至普通职场人——这是一个更大的市场。 过去三年,AI 行业留下了两个教训:面向普通消费者的产品迟迟找不到商业模式,耗光了巨头的耐心;抖音、小红书、淘宝甚至微信则验证了另一件事,在原有产品里加 AI,影响有限,旧产品的功能、组织和商业模式早已成型,很难靠一个 AI 入口脱胎换骨。 对巨头们来说,更现实的选择是从头做一款面向专业用户和办公场景的 AI 原生产品,钉钉、飞书与企业微信可能都不再是主角,他们最大的价值是过去多年积累的企业组织上下文数据。 一位阿里人士问,此时此刻,是豆包/千问更需要飞书/钉钉,还是飞书/钉钉更需要豆包/千问? 上一轮战争打了近十年还难言胜负,而现在,三家公司在办公上重新站回了起跑线。 巨头的摇摆 巨头们在智能体上格外激进,但最早下注的不是它们。 2025 年春节前夕,DeepSeek 发布 R1。它依靠大规模强化学习获得推理能力,在数学、代码等任务上的表现比肩 OpenAI o1,也打乱了场上所有玩家的节奏。 北京海淀的办公室里,月之暗面团队开始调整路线。一个决定是停止在产品上大规模投放,把资源重新集中到模型本身。他们计划打造国内第一个万亿参数模型,将智能体作为模型的核心方向,重点提升工具调用、软件工程和长链条任务能力。“创业公司必须有自己的 bet(押注),这是避免与对手陷入消耗战的现实选择。” 一位月暗人士说。 两公里外的智谱,创始人唐杰在一场小范围的战略会上讨论下一步,摆在他们面前的是两条路:继续跟随 OpenAI,在推理模型应用场景上投入更多力量;或者以 Claude 为参照,强化预训练和数据构造,专注提升基座模型的编程与长程任务能力。 “学 OpenAI 是做科学家,学 Claude 是做工程师。” 一位知情人士说。会上没有结论,但很明显,“科学家是一个很小的群体,而且不怎么赚钱;工程师群体大,也赚钱。” 这很快在 4 月智谱的系列发布中得到验证,此后,智谱将更多资源集中到了编程方向。 中国的互联网巨头们在当时还不是这样想的。 2025 年上半年,无论字节、阿里还是腾讯,都仍以 OpenAI 为主要参照:追求通用,聚焦聊天机器人。当时 OpenAI 以 3000 亿美元估值完成新一轮融资,是当时全球估值最高的 AI 创业公司;ChatGPT 的周活跃用户也已经达到 5 亿,远远领先于其他通用 AI 产品,有机会成为新时代超级入口。相比之下,编程看起来只是垂直的小市场。 一位字节跳动人士回忆,公司高层当时判断,AI 最先颠覆的会是搜索,并可能催生一种效率超过传统推荐系统的新产品形态,“这是一个绝对不能放弃的巨大机会。” 腾讯管理层也把搜索视为 AI 最值得研究的落地方向。“相比编程,他们更关心的是 Perplexity(美国创业公司的 AI 搜索产品)。” 一位腾讯人士说。 大厂的编程和智能体产品经历了漫长的沉寂期。腾讯的 CodeBuddy 只是一个 IDE 插件,团队仅十人左右;字节的 Trae 虽已上线,投入却很有限。阿里的通义灵码走了阿里云的路子,既做标准化产品,还承接定制开发,结果是投入很高,收入却十分有限。 “当时唯一的想法,就是先活下去。” 一位 CodeBuddy 人士说。为了拿下客户,他们不惜花数周时间驻扎在对方办公室,陪着客户解决问题,再根据反馈不断优化、迭代产品。 转折发生在去年年中。美国 AI 编程工具 Cursor 的年化收入已经超过 5 亿美元,估值达到 99 亿美元;紧接着,Anthropic 旗下的 AI 编程智能体 Claude Code 正式上线,半年后它的年化收入达到 10 亿美元。 编程突然被证明是一门数百亿元收入的生意,而那些面向大众消费者的 AI 产品,仍看不到清晰的商业化前景。这改变了大公司的态度。 “内部开始有些着急了。” 一位接近通义灵码的人士说。据了解,阿里巴巴管理层当时向团队传递了明确压力,要求限期拿出结果。通义灵码负责人丁宇随即从集团内多个研发效能相关团队抽调人手,在阿里巴巴西溪园区 C 区集中办公、对标 Cursor 封闭开发数月。这个新的集团战略级产品被命名为 Qoder。 同样在此时,腾讯元宝也将智能体列为了优先级最高的业务方向。他们为这一场景搭建了独立的端内容器和模型链路,其他项目甚至都要为它让路。此时恰逢元宝的新团队刚刚组建,又赶上产品重构,许多基础能力尚未补齐,因此项目推进得并不顺利。 CodeBuddy 也在这一时期变成腾讯最受重视的 AI 项目之一。团队随即进入高强度工作状态——核心成员经常加班至凌晨两三点,算力资源也越来越多。 不过与美国相比,AI 编程在中国尚未形成同等规模的用户需求,这些产品的用户规模始终没有明显增长。很快,大厂又回到追逐超级入口的老路。 2025 年底,字节跳动以最高价码拿下春晚合作。腾讯迅速准备了 10 亿元现金红包,通过元宝发放。阿里也宣布投入 30 亿元,通过千问 App 在春节期间向用户免费送奶茶。 “超级入口,这是一个多么有吸引力的词。” 一位字节跳动人士说。 春节大战碰壁后的坚定转身 春节的这场大战并未让巨头们收获预期的结果。 元宝和千问的日活跃用户数在攀升到历史峰值后快速下滑。豆包看上去是最大赢家,日活突破 2 亿,回落幅度也最小,但成本压力席卷而来 —— 豆包每天消耗数千万元算力成本,每天收入不足百万元,还没算上为训练模型搭建的算力中心投入。“这种投入就像无底洞。” 一位字节跳动人士说。 春节后,元宝开始放缓买量。阿里也大幅削减了千问 App 的增长投入,预算从此前单季度百亿元规模,降至全年百亿元规模。就连豆包也一度暂停了投放。面向普通用户的战事逐渐消停。 竞争重新回到智能体和 to B 的战场,跟此前的摇摆和试探不同,今年三家公司都更坚定。 在腾讯,新任的大模型负责人姚顺雨起到了重要作用。一位腾讯人士告诉我们,2025 年下半年的一次总办会上,CEO 马化腾就提到,应该更加重视编程与智能体。 姚顺雨当时提议,可以搭建一套集团层面的强化学习基础设施,让公司内不同业务都能在这一平台上训练自己的模型,同时把真实业务产生的数据回流给混元。目标是建立数据飞轮,集全公司之力做出最好的编程与智能体产品。 在普林斯顿读博期间,姚顺雨参与提出 ReAct、Tree of Thoughts 等智能体领域的经典框架,之后又在 OpenAI 参与 Operator、Deep Research 等智能体项目。 “从那时起,整个公司上下,到处都能听到讨论智能体和强化学习。” 上述腾讯人士说。3 月,OpenClaw 火爆以后,腾讯的各大业务倾巢而出,纷纷上线了自己的智能体产品。 春节后,字节高层赴美调研,访问了 Anthropic 等公司。回来后不久,他们也开始反思此前集中押注消费产品的策略,决定调整 AI 资源分配,重心转向企业服务。 豆包也重新审视了用户结构,筹备办公能力更强的企业版,试图把资源转向价值更高的用户群体。但这个产品的娱乐心智太强了,转型并不顺利。 飞书转向更激进。2023 年底,飞书推出智能伙伴及创建平台 Aily,但此后很长一段时间,对外销售的核心卖点仍是多维表格。“龙虾热” 之后,AI 被提到更优先的位置,进展依然有限。 一位飞书人士告诉我们,团队最初主推智能会议纪要时比较顺利,这项功能一年只需一万多元,不少企业续约时会顺带购买。到了 Aily,价格升至近 10 万元甚至近 30 万元,买的人很少。后来销售团队不得不用更强硬的策略,一边介绍飞书的理念和 AI 能力,一边告诉客户:“不买 AI,就不给折扣。” 同一时间,阿里内部出现了至少三条并行的智能体产品线:QoderWork 主攻办公生产力;悟空依托钉钉做企业协同;MuleRun 的情况更特殊。 MuleRun 的创始人陈宇森是一名连续创业者,22 岁从浙大毕业后创办网络安全公司长亭科技,2023 年被阿里收购后进入阿里,接到的任务是探索创新型的 AI。“吴妈(吴泳铭)没有设限,让他在自由的环境中做任何尝试。” 一位阿里人士说。 MuleRun 最初的方向是智能体交易市场——一个让人创建和购买智能体的平台。很快他们发现,真正能做出好智能体的人太少了,供给极其有限,这条路走不通。后来,团队尝试过几种产品形态,包括一个模型聚合分发平台,以及类似 Slack 的人机协作产品,前者至今每月仍有数十万美元收入,但这些都不是阿里真正想要的方向。跌跌撞撞,最后发现,“你还是得服务于更大的目标。” 一位阿里人士说。2026 年初,MuleRun 转向 AI 智能体产品的开发。 三条智能体产品都想成为最后的胜者。“我们几乎没有感受到外部压力,反而是内部竞争异常明显。” 一位参与其中的阿里人士说。 无论是 MuleRun、悟空还是 Qoder,它们首先要争取的是公司内部阿里云的支持,尤其是它的销售资源,于是得经常和销售人员吃饭喝酒、拉近关系。还通过各种办法做高 ARR,比如有团队会推动关系较好的分销商或代理商集中采购产品兑换码,然后慢慢卖给真实客户激活。“ARR 就是你的考试分数。” 上述人士说。 尽管 to B 市场拓展的速度明显慢于 to C 市场,但巨头们对方向本身几乎没有分歧。“办公和 to B 就是现在最重要的方向,没有之一。” 一位豆包人士说,“连老师(OpenAI)都转向了,你还有什么道理不转?” 赛马收场,权力重组 2026 年 5 月,CodeBuddy 与 WorkBuddy 团队从深圳前海的数码大厦搬进了腾讯大厦,元宝、腾讯会议等产品也在这里办公。不久前,他们升格成了腾讯云的云产品六部,成为了独立组织;部门负责人刘毅也从总监升任为了助理总经理(AGM)。刘毅在腾讯曾经先后负责过 QQ 空间、腾讯文档、CodeBuddy 等产品。 一位腾讯人士评价这支团队:在内部口碑很好,做事快且灵活。1 月中旬 Claude Cowork 刚发布时,产品经理汪晟杰便和三名同事用一个周末做出了一个类似的产品,即 WorkBuddy。他们直接用 CodeBuddy 的基建和 Agent SDK。当晚,刘毅就决定发布至全公司内测。此后近两个月,每天稳定有上千名非技术员工在用。“养虾” 浪潮来临后,WorkBuddy 提前对外上线。 今年上半年,WorkBuddy 成为了腾讯一众办公智能体中,数据表现最好的产品。这与团队一开始的决策有关。他们坚持做一个简单易上手的产品——只保留一个对话窗口,用户说出需求,系统自行执行;界面上没有任何开发者术语,Skills 叫 “技能”,MCP 叫 “连接器”,Agent 叫 “专家”。在全民 AI 焦虑的背景下,这种低门槛的设计为产品打开了销路。 6 月开始,腾讯的资源越来越多开始向 WorkBuddy 倾斜,打通了腾讯文档、腾讯网盘、腾讯乐享(一款企业知识管理工具)等业务;“龙虾” 产品 QClaw 也并入了六部;包括微信支付、ima、QQ 邮箱、腾讯新闻、自选股等业务陆续接入了 WorkBuddy。腾讯同时也在加大 WorkBuddy 市场推广力度。 WorkBuddy 的广告频繁出现在社交媒体、街头,甚至覆盖了整列地铁车厢。这是腾讯过去几乎没有做过的事情。“我们看到都惊了。” 一位飞书人士说。过去无论是飞书、豆包还是火山引擎、阿里云,它们的广告主要铺在机场,打的是商务人群,但 WorkBuddy 走的是群众路线,“想农村包围城市。”6 月起,飞书将 WorkBuddy 视为了主要威胁之一。 就在 WorkBuddy 一路领跑时,阿里的赛马也因为一场意外加速走向终点。 今年 6 月,陈航(花名:无招)因内部管理争议引发舆论风波,被阿里集团免去钉钉 CEO 职务后离职。1992 年的 MuleRun 负责人陈宇森接手钉钉。 一位阿里人士告诉我们,吴泳铭与陈宇森相识已久,非常欣赏他。上任第一周,陈宇森着手整合悟空与 MuleRun。但考虑到悟空上仍有不少存量用户,他没有立刻关掉悟空这个产品,而是先调整底层技术方案,将悟空原来自研的 Harness 替换为 Claude Code 的 Harness,产品效果得到明显改善。 自此,一切都被按下了加速键。不到一个月后,Qoder 团队被拆分,面向办公场景的 QoderWork 被划入了陈宇森麾下,与悟空、MuleRun 统一整合为了 “千问办公”。由于整合时间仓促,“最初内测时用的还是 MuleRun 的底座。” 一位钉钉员工说。在陈宇森的带领下,千问办公很快就完成了基于 QoderWork 的底座改造。8 月 3 日千问办公开启公测,已初步打通钉钉。 一位千问办公人士告诉我们,在阿里管理层看来,千问的系列产品必须保持统一的品牌 Logo —— 三个箭头旋转在一起,寓意 “一生二,二生三,三生万物”。 不过千问办公推出了独立的品牌形象,一只章鱼。据我们了解,7 月 24 日周五下午在内网推出了一个关于千问办公吉祥物的投票,在章鱼和小猫两个吉祥物形象里二选一,最终大家选择了章鱼。 阿里的风格一向是组织先行。但产品整合需要更长时间。悟空、QoderWork 等原有产品仍有许多存量用户,用户数据、产品能力和团队分工都需要逐步迁移。“内部生态重新整理,需要几个月时间。” 一位熟悉阿里的人推测,相关产品可能要到 2026 年年底才会基本完成整合。 Qoder 原有的编程业务则被保留下来,继续由丁宇(花名:叔同)负责。一位阿里人士告诉我们,吴泳铭希望将 Qoder CLI 逐步升级为阿里集团的基础设施。未来,阿里集团新推出的 Agent,都可能尽量复用 Qoder CLI 的能力。 字节跳动是最后完成整合的。 一位飞书人士告诉我们,字节在 2023 年就讨论过飞书与火山引擎在销售层面的合并,但一直没有拿出明确方案。“飞书在内部一直处于需要不断证明自身价值的状态。”2025 年,整合飞书的声音再起,“飞书的压力已经很大了”。当时,它的内部竞争者里还多了一个豆包。 这轮 AI 浪潮中,飞书和豆包在底层技术和产品生态上有大量可以打通的部分,但受制于组织边界,两个团队长期重复建设——飞书在原有协作产品中加入 My AI 等能力,豆包也逐步进入办公场景,两者出现了不少重合。从公司视角看,这是资源浪费。飞书对 AI 的态度也相对保守,坚持在自己的云端闭环内做功能,不开放本地文件和系统权限——这恰恰是 WorkBuddy 和 OpenClaw 这类桌面智能体的核心卖点。 不过随着 2025 年钉钉遭遇增长瓶颈,飞书反而加速增长,合并的紧迫性降了下来,“于是又拖了一年。” 上述人士说。直到 2026 年,各家集中整合 to B 业务,飞书的独立地位才真正走到了终点。 赵祺是调整中上升最快的人。这位北大计算机博士,加入字节前做过豆瓣产品经理,也创过业。2017 年加入字节后,先后负责增长中台、穿山甲广告平台,被认为是字节跳动 “最会花钱的人”。2022 年,他转入了人力资源部门,此后为字节的 AI 业务搭建人才体系。2025 年 9 月,赵祺终于回到业务一线接手豆包。 火山引擎负责人谭待则接手了飞书的战略、市场和销售体系。尽管最近几年火山引擎凭借 MaaS 业务快速增长,他面对的压力依然不小。一位字节人士告诉我们,在部分高层看来,火山引擎的增长更多来自 Seedance 等模型能力的拉动。 据我们了解,目前火山引擎超过 40% 的 Token 消耗量来自 Seedance;超过 10% 来自 Seedream;Coding 和 Agent 的占比不高。如何把模型能力转化为更多企业场景中的实际用量,也是谭待接下来要解决的问题。 至此,三家巨头在半年内先后完成了办公 AI 的组织整合。排兵结束,竞争才刚刚开始。 重塑格局的机会 在上一轮办公应用的竞争中,钉钉和企业微信跑在前面,飞书是追赶者。大部分客户已经被对手拿走,飞书只能喊出 “先进企业用飞书”,用一套面向未来的产品理念去打动剩下的人。 但愿意为理念买单的中国企业不多。一位前飞书区域负责人告诉我们,真正用好飞书,意味着接受信息透明、文档协作和更扁平的管理——客户要改的不只是工具,还有管理习惯。 在对手夹击下,飞书选择集中资源拿下各行业头部客户:高价格、重服务,帮客户部署产品、改造流程,再借标杆客户向行业渗透。代价是获取周期长。比如拿下海尔,飞书花了一年。早年的项目经常需要驻场,参与部署、培训和流程改造。产品投入大,交付重,很多项目做下来不赚钱。 一位接近飞书的人士告诉我们,钉钉和飞书曾争夺同一家制造企业。飞书展示文档协作能力,强调可以 “像字节一样工作”。客户说,制造企业的配方是核心机密,不能随意共享。飞书团队说服的方式是,“企业应该学习互联网公司的工作方式。” 最后对方选了钉钉。 AI 提供了重塑格局的机会。 进入 AI 时代,无论钉钉、飞书还是企业微信,都已经是上一代的产品了。许多传统产品随之贬值。比如,这些产品过去曾向企业客户提供过一项文件管控服务:把本地文件上传到云端,向量化处理后分类归纳、做版本管控,整套流程涉及大量中间件,报价数十万到上百万元。智能体出现后,同样的事可以用极低的成本完成。 更大的颠覆还可能发生在产品的底层逻辑上。上一代办公平台以即时通讯为中心,而下一代大概率围绕 AI 和智能体展开。一位头部企业服务产品负责人分析,当智能体可以直接拆解任务、生成方案、完成初步执行,很多过去先讨论再动手的事,变成了先出结果、再评审对齐。沟通不会消失,但即时通信在办公中的权重可能大幅缩小——它有可能不再是工作的起点。 三个玩家里,企业微信的位置目前最稳。它靠着微信关系链连接企业、员工和外部客户的能力,在销售、客服和私域运营上的入口地位很难被替代。但优势的另一面是,很多客户只拿它做对外连接的通道,审批、文档、业务系统仍在别处。智能体执行任务,靠的是这些上下文,仅有关系链,在 AI 时代可能不够用了。 “字节有钱、组织能力也强,永远可以灵活转身。” 一位腾讯人士评价。他认为 WorkBuddy 目前只领先对手们半个身位,唯一的办法是不断往前跑,用时间换壁垒。它还有一个待解的问题:如何与企业微信协同。企业微信此前推出了自己的智能体 “大圆”,两条产品线怎么分工或协作,腾讯内部还没有给出答案。 一位互联网公司企业服务产品负责人告诉我们,在国内做 SaaS 生意仍然是个难题。新产品要面对的,还是那些老问题:在国内,企业付费生态差。何况大多数人并不像研究 AI 的工程师那样忙碌到愿意花钱省时间——不然,也不会每天有 8 亿多人刷两小时抖音,4 亿人刷快手,1 亿多人刷小红书。 7 月 20 日,陈宇森召开了一场内部座谈会,回答了几个投票选出的重点问题。一位钉钉员工告诉我们,这场座谈会上,他没有回应与钉钉传统业务相关的问题。但钉钉仍然是他关注的重点业务之一。 关于组织的上下文数据,可能是飞书和钉钉多年来积累的最大价值,过去,飞书和钉钉一年收入三四十亿量级,在 AI 时代,这个空间有机会被放大。一位阿里人士提问,此时此刻,是豆包/千问更需要飞书/钉钉,还是飞书/钉钉更需要豆包/千问? 据我们了解,三个产品都计划积极向海外扩张。最大的挑战是与 Anthropic 和 OpenAI 正面竞争,而便宜的国产模型可能是它们手里看上去为数不多的优势。 “上一代的仗打完了,大家发现打下来的城池不值钱了。” 上述企业服务产品负责人说。这一次,所有人都有机会重新证明自己的价值。
手机芯片厂跨界做AI芯片!联发科盯上谷歌和Meta大单
快科技8月3日消息,联发科CEO蔡力行在业绩说明会上透露,公司400G/448Gbps高速串行接口(SerDes)研发进展顺利,预计2027年下半年准备就绪。 业界认为,这标志着联发科拿到了竞逐谷歌TPU v10和Meta下一代AI定制芯片(ASIC)订单的重要门票。 联发科在AI芯片上的野心不小,首款AI定制芯片预计今年第四季度量产,第二款计划2028年初推进,同时把2027年的ASIC市场份额目标上调至15%到20%。 除了今年第三季度推出的2纳米手机SoC,它还想用2纳米工艺开发数据中心AI定制芯片,进一步扩大AI芯片版图,背后靠的是台积电代工和供应链整合资源。 供应链透露,联发科凭借336Gbps高速接口、先进封装和台积电供应链整合能力,已拿下谷歌TPU v9的主要订单,预计2028年初量产。 而下一代TPU v10将升级到400G/448Gbps高速接口,只要联发科如期完成接口验证,就有机会与博通竞逐,提升自己在谷歌供应链中的供货份额。 另一个大客户是Meta,Meta正在大举扩建AI数据中心,GPU部署规模从数万颗冲向跨区域、数百万颗,单一集群往往会超过1GW。 但眼下互联带宽成为瓶颈,以机架背板搭配200Gbps高速接口为例,每个运算单元的带宽只有约102T至115T,就像高速公路车流暴增却没拓宽车道,芯片之间容易堵车。 Meta目前主要和博通合作定制多款MTIA芯片,业界分析,Meta倾向采用多元芯片策略,联发科一旦完成400G高速接口开发,并集成CPO(共封装光学)、先进封装等能力,就有机会切入它2027年以后的新项目,成为第二供应商,甚至参与新一代AI芯片系统的研发。 当然,高速接口只是入场券,后续还得通过芯片验证、客户导入和产能配置等环节,联发科的400G高速产品最快也要到2028年至2029年才能放量。
这个新生图模型有点夯:4K直出的,国产的,开源的
金磊 发自 凹非寺 量子位 | 公众号 QbitAI 刚刚,新出的一个生图模型,着实是有点东西在身上的: 国产的,4K直出的,开源的,轻量的,还是可以指哪儿改哪儿的。 例如下面这张信息密度超高的图片,就是它做出来的: 我们从结果可以看到,即便是把图片放大了来看 ,不论是文字、图片元素,都是细节拉满的状态。 再如这组充满艺术感的视觉大片,这个AI也是不在话下: 那这是何许AI是也? 它,便是商汤刚刚面向社区开源的SenseNova U1.5-Lite-Preview。 这是一个轻量级原生统一多模态模型的早期预览版本。它延续了商汤自研的NEO-Unify架构,把语言、视觉语义和像素生成放进同一套模型里,覆盖视觉理解、推理、生成与编辑。 不过有一说一,原生4K直出,还仅仅是它的亮点之一。 在仅有8B-MoT参数的轻量身形之下,U1.5-Lite-Preview做到了: 复杂Prompt能接住:支持长篇、多约束、层次化和结构化视觉指令; 文字和版式更能打:面向海报、信息图、品牌视觉等高信息密度内容; 生成后还能继续改:支持参考图、多图组合、局部文字编辑,以及红框、坐标和marker精准编辑。 毕竟在真实创作中,“会画图”只是第一步,真正决定它能不能进入创作流程的,还得看复杂任务和编辑能力。 那U1.5-Lite-Preview这个8B-MoT小模型创作起来有多方便?我们继续往下看~ 能Hold住复杂创作和编辑才是重点 先来看一张信息密度相当的图片。 这张图的主题是银盐摄影。 画面正中央,是一台被拆解开的复古相机。镜头、快门、胶片仓、卷片轴、取景器等结构,被一层层摊开来讲清楚;一束橙色光线从镜头前方打进来,顺着成像路径一路穿过去,整张图的视觉中心也因此一下子立住了。 这种图最难的地方,其实并不在于“画一台相机”本身。真正难的是,模型得同时把时间线、知识模块、结构拆解、流程说明和视觉层级都组织进同一张图里,还得让人一眼看过去,知道哪里是主干、哪里是补充,哪里是说明,哪里是结论。 从最后出来的效果看,U1.5-Lite-Preview在这种高信息密度的信息图任务上,已经能把内容和版式一起接住了。黑白蚀刻风格很统一,主视觉够醒目,细节也足够丰富,整张图读起来并不乱,反而有种“越看越有东西”的感觉。 如果说上一张图考验的是“从零做一张复杂信息图”,那接下来这组,更像是在考模型有没有复刻一张图的逻辑,再重新输出的能力。 输入图的主题,是一张名为Modern Pop Culture Film & TV Milestone Journey的信息图。 它把几部流行影视作品串在一条弯曲的路径上,节点、卡片、插画和标题都带着比较统一的手绘水彩风格。整张图看上去像一张轻松、亲切的文化主题路线图。 而到了输出图,主题换成了The Journey of Postal Mail,也就是“邮政邮件的旅程”。 但你再仔细看,会发现它并没有推倒重来。 原来那条弯弯曲曲的路径还在,节点式的节奏也还在,左中右的版式关系也保留了下来。只不过,原先围绕电影和剧集展开的内容,被整体替换成了“投递、分拣、运输、派送”这四个环节。洗衣店、剧集卡片、电影海报式的小模块,被换成了邮筒、分拣中心、运输车、邮差上门这些更贴合新主题的元素。 换句话说,它领悟的并不只是简单的“画风”,更是一整套设计框架和组织方式。 在真正的内容生产中,从头做图只占一部分时间;更多时候,折磨人的其实是改稿。 比如下面这组博物馆文创的案例: 输入图和输出图,主题其实都是博物馆文创开发流程。 整张图的大框架没有变。左侧仍然是竖排标题,中间依旧是巨大的“MUSE”字样,右侧还是从“研究与挖掘”到“反馈与迭代”的六步流程,底部的价值模块和整体米色、浅棕色的调性,也都还在。 但它改动的,是画面里最核心的主视觉。这个案例挺像真实工作流里常见的改法。 文案不一定大改,结构也不一定重做,但客户会告诉你,主题方向变了,主视觉要换,气质要跟着调整,原来的信息框架尽量保留。这时候,难点已经不只是“生成一张图”,而是在同一套版式里,重新组织新的视觉主体。 从这个结果来看,U1.5-Lite-Preview已经开始具备这种能力了。它不是简单地把一件新文物塞进去,而是在保留原有流程信息图框架的前提下,把新的核心元素重新放进整张设计语言里。 我们再来看一个更刁钻的,把有设计感且复杂的“迎”字,改成“命”字: 最后的结果里,原有船体继续充当“命”字的最后一竖,周围浪花则重新组织出其余笔画。而新字依然像是从海面里自然生长出来的,没有变成一层生硬贴上去的平面字体。 除了在一张图上修修改改,U1.5-Lite-Preview还可以同时读取多张参考图。 比如下面这个韩式双拼炸鸡案例: 这次输入的图片有两张,一张参考图负责提供手绘食谱的版式和画风,另一张真实照片负责提供食物内容。 按照要求设计后,输出的图片是这样的: U1.5-Lite-Preview把照片中的原味炸鸡、甜辣炸鸡和可乐,重新画进了米色网格笔记本里;左侧黑色螺旋装订、手写标题、卡通小猪,以及下方两行三列的烹饪步骤也一并补齐。 最后做出来的,已经是一张能够直接用于社交媒体传播的手绘食谱。真实照片与插画模板之间,没有出现明显的风格割裂。 类似的能力若是落到办公场景里,U1.5-Lite-Preview还可以把一张普通人物照片,直接变成一份单栏简历。 从结果来看,人物头像被放在顶部,原图里的三角梅继续作为封面主视觉。玫粉与米白配色顺着花丛延展开来,姓名、职位、联系方式、工作经历和技能条依次排开。 至于我们刚才提到的指哪改哪,红框和marker都能派上用场。 最简单的情况下,你可以圈出下面这张信息图里的“35+MIN”,让模型将它改成“25MIN”,同时保持原有字体、字号和排版,并在完成后把用于定位的红框一起移除。 对于复杂一点的要求,则甚至可以直接对画面氛围动手。 原图是一艘帆船驶过金色满月的暖色场景。我们只需要在图上留下marker和修改要求,U1.5-Lite-Preview便会把满月替换成深红色血月,在水面增加一层浓雾,再将天空、湖面与帆船的光线全部调整为暗调夜景。 虽然月亮、雾气和整体光影都变了,但帆船、船上人物与背景树林仍然留在原来的位置。 这一大一小两种修改,刚好对应了编辑场景中的两类需求。 前者追求精准,最好只动几个字符;后者需要模型重新处理色调、光线和空间关系,还得尽量守住画面里的主体。 看到这里,U1.5-Lite-Preview展现出的不只是会画图这么简单。 它已经开始理解一张图里的主体、版式、风格和空间关系,也开始知道用户想动哪里、哪些地方最好别碰。 怎么做到的? 这些看起来各不相同的能力,其实都顺着同一条技术路线长了出来。 SenseNova U系列采用的是NEO-Unify原生统一多模态架构,在同一个模型里,语言、视觉语义与像素生成被放在一起建模。 于是,从读懂指令、分析参考图,到判断该怎么改、最后生成像素,可以在同一套架构中完成。 这套设计放到图像编辑里尤其关键。 比如把“迎”改成“命”,模型先要理解文字造型是由船和浪花共同组成的,接着找到需要重构的区域,再判断飞鸟、海面和上下方文字应该留下。 血月案例也一样。月亮、雾气和光照需要整体变化,帆船与人物的主体结构则要尽量稳定。 一边动手,一边判断哪里不能乱动,这才有了持续编辑的基础。 为了把分辨率进一步推到4K,商汤还重新设计了生成头,减弱视觉Token网格对最终画面的影响,并把训练扩展到4K分辨率。 这样一来,画面放大以后,纹理、材质和光影更经得起看,常见的网格感、拼接痕迹与纹理断裂也会随之减少。 长Prompt的控制能力,则由Prompt Enhance进一步增强。 日常生图用一句自然语言就能开干。到了海报、信息图和品牌视觉这类复杂任务,用户可以把布局、风格、文字、比例和禁止项逐层写清楚,让模型尽可能同时接住。 所以,长Prompt在这里并不会刻意增加使用门槛,它提供的是更高的创作控制上限。 再从评测榜单角度来看,相较上一代U1,U1.5-Lite-Preview在Qwen-Image-Bench上的成绩从47.14提升至55.20,这里对应的是with Prompt Enhance条件。作为一个轻量级开源模型,表现相当优秀。 与此同时,ImgEdit-Bench从3.90升至4.37;GEdit-Bench英文项从7.47升至8.17,中文项也从7.42升至8.05。在技术宣发展示的WeEdit榜单中,U1.5-Lite-Preview的Overall Average则达到了6.44。 有点接近一套视觉工作台了 再回头看这次升级,4K确实亮眼,却很难独自撑起一套生产流程。 真实的视觉工作,往往从第一版出图之后才开始。 例如标题换一句、产品挪一下、人物得保留、整体光线再暗一点、客户临时又要补个元素…… 过去我们遇到这些修改,要么重新生成碰运气,要么回到专业软件里继续处理。 但当模型能够理解眼前这张图,并顺着用户的反馈一轮轮往下改,AI生图才开始真正靠近内容生产和设计工作流。 而统一多模态架构的价值,也在这个过程中变得更容易感知。 视觉理解、推理、生成和编辑不再分别躺在技术说明里,它们最终落成了看懂参考图、保住人物、换掉标题、重排版式和局部修改这些具体动作。 当然,U1.5-Lite-Preview依然只是一个早期预览版本。短Prompt理解、小字与人像细节、整体美学一致性,以及复杂场景编辑的稳定程度,都还有继续提升的空间。 据了解,U1.5的正式版很快就会开源;届时,这些问题应当都会得到很好的解决。现在,商汤把轻量版面向社区开源,也意味着这些能力和问题,都将更早进入开发者与创作者的真实工作流里接受检验。 总而言之,若是说4K决定了一张图能放多大,那么AI的理解和编辑能力,则决定它能走多远。 开源地址: GitHub:https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md Hugging Face:https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview 魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview
又一国产模型重磅开源!有声视频编辑全球第一,16家芯片及平台首日适配
智东西 作者 | 杨京丽 编辑 | 李水青 智东西8月3日报道,今日,MiniMax正式开源新一代通用视频模型MiniMax H3。 MiniMax H3是一个通用型全模态生成系统,可统一理解文本、图像、视频和音频组成的多模态上下文,生成最长15秒、最高2K分辨率并带有原生立体声音频的视频。 此前7月31日,MiniMax H3发布。目前,在Artificial Analysis有声视频编辑榜单中,MiniMax H3以1130分的Elo成绩位列第一,领先Gemini Omni Flash、HappyHorse-1.0、Wan 2.7等国内外视频模型。 ▲MiniMax H3位列有声视频编辑榜单榜首 H3系统由H3-Context-IR、H3-Base、H3-Regenerate-2K三个模块组成。开发者可以直接从Hugging Face下载MiniMax H3模型,H3-Base目前支持通过SGLang、vLLM、diffusers和ComfyUI等推理框架和工作流进行部署。 与模型开源同步,华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel等国内外芯片厂商,以及Hugging Face、魔搭ModelScope、ComfyUI、RunningHub、fal等开发社区和云推理平台,另有vLLM-Omni、SGLang等推理框架,共16家生态伙伴均完成了相关适配支持。 开源地址: huggingface.co/MiniMaxAI/MiniMax-H3 模型体验地址: H3-2K直出: platform.minimaxi.com/docs/api-reference/video-generation-v2-create H3-Context-IR: platform.minimaxi.com/docs/api-reference/video-generation-v2-h3-context-ir H3-Regenerate-2K: platform.minimaxi.com/docs/api-reference/video-generation-v2-regeneration MiniMax Hub: hub.minimaxi.com 海螺AI:hailuoai.com 今天,智东西对MiniMax H3进行了实测。MiniMax H3已经能够完成不同类型的视频生成任务,在画面自然度、镜头组织和整体风格一致性方面表现较好。模型在画面真实感、镜头编排等方面有一定的提升空间。 比如,我们让模型生成了一段15秒的风光摄影航拍视频,成片中的雪山、草地等自然景观较为真实,色彩、光影和航拍镜头运动也比较自然,长镜头整体保持了较好的视觉连贯性。不过,画面中的寺庙建筑仍有较明显的AI生成感。 随后,我们又让MiniMax H3生成了一段奶茶和游戏IP联动的广告宣传视频。MiniMax生成的视频包含6个分镜头,整体叙事顺序较为清楚,画面风格和广告氛围也基本统一。不过,在多镜头编排方面,模型出现了一处较明显的重复:店员向顾客递出奶茶的动作被连续呈现了两次。 一、最长生成15秒2K视频,画面与立体声同步输出 MiniMax H3 是一个通用型全模态生成系统。在输出规格方面,H3可生成4秒至15秒的视频,支持21:9、16:9、4:3、1:1、3:4、9:16等多种画面比例,输出帧率为24FPS,并可同步生成32kHz立体声音频。 模型默认生成短边为768像素的视频,通过H3-Regenerate-2K可进一步生成2K版本。H3稳定支持中文、英语、日语、韩语、法语、德语等11种语言,对其他语言也提供不同程度的支持。 H3包含FL2VA和Ref2VA两个版本,分别面向首尾帧生成与全模态参考生成。 H3-Base-FL2VA为首尾帧模式,最多可输入两张图像。不输入图像时,模型执行文生视频任务;输入一张首帧或尾帧图像时,可生成对应的首帧生视频或尾帧生视频;同时输入两张图像时,则可根据指定的首尾画面生成中间的视频内容。 H3-Base-Ref2VA支持全模态参考模式,最多可输入9张图像;视频最多可输入3段,每段时长为2秒至15秒,总时长不超过15秒;音频最多可输入3段,每段时长为2秒至15秒,总时长不超过15秒,且必须与图像或视频一同输入,不能作为唯一输入。图像、视频和音频文件合计最多可输入12个。 二、三大模块协同生成音视频,2K画面采用上下文再生成 H3系统由负责理解和整理多模态指令的H3-Context-IR、负责生成音视频的H3-Base,以及负责生成2K画面的H3-Regenerate-2K三个模块组成。 ▲MiniMax H3系统概览(图源:MiniMax) H3-Context-IR是一套托管式预处理与编排系统,能够理解文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成结果之间的关系。其内部工作流包括指令解析、跨模态关联、时序理解和复杂逻辑推理。 H3-Context-IR依赖多阶段工作流,以及多个托管模型与服务,该模块暂未开源。MiniMax目前提供了相应API和提示词指南,开发者可以据此搭建自己的多模态预处理系统。 视频提示词写作指南: huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md 全参考模式输出指南: huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md H3-Base负责实际的音视频生成。文本由H3-Encoder编码,视觉素材同时经过H3-Encoder和H3-VisualVAE处理,音频则由H3-AudioVAE编码。不同模态的信息随后被组织成统一序列,输入H3-Omni-Transformer。 ▲MiniMax H3-Base架构概览(图源:MiniMax) 对于H3的2K分辨率输出,H3没有采用传统的专用超分辨率模块,而是通过H3-Regenerate-2K,让基础模型结合原始文本及多模态参考素材,对已经生成的768p视频重新生成。这种方式可以再次利用原始上下文,有助于还原小文字和精细纹理等仅凭低分辨率画面难以补全的信息。该模块目前同样尚未开源,开发者可通过官方API复现完整的2K生成流程。 三、本地部署可生成768p音视频,完整2K工作流需调用API MiniMax为开发者提供了H3-Base本地部署和完整2K工作流两种验证方式。H3-Base以FL2VA和Ref2VA两个独立模型仓库发布,均包含处理器、分词器、文本编码器、Omni Transformer、Visual VAE和Audio VAE等推理组件,可通过SGLang、vLLM、diffusers和ComfyUI等框架或工作流部署,并支持多GPU并行推理。 仅在本地部署H3-Base时,开发者可以生成短边为768像素的音视频。其中,FL2VA版本支持文生音视频及首尾帧生成,Ref2VA版本支持联合参考图像、视频和音频,完成角色与场景保留、动作和嘴型编辑、音色参考等任务。 完整2K工作流则需要结合本地模型与官方API:首先由H3-Context-IR理解并扩展用户输入,随后由本地部署的H3-Base生成768p音视频,最后通过H3-Regenerate-2K结合原始上下文重新生成2K视频。MiniMax还提供了文生音视频、首帧生音视频和全模态参考生成等可复现案例,相关请求参数、示例代码和参考结果均可在Hugging Face模型页面查看。 结语:全模态视频生成加速走向开放生态 从实际效果来看,MiniMax H3已经能够处理自然风光、商业广告等不同类型的生成任务,在画面自然度、镜头组织和风格一致性方面展现出较高的完成度。 随着多家芯片厂商、开发社区、云推理平台和推理框架同步完成适配,MiniMax H3此次开源不仅开放了模型能力,也初步打通了从模型下载、本地部署到应用开发的生态链路。全模态视频模型之间的竞争,正从单一画面效果进一步延伸至声音生成、复杂指令理解和产业生态建设。
在K3爆火之际,来聊聊Kimi的商业化前景
撰文 | 李信马 题图 | AI生图 最近,Kimi K3可以说火出圈了。 2026 年 7 月 17 日,月之暗面正式发布了Kimi K3,总参数2.8万亿,激活参数约1040亿(MoE架构,896个专家中每Token激活16个),可以说是全球首个开源3T级模型,而且K3支持文本、图像、视频多模态理解。 据报道,上线前有近3700名开发者排队下载,发布仅30分钟,Hugging Face平台就收获超4000赞,登顶趋势榜,创下了平台最快发布增长纪录,甚至因请求量远超预期导致算力紧缺,一度暂停C端新用户订阅,马斯克都在相关评测报道的评论区留言“Impressive”。 在7月27日深夜,月之暗面正式开源了K3的完整模型权重及技术报告,还同步开放了MoonEP(弹性并行训练框架)、FlashKDA(注意力算子)、AgentEnv(智能体沙箱系统)三大底层基础设施技术,又引起了行业的深度震荡。 有意思的是,这股震荡也传递到了资本市场,有报道称K3上线72小时内,海外AI板块蒸发约3.2万亿美元,17 家投行连夜下调算力企业估值。在国内,某家上市大模型公司的股价暴跌,也被认为是受到了K3发布的影响。 AI发展到今天,资金和市场的规模都是相对明确的,一家公司太出挑,就会抢走其他公司的资源,自然会带来其他公司估值或市值的下降。6月底,月之暗面刚完成了200亿美元估值融资的交割,就启动了新一轮融资,据财联社报道,现在超35亿美元的F轮融资也已经完成,投后估值达到350亿美元,G轮也提前启动。 而支撑起资本热情和高市值的,不只是技术上的领先,还有肉眼可见的商业化前景。据披露的运营数据显示,截至6月中旬,Kimi的年度经常性收入(ARR)突破3亿美元。这个数字的增长速度惊人,3月时,其ARR才刚破1亿,三个月后就增长到了三倍。 不久前,月之暗面Kimi企业业务负责人黄震昕在亚马逊云科技中国峰会上透露,Kimi的API收入增长400%,已占公司整体收入的七成以上,且占比仍在持续提升,此外,Kimi的海外付费用户增长400%,产品已进入180多个国家和地区。 随着K3在全球爆火,可以预见其财务表现还会更加靓丽。一家成立仅三年、全员300多人的公司,如何在这么短时间内把模型卖到了全球?这篇文章里,我们就来好好聊聊。 01. 出海路径的博弈 中国大模型不能只在国内卷,一定要走出国门,赋能全世界。把视角拉高,大模型出海其实有四条路。月之暗面走了其中一条路,这个我们放后面讲,先聊其他的。 首先,DeepSeek的模式是开源渗透加低价走量。今年DeepSeek也是火出圈了,两家公司的技术路线有差异,商业模式也是如此,DeepSeek的模型权重全部对外公开,让开发者可以亲自验证性能、下载部署,建立信任,同时运营官方API按tokens收费,承接没有算力自建部署的企业流量。 价格策略上,DeepSeek把成本打到极致,在OpenRouter平台,DeepSeek长期占据全球Token调用量前列。总的来说,这条路径的优势是用户基数大、生态影响力强,不过商业化效率偏低,变现能力受限。但考虑到DeepSeek更像是用技术理想主义换全球话语权,而非追求短期商业回报,也可以理解。 MiniMax的模式是“轻量化模型+爆款应用”,海外收入占比高,其核心产品Talkie(国内对应版本叫“星野”)是面向海外市场的AI角色扮演社交应用,海螺AI(Hailuo AI)则成为全球视频生成领域的核心基础设施之一。2025年全年,MiniMax收入7903.8万美元,同比增长158.9%,其中AI原生产品收入5307.5万美元,同比增长143.4%。 智谱选择深耕B端和G端,积极输出主权AI基座模型,比如落地马来西亚国家级AI平台,在中东及东南亚等新兴市场构建差异化竞争壁垒。2025年,智谱营收7.24亿元,同比增长132%,其中74%来自本地化部署。 相比之下,月之暗面的商业模式更像是“搭船出海”。为什么这么说?因为这是一条轻快,但也要与渠道和云平台深度合作的商业路径。 02. “搭船出海” 企业出海的云平台基本首选亚马逊云(下文简称AWS),毕竟是全球市场份额第一。下面我们就以AWS和Kimi的合作为例,来介绍下Kimi海外扩张的路径。 此前在峰会上,黄震昕系统性地披露了Kimi与亚马逊云科技的合作架构。这不是一个简单的API接入,而是一个从底层到顶层的四层合作体系。 第一层,基础设施。Kimi借助亚马逊云科技遍布全球的数据中心和网络基础设施扩展全球业务。对于一家300人的创业公司来说,自建全球数据中心网络是不可能的。亚马逊云科技在北美、欧洲、中东、亚太的节点布局,为Kimi提供了即插即用的全球化底座。 第二层,平台服务。Kimi多个模型已经登陆Amazon SageMaker,开发者可以直接进行训练与推理。同时,Amazon Bedrock已经接入了Kimi K2.5等开源模型,更多最新模型的接入也在推进中。 第三层,业务合作。Kimi官方API登陆了亚马逊云科技Marketplace,全球客户可以一键使用、按量付费、零门槛接入。黄震昕透露,Kimi会为新上线的Marketplace渠道提供重点资源倾斜,保障充足稳定的TPM(每分钟Token配额)供给。 采访中,黄震昕还明确解释了几种模式的区别,在Marketplace合作模式下,模型的底层推理计算仍然是跑在Kimi自己的云之上,接的还是Kimi的API。上到Bedrock那一层,就意味着Kimi将模型推理直接放到亚马逊云科技的Bedrock上来进行,直接使用亚马逊云科技的算力,跑在亚马逊云科技的Gateway网关上。简单来说,Marketplace是渠道,Bedrock是深度整合。前者是“卖货”,后者是“嵌入”。 第四层,垂直行业。Kimi与亚马逊云科技的解决方案架构师(SA)联合打造行业解决方案,已覆盖金融、医疗、制造等场景。Kimi提供核心大模型,亚马逊云科技提供行业经验和客户资源。 对比来看,Kimi的选择有其必然性。一家中小型公司,没有能力也不应该像大厂那样在全球铺销售团队,而亚马逊云科技恰好提供了三样Kimi最需要的东西:全球渠道、合规体系、品牌背书。 黄震昕的原话很直接:“我们和亚马逊云科技之间其实是一个‘飞轮’式的合作。一方面,我们会从亚马逊云科技采购全球的云基础设施、算力等服务;另一方面,我们也希望通过亚马逊云科技的渠道来卖我们的服务……亚马逊云科技的品牌和合规在海外全球做得非常好,我们也希望通过和亚马逊云科技的合作,能让我们的收入迎来一个增长更快的、更好的上升曲线。” 这也正是Anthropic走过的路,Anthropic的ARR从1亿到90亿美元的过程中,亚马逊云科技始终是其最重要的云渠道伙伴。但这条路并非没有争议,在峰会的媒体问答环节,有记者直接抛出了尖锐问题:“把模型托管在亚马逊云科技上,是不是意味着把客户关系和数据给了亚马逊云科技,从而沦为管道?”毕竟,利润空间被渠道分走,客户关系也一定程度上依赖云厂商。 黄震昕的回答是:“对于某一部分客群,和亚马逊云科技一起合作是非常好的选择。”他没有明确回复,而是强调了合规的重要性。不过笔者觉得问题应该不大,Kimi并非只押注亚马逊云科技一家,据公开信息,Kimi同时入驻了GCP、Azure等主流公有云平台,还接入了Groq、Together AI等推理优化平台,以及Cursor、Cline等Coding Agent工具,分散了自身对单一渠道的依赖。 其次是技术差异化,Kimi的核心竞争力不在于渠道,而在于模型能力本身,K3的爆火就足以说明问题。当你的模型能力够强时,有的问题似乎也不是问题了。用黄震昕的话说:“用户对于最高性能的token需求是有溢价支付意愿的。” Kimi估值的不断攀升,既有市场对其底层技术创新带来的技术壁垒的认可,也有对其未来收入增速的期待,毕竟已经有Anthropic这个榜样了。不过,Kimi并不是Anthropic的中国模仿者,有关Kimi的定位,黄震昕说了一段话:“Kimi的终极定位是‘寻找能源转化成智能的最优解’。有史以来首次,智能可以像能源与粮食一样被规模化生产,成为可扩展、可并行、可存储的基础性公共效用。” 翻译过来就是,Kimi想成为AI时代的“发电厂”,平台则承担电网的角色。这几条路径哪条能走得更宽更远,还不好说,但每一条路径上的突破都值得我们欣喜——这个时代,也是中国大模型的时代。
美团兵分两路杀入Agent大战
国内互联网巨头正在加速布局Agent应用。 阿里将多Agent能力整合到企业办公场景,腾讯围绕WorkBuddy推进AI工作入口,字节也在推动豆包、飞书和火山引擎之间的协同。 7月27日,美团同时从消费决策和企业经营两端切入Agent竞争:推出面向消费者的“小团2.0”,以及面向企业和商家的全场景AI Agent平台CatPaw。 这是美团继开源LongCat-2.0之后,将AI能力进一步连接具体业务场景的重要动作。 王兴曾在美团财报电话会上表示,美团希望将AI视为本地生活业务的战略机遇,并推动美团App成为AI驱动的本地生活入口。 从消费者选择一家餐厅,到商家经营一家门店,再到订单完成后的履约服务,美团已经建立了一套覆盖需求、供给和执行环节的本地生活网络。 此前美团也曾探索过AI浏览器等更偏通用入口的方向,相比之下,将AI嵌入本地生活业务流程,显然更接近其长期积累的核心能力。 01 从消费决策到商家经营, 美团将AI嵌入本地生活两端 模型能力之外,如何让AI进入真实业务、持续产生结果,成为了新的竞争焦点。 当AI能力与具体应用场景结合,互联网平台过去积累的用户、数据和业务流程,也开始展现新的价值。 对美团而言,这意味着回到自己长期积累优势的本地生活场景。 一次看似简单的消费决策,背后连接着用户需求、商家供给、服务评价、价格变化以及最终在线下完成的履约过程。 以订餐这个常见的生活场景为例。周末的家庭聚会,“带老人和孩子吃饭,希望环境安静、有停车位、不要排队,预算适中”,这背后包含了人数、场景、位置、时间、口味偏好等多重需求。 一个真正好用的生活Agent,需要理解这些隐含条件,结合商家信息、用户评价和实时状态,帮助用户完成筛选、比较、推荐,并且能进一步完成预约、下单等后续流程。 换句话说,它不仅需要理解用户,还需要理解供给,并连接最终发生在线下的服务过程。 在消费侧,美团此次全面升级了本地生活AI原生助手“小团”,进一步强化任务执行能力。 上下滑动,查看更多 从“帮你想”到“帮你办”,小团让AI进入真实消费流程 据了解,美团内部将AI“管家”能力分为结果准确性、决策辅助、行动代理、情境判断和附加信息提示五层。 此前,小团更多帮助用户回答问题、辅助选择;这次升级的重点落在“行动代理”——在用户授权和确认下,把下单、打车、订位这些事办好。 用户提出聚餐需求后,新版小团可以根据人数、时间、位置和偏好筛选方案,并在用户确认后继续完成预约等后续流程;对于没有线上预约渠道的商家,小团还支持通过AI外呼协助沟通。 对用户而言,这意味着过去需要自己搜索、比较、联系商家的多个步骤,开始被整合到一次自然语言交互中。用户可以通过直接描述自己的需求,让AI帮助完成从选择到执行的过程。 但AI要进入生活场景,改变的不只是消费者的决策过程。 在企业和商家侧,美团同日推出全场景AI Agent平台CatPaw,希望帮助个人、团队和企业构建能够理解任务、调用工具并交付结果的AI助手,覆盖从日常办公到业务协作的不同需求。 根据美团介绍,CatPaw的定位是帮助餐饮外卖等商家,完成日常数据汇总、异常识别、策略输出等重复性工作,让人把时间留给选品、服务和经营判断。在其测试阶段中,美容美发店、宠物店、便利店等不同类型的商家,也会尝试用CatPaw处理预约整理、评价汇总等日常事务。 如果说小团探索的是AI如何进入消费者生活,那么CatPaw探索的则是AI如何进入商家经营和企业工作流程。 对于本地生活而言,AI真正的价值并不在于提供一个新的交互入口,而是让需求理解、服务匹配和业务执行之间形成更紧密的连接。 从消费决策到商家经营,再到企业工作协同,美团正在尝试让AI覆盖本地生活生态中的不同环节。 02  AI进入真实业务, 平台积累正在重新被理解 截至2025年底,美团年度交易用户规模超过7亿,平台活跃商家数量超过千万级,业务覆盖全国数千个城市。从外卖配送,到店消费,再到酒店旅游,美团构建了一套覆盖线上决策、交易和线下服务的本地生活网络。 与主要发生在线上的互联网服务不同,本地生活最终发生在线下。AI给出的推荐、判断和策略,最终都需要通过真实服务完成验证。 以外卖为例,用户感受到的“准时送达”,背后并不是简单的信息匹配。一笔订单从下单到送达,需要同时协调商家的出餐节奏、骑手位置、道路情况、订单密度以及用户期望时间。 这也是为什么,同样是点一份外卖,不同平台给用户带来的体验并不完全相同。 过去多年,美团持续建设即时配送体系,通过智能配送系统,将用户需求、商家状态和配送资源连接起来,对订单分配、路线规划、送达时间等环节进行动态优化。 对身处其中的骑手、商家和用户而言,这些能力最终体现为更准确的送达时间、更稳定的配送体验,以及更顺畅的服务过程。 而对于AI而言,美团长期对“需求→供给→执行”全链路的理解和数据积累,是其在本地生活场景中做出靠谱判断的前提。它知道的不只是“哪家餐厅评分高”,还包括“这家店现在能不能出餐”“骑手多久能到”“订单密度会不会影响送达时间”。 这也意味着美团已经积累了一套连接线上需求与线下执行的能力:它不仅知道大家想要什么,也充分理解服务如何发生、如何被完成。 而这恰恰是当前大多数Agent的盲区。当ChatGPT提出“那家餐厅不错”时,它只能完成信息推荐;而当小团“已订好位并通知商家留车位”时,AI才真正改变了生活。 小团可结合位置、时间和商品信息完成筛选,并提供可直接付款的方案。 更重要的是,这些业务过程会持续产生真实反馈。 用户如何选择一家餐厅,什么因素影响消费决策;商家如何调整经营策略,哪些服务能够提升转化;订单如何完成履约,哪些环节影响用户体验——这些持续发生的业务过程,让美团积累了对本地生活运行规律的理解。 与需要在已有产品体系之外寻找落地场景的AI探索不同,美团面对的是一个已经高度数字化、持续运行的本地生活业务体系。 依托这套体系,CatPaw成为了美团将长期积累的业务理解、行业经验和流程能力转化为Agent能力的重要载体。 据介绍,CatPaw最初源于美团内部“AI at Work”的探索,目前已覆盖9万名员工,搭建Agent超3万个,在研发、数据分析、知识管理等多项工作中落地。 对本地生活企业和商家而言,AI落地面对的是大量具体的经营问题:哪些评价反映服务短板,哪些经营指标出现异常,哪些营销策略可能影响转化,以及如何将这些判断转化为实际行动。 随着能力向商家和企业侧延伸,CatPaw也将美团长期积累的本地生活业务认知转化为可调用的AI能力,围绕餐饮、美业、零售等线下经营的具体需求,帮助用户完成评价诊断、经营分析、活动策划、内容生成等任务。 同时,记忆、多端协同等能力让Agent能够保留任务上下文,并在不同工作场景中持续运行;对于有更复杂需求的企业,CatPaw进一步提供Agent开发、部署和管理能力,企业可以根据自身业务接入知识库、工具和权限,让AI进入具体工作流程,并在明确边界内协助完成任务。 从内部员工,到本地生活商家,再到企业客户,CatPaw展示的是一种平台型公司的AI路径:将长期积累的业务经验、流程和工具能力重新组织,让AI从通用能力转变为能够理解行业、参与流程并产生业务结果的能力。 03 AI竞争的下一阶段, 拼的是业务闭环能力 近期,AI厂商正在进行一轮新的产品整合。 阿里正在将不同方向的智能体能力整合到千问办公体系,并由钉钉承接,让AI能力进一步进入企业协作场景;腾讯将QClaw等Agent探索纳入WorkBuddy体系,尝试围绕办公和开发场景构建统一的AI工作入口;字节则进一步推动豆包、飞书和火山引擎之间的协同,将模型能力、办公产品和企业服务连接起来。 超级工作台聚合的不只是Agent本身,还有Agent运行所需要的数据、流程、工具和权限。通过将分散的能力收拢到统一入口,AI才能从单点工具逐步进入完整的业务流程。 这也说明,AI竞争正在从单一模型能力,走向“智能能力+业务场景+执行体系”的结合。 模型能力决定了AI能够达到的上限,但能否进入具体场景、连接真实流程,并持续产生结果,决定了智能价值如何被释放。 未来的AI竞争,属于能够建立“业务闭环”的平台——所谓业务闭环,指的是让AI进入完整的业务运行过程:理解需求、参与决策、调用资源、推动执行,并根据最终产生的业务结果持续优化。 在美团本地生活中,AI连接的不只是一次消费决策,而是消费者需求、商家供给和线下服务之间的完整业务链路:用户侧的消费选择和评价反馈帮助平台理解需求,商家侧的经营数据和服务反馈供给和履约优化的可能,以及AI将这两端连接起来形成持续优化的循环。 平台长期积累的交易数据、业务流程和服务经验,也因此成为AI理解现实世界、提升决策和执行能力的重要基础。 从这个角度看,小团和CatPaw代表的是同一条路径在不同场景中的延伸: 小团尝试让AI进入消费者决策过程,让用户从“搜索服务”走向“描述需求并完成任务”;CatPaw则尝试让AI进入商家经营和企业协作,让业务经验转化为可调用的智能能力。 但对于平台型企业而言,AI的价值并不只是分别服务消费者和商家,更在于能否让两端形成持续反馈。 用户侧的需求变化、消费选择和服务评价,可以帮助平台更好理解消费者需求;商家侧的经营数据和服务反馈,也能够进一步优化供给和履约流程。 当消费者需求、商家经营和服务执行之间形成更紧密的连接,AI才能真正融入本地生活业务循环。
阿里字节腾讯,为AI办公拼了
智东西 作者 | 王涵 编辑 | 云鹏 智东西8月3日报道,短短两周内,字节跳动、阿里巴巴、腾讯三家互联网巨头接连向AI办公领域投下重磅炸弹。 7月30日,字节跳动CEO梁汝波发布内部邮件,将飞书产品团队并入豆包,销售线划归火山引擎。飞书原有的产品与商业化体系被拆分。 同一天,腾讯WorkBuddy上线“人机双写”协同编辑能力。8月3日,阿里巴巴千问办公正式开启公测,QoderWork、悟空、MuleRun三款Agent产品合并为统一产品体系。 三家整合手法各异,指向却是同一个方向:让AI从独立功能变成办公App的基础能力。 国际市场数据追踪机构IDC与腾讯云联合发布的《协同办公领域AI发展趋势与落地》报告提出,未来的协同办公不再是简单的“AI嵌入传统工具”,而是为AI与人深度协作设计的原生架构系统。 IDC预计,到2030年,95%的工作角色将被重新定义,员工将从重复性任务执行者转变为创造性工作的“任务架构师”。 梁汝波同样给出判断:AI时代办公软件的形态将被重构,最终演变为以智能体为核心的新型工作平台,而非传统意义上的文档或协作工具。 在WorkBuddy功能更新的推文下,有网友感叹功能迭代速度之快,几天前还需要封装的AI技能,现在可以一秒钟就可以完成。 还有网友自嘲自己开了10年办公软件的超级会员,没想到AI功能发展这么快。 一、字节跳动:拆飞书喂豆包 7月30日,字节跳动CEO梁汝波发布的内部邮件宣布了两条整合线: 产品线:飞书产品团队与豆包产品团队整合,成立新的“豆包产品团队”,由豆包负责人赵祺统一负责,原飞书负责人谢欣向赵祺汇报。 销售线:飞书GTM(市场、销售、客户服务)团队与火山引擎整合,成立新的ToB GTM组织“创造力服务平台(Creativity Service Platform)”,由火山引擎负责人谭待负责,飞书销售负责人林婵、飞书战略及市场负责人史志隽向谭待汇报。 简单来说就是,飞书原本相对完整的产品与商业化体系被拆散,产品归豆包,销售归火山引擎。其中豆包企业版已在部分飞书客户中开启内测。 为什么被拆的是飞书?梁汝波在内部信中给出了答案: 据字节披露,按2026年7月平均消耗口径推算,其大模型业务年化营收运行速率(ARR)已超40亿美元,超过国内其他所有模型公司总和。豆包月活已达3.82亿,断层领先。这两项指标意味着豆包的B端商业化能力在国内大模型公司中已处于领先位置。 同时,飞书近期新签约的企业客户中,同时购买飞书AI功能模块(如AI助手、智能会议纪要)的比例已超过90%。 这组数据说明市场需求在倒逼飞书加速AI化。与其让两个团队各自为政、重复投入,不如将飞书的产品团队并给豆包,让豆包的AI能力直接嵌入飞书积累的企业场景,省去中间环节。 二、阿里巴巴:三合一,主推千问办公 阿里也对AI办公动了大刀。 产品方面,7月30日,钉钉在8.3.45版本中上线DingTalk WorkSpace CLI(DWS),把钉钉产品能力封装为命令行工具,面向开发者和AI智能体提供18个业务模块、160余条命令和32个自动化脚本。 今天,阿里巴巴新款AI Agent产品千问办公正式开启公测。该产品整合了阿里旗下三款Agent:桌面端智能体QoderWork、网页端智能体MuleRun、企业级智能体悟空。千问办公在7月27日便开始小范围测试,目前已上线本地桌面客户端。 据虎嗅最新报道,阿里内部已将“AI办公”视为公司AI战略方向之一,决策层定位明确:做面向企业组织的AI生产力平台,而非C端个人办公工具。 组织架构方面,阿里ATH事业群原悟空事业部升级为“千问办公事业部”,由陈宇森负责,整合QoderWork、悟空、MuleRun三款产品,三者在整合后不再单独存在,人才全部归入统一的千问办公体系,吴泳铭等集团高层亲自参与千问办公关键会议。 组织架构方面,阿里巴巴ATH(Alibaba Token Hub)事业群具体的架构体系变化情况如下: Token Foundry事业部:由吴泳铭带队,包括通义大模型团队和未来生活实验室(Happy Horse、Happy Oyster等项目); 千问事业部:由集团副总裁,吴嘉带队,负责千问APP等C端应用; 千问办公事业部:由陈宇森带队,负责千问办公和钉钉两大核心业务; MaaS业务线:链接上下游、打通Token链路的模型服务平台和技术体系; 创新事业部:由多个超级单元小组构成,进行创新应用、新项目孵化。 三、腾讯:WorkBuddy独立上线,加码“人机双写” 腾讯在7月完成了两项关键产品升级。 7月18日,腾讯旗下AI办公智能体产品WorkBuddy独立App上线iOS、Android、鸿蒙三端,成为鸿蒙平台首个桌面办公智能体。 7月30日,WorkBuddy上线“人机双写”协同编辑能力。用户、同事和AI可共同编辑同一份文档,覆盖腾讯文档及本地Word、Excel、PPT、Markdown文件。用户选中文字、表格、图片或PPT元素后,可通过自然语言指令让AI直接修改原文件,修改结果实时同步。 三项核心办公任务均获得AI能力覆盖:文档场景支持生成总结、批量格式调整、错别字检查与润色;表格场景支持制作透视表、公式补齐、数据清洗、图表生成与异常值标注;PPT场景支持统一版式、配图与图表生成、页面拆分及演讲备注写入。 在上线“人机双写”能力之前,WorkBuddy的月访问量已呈现明显上升趋势。根据易观分析在2026年7月20日发布的 《2026年Q2中国办公智能体平台市场洞察报告》,WorkBuddy的月访问量从3月发布时的885万次,增长至6月的2097万次,增长超一倍。 四、时机已到,BAT同月整合AI办公有三个共识 三巨头在同一窗口期集中出手,背后有三个原因: 第一,办公场景是token消耗规模最大的刚需场景之一。 据晚点LatePost分析,字节大模型收入激增主要得益于豆包在编程辅助和智能体场景的深度嵌入,带动了真实工作流中的高频token调用。 办公场景具备高频、高粘性、高付费意愿三重属性,已成为大模型token变现效率最高的出口。 第二,Agent能力已跨越可用性门槛。 阶跃星辰董事长印奇此前提出判断:2026年模型能力正在跨越关键临界点,AI已从仅能连续执行数秒任务进阶到能够独立工作数十小时。 办公正是“长程任务”最密集的场景,Agent技术成熟度首次足以支撑真实工作流,而非停留在信息检索与纪要生成等工具层。 第三,入口争夺的窗口期正在收窄。 OpenAI已推出ChatGPT Work整合Codex,微软确认Copilot“超级应用”将于年内面世。 海外巨头同步推进相同方向的布局,国内三家若不能率先完成内部整合、统一产品入口,将在下一代办公入口的争夺中丧失先手。 结语:AI办公“入口之战”提速 三家同月整合的逻辑一致:单点工具价值在稀释,统一入口和全流程覆盖才是新壁垒。 AI办公赛道的竞争已经过了“比功能”的阶段,谁能把AI真正长进企业的生产流程里,谁就拿到下一代办公入口的船票。 留给尚未完成整合的玩家的时间,已经不多了。
大模型的下半场,拼的是记性
人类总是习惯用旧时代的地图,导航新时代的大陆,AI时代也不例外。 互联网时代,人类最重要的进步之一,就是借助网络访问千里之外服务器上的公开信息,我们自此有了从无限的信息中找到答案的能力。 到了AI时代,当我们试图为AI增加记忆与外部信息时,这条路径被刻舟求剑式地延伸成了RAG (Retrieval-Augmented Generation,检索增强生成),并成为当下最主流的AI Memory范式。 为了方便理解,我们先解释一下RAG到底是什么。 简单来说,就是先把不同类型的信息,统一用向量的形式存起来,等用户提问时,再搜索、召回、拼接,交给模型生成答案。 它的本质还是一个被动的搜索框。只不过搜索结果从网页链接变成了文档切片,搜索框后面多接了一个大模型。 这是一项极为有效的工程技术。它让模型能够接触训练数据之外的信息,也在相当长一段时间里,成为企业接入大模型成本最低、风险最可控的方式。 问题在于,被动检索并不等于主动记忆。 当大模型演进至Agent的下半场,记忆已升级为与推理同等重要的认知能力。 我们对记忆的期望也随之改变——它应该能够主动写入、主动判断、主动整理、主动更新,主动建立信息之间的关联,甚至主动遗忘错误的信息,并将这些记忆作为上下文提供给模型,提升任务完成效率。 而传统RAG,只有机械化的写和机械的读。中间那些关于理解、遗忘、关联的工作,全都被外包给了人类工程师。 什么是真正AI native记忆,逐渐成为了Agent 系统设计中的核心问题之一。 AI memory的昨天、今天与明天 沿着大模型记忆的发展脉络看,今天市场上的方案大致可以切割为三个代际版本。 2023年开始,行业出现了第一代外挂式记忆产品。 这类方案会把用户的对话历史、业务日志或文档塞进向量数据库,在下一次提问时,可以通过关键词或混合检索召回相关片段。 为了让它看起来更像记忆,工程师们为其打满了工程补丁:用户画像、摘要压缩、时间过滤、长内容切分等技术依次登场。 但它的基本逻辑没有发生变化:写入是机械的,读取也是机械的。系统不知道一段信息是否可信、是否已经失效,也不知道两条记忆是否冲突、哪些应该被遗忘。 这直接导致了两种极端: 要么系统里什么都存。随着数据持续累积,记忆库越来越臃肿,召回噪声越来越大,Token 消耗越来越高。 要么系统依赖预先设定的规则只存一小部分信息,一旦越过规则边界,一些关键的上下文便永久丢失。 打个比方:RAG并没有赋予AI记忆,它只是给AI外接了一本极其笨重的字典。 2026年,著名 AI 专家安德烈·卡帕西(Andrej Karpathy)提出的 LLM Wiki 构想,在技术圈掀起了一场地震。 他观察到,传统 RAG 每次面对问题时,都要重新从原始资料中检索、拼接和推理。模型上一次完成的分析并不会真正留下来。下一次遇到相似问题,它仍然要从头检索,非常低效。 于是,LLM Wiki 试图让 AI 持续维护一套小型知识网络——新资料进入后,模型会主动总结、建立链接、更新页面并维护索引。知识不再是查询时临时拼凑的散料,而被沉淀为可被持续修订的中间层。 这是一次至关重要的跃迁,它让“把思考结果沉淀下来、主动提供给模型”成为行业共识。知识由此实现复利式进化。 但个人知识能够积累,并不意味着产品级记忆可以运行。个人场景中,我们可以接受页面偶尔出错,可以手动修订链接,也可以决定哪些资料被加入系统。 但进入企业场景后,问题变得复杂起来:谁有权写入知识?一条结论经过什么验证才能生效?两个部门的知识发生冲突时,以哪个版本为准?员工离职、权限变化或者业务规则调整后,哪些内容需要被删除?不同 Agent 之间应该共享多少信息? 一套由文件、索引和人工规则维护的Wiki,可以帮助AI积累知识,却未必能解决权限、时效、版本、一致性与责任归属问题。 不难发现,前两派玩家给出的答案,其实都是先训练或接入一个通用大模型,再在模型外部添加RAG、知识库或者插件。 但记忆与智慧一定是分别独立的模块吗?不同场景需要的记忆方式是统一标准的吗? 沿着主动记忆与企业级产品能力这条路线,行业自2025年起出现了第三类玩家——分层主动记忆派。 在他们看来,真正成熟的 AI 记忆,不该是一个静态数据库,而应是一套持续运转的认知架构。 它需要具备主动性:主动观察交互,判断什么值得记录;主动识别实体、时间与因果关系;主动更新旧结论,抹平新旧信息的冲突;主动降低低价值数据的权重,并在恰当的时候执行遗忘。 更关键的是,它必须像人类大脑一样,建立分层架构。 当前任务的即时指令,绝不能与沉淀数年的业务事实混为一谈;用户一句随口的吐槽,不该轻易推翻团队长期形成的工程规范。 更直白地说,真正的记忆系统需要建立“瞬时记忆—工作记忆—长期记忆”的分层体系,让不同信息以不同方式进入、停留、迁移和退出。 然后在此基础上,他们会进一步将记忆变成模型的原生能力,并针对不同场景做出不同的 agent 记忆方案。 如何打造记忆的三层存储体系 如何衡量一套 AI 系统是否真正拥有长期记忆? LoCoMo 和 LongMemEval 是目前行业中具有代表性的两类公开测试。 LoCoMo 通过横跨多轮、多个时间阶段的超长对话,考察模型对人物、事件和关系的记忆,以及对时间和因果链条的理解。研究显示,扩大上下文或引入常规 RAG 虽然可以改善表现,但模型依然明显落后于人类。 LongMemEval 则进一步把能力拆成信息提取、跨会话推理、时间推理、知识更新和拒绝回答等维度。 近期登顶这两项测试的红熊AI,及其自研的MemoryBear,为行业提供了一个鲜活的工程样本。(评测结果与复现材料见文末附注) 严格来说,2024年底红熊AI立项研发记忆引擎时,"AI记忆"还不是一个单独赛道,只是大模型的附属话题。如今这个赛道已经挤满跟进者——大厂在模型里加记忆层,创业公司扎堆做记忆框架,而此时MemoryBear已经开源。 作为第三派AI记忆的代表性玩家,红熊 AI没有把记忆理解为一个数据库,而是构建了由工作记忆、短期记忆与长期记忆组成的分层动态体系。 其中:工作记忆处理当前任务所需要的信息。短期记忆保存近期重要内容,并进行初步提炼和结构化。长期记忆则沉淀经过验证、具备持续价值的事实、经验、技能与用户偏好。 当然,分层不是呆板和静态的归档——一条信息不会因为出现过,就自动成为记忆。在分层之前,信息需要经历三步建模: 首先是萃取。系统从大量交互中识别真正有价值的事实,过滤寒暄、重复表达、无效指令和临时噪声。 其次是关联。信息会通过实体、事件、时间和语义关系形成动态网络(类似第二派的LLM Wiki )。一条客户投诉可以关联到具体产品、订单、服务记录和后续解决结果;一次技术选型可以关联到当时的约束、被放弃的方案和后来出现的问题。 最后是匹配。系统根据当前任务,从不同层级的记忆中提取必要信息,避免了RAG式仅靠语义相似度的粗暴召回。 MemoryBear操作界面 在此基础上,MemoryBear 还加入自动遗忘和自我反思机制。没有遗忘与反思,错误、过时、低价值的信息持续累积,记忆最终会沦为污染每一次召回的垃圾场。这也是MemoryBear与传统RAG最根本的区别。 但只有一个通用的分层记忆系统就够了吗? 从分层记忆到专属模型 MemoryBear解决了记忆如何存储与分层的问题,但行业很快撞上了第二道墙:记忆-推理断层。 在长任务中,模型需要理解持续变化的业务目标,继承此前形成的决策背景,在多个步骤和多个会话之间保持一致,并将新的执行结果重新反馈给记忆系统。过程中,记忆不仅会改变模型的上下文窗口内容,也改变了模型组织任务、规划行动和修正判断的方式。 但如果只是将记忆直接直接塞给通用的无状态大模型,本质依然是静态的 Prompt 输入。这就导致,当面对跨会话、长周期的复杂任务时,通用大模型由于缺乏对记忆状态变更的内生感知力,即使引入外部记忆,也经常引发注意力衰减或遗忘控制失效。 在这一背景下,行业开始探索,是否可以把记忆做成模型原生能力的一部分。 大厂的探索颇具代表性,谷歌的hope模型,会尝试给模型设计拥有多个嵌套的学习循环和多个时间尺度的记忆,让模型具备不断学习进化的能力。Meta进一步尝试把一个可训练的超大参数记忆层,塞进 Transformer 里,用于增加模型的记忆能力。 创业公司的代表则是红熊AI。基于MemoryBear的原生能力,红熊AI还研发了通用推理基座OpenBear。 二者之间有明确的职责分工。 MemoryBear负责管理认知:判断应该记住什么,建立怎样的关联,什么时候更新或遗忘,以及在当前任务中提供哪些记忆。 OpenBear负责使用认知:理解目标、拆解任务、进行推理、调用工具、执行流程,并将新的事实、结论和结果反馈给记忆系统。 OpenBear可以从一个简单想法出发,完成需求拆解、架构设计、代码编写、测试和文档输出;也可以跨文献完成研究、形成假设、设计分析路径并输出报告。更重要的是,当它完成第一次任务后,系统还能记住用户的目标偏好、组织的决策方式、过去采用的方法、失败原因以及有效工具组合。 OpenBear操作界面 另外,考虑到在通用推理之外,不同专业场景还拥有各自独特的知识结构和任务逻辑。 以软件开发为例,真实开发过程包含大量不会被完整写进代码的隐性知识: 为什么当时选择这套架构?某个看似奇怪的实现究竟是历史包袱,还是为了规避特定问题?团队已经踩过哪些坑? 这些信息散落在需求讨论、代码评审、故障排查和团队协作过程中,通常不会以一条清晰指令的形式出现。 为此,红熊AI进一步研发了可以工程化落地的 AI 编程模型CodeBear。 CodeBear与OpenBear一样,生长在MemoryBear所构建的统一记忆底座之上。但它面向的是软件工程中的代码理解、架构分析、开发执行和经验复用。 因此,在统一的记忆能力之外,CodeBear增加了针对软件开发的专业建模和任务处理能力,将项目经验进一步沉淀为四类可复用资产: 结构记忆保存模块依赖、调用链和数据流,让新成员或新加入项目的Agent不必每次重新分析整个代码库。 决策记忆记录架构选型理由、历史约束和复盘结论,避免团队反复争论同一个问题,也避免关键判断随着人员流动而消失。 模式记忆总结常见Bug的根因、修复方案和重构路径,让新问题可以匹配过去的工程经验。 共识记忆则沉淀命名规范、测试策略和团队约定,让协作规则不再依赖口头提醒。 CodeBear操作界面 有了这些资产,代码Agent才有可能从一个无状态的工具,进化为理解项目历史、继承团队经验的资深协作者。 由此,红熊AI形成了两条建立在同一记忆根基之上的模型路径:OpenBear面向通用推理和复杂企业任务,CodeBear面向AI 编程这一专业场景。 Memory 的最后一公里,是产品化和场景化 人类的大脑从来不会用同一种方式记住所有事情。 有研究发现,我们记忆电话号码、感知情绪体验、掌握骑车技能以及分析一个人性格时,调用的脑区与认知机制截然不同。 任何离开具体业务场景的记忆设计,本质上都是空中楼阁。 基于以上认知,在2026年7月31日的“记忆觉醒·智能新生”产品发布会上,红熊AI披露,基于统一的记忆底座(MemoryBear)与通用/场景模型(OpenBear、CodeBear),红熊AI又推出了面向智能客服、智能营销、ChatBI 和智能教育四类 Agent 应用。 其中,智能客服Agent在记住客户姓名和历史对话之外,还能记住问题是否解决、承诺是否兑现、情绪是否发生变化,以及当前咨询与过去事件之间有什么关系。 智能营销Agent,也不只是能给用户打更多标签。还能区分长期偏好和短期意图,识别购买周期的变化,判断用户是否已经对某类内容产生疲劳,并随着新行为更新旧画像,避免“千人千面”变成“用过去一次点击,反复骚扰同一个人”。 ChatBI Agent中的记忆则更加复杂。它能记住用户习惯使用的指标口径、部门之间不同的数据定义、历史查询路径和决策背景。当用户说“继续看上次那个转化问题”时,系统不仅知道“上次”是哪次分析、采用了什么筛选条件,还知道相关数据是否已经更新,为用户提供完整、精准的上下文。 类似地,智能教育Agent也能在保存错题集之外,持续判断学生有没有理解概念、是否缺少练习,还是因为注意力和表达方式出现了问题。同样的错题,在不同学生身上可能意味着完全不同的症结——这正是AI记忆支撑的因材施教。 尾声 AI 普及之后,一个经常被讨论的问题是:当每一家企业、每一个人都能以极低成本调用相似的模型和 Agent,彼此之间的差距会不会越来越小? 答案可能恰好相反。 模型能力越趋同,组织独有的经验就越重要。 过去在互联网时代,企业的重要能力是从外部世界找到信息、组织信息,并把公开信息转化为产品和决策。 AI 时代,竞争的重心早已转移。企业仍然需要外部知识,但更稀缺的资产,将是那些持续发生在内部、从未完整写进公开文档的交互。 这些经验只有被主动提炼、持续更新,并被正确的人和Agent在正确的时刻调用,才会从数据变成资产。 一定程度上可以说,大模型时代的数据飞轮,往往是从一个真正好用的AI Memory开始转动的。 附注: MemoryBear评测结果: https://www.memorybear.ai/benchmark GitHub 仓库(评测代码、流程文档): https://github.com/SuanmoSuanyangTechnology/MemoryBearBenchmark Hugging Face 数据集(逐题召回、模型回答): https://huggingface.co/datasets/redbearai/MemoryBear_eval_result
实测千问办公:阿里这个 AI 专家,真的能帮你带货
今天,阿里正式推出企业级 Agent 产品「千问办公」(QwenWork),并开启公测。 它由 QoderWork、MuleRun 和悟空三款产品整合而来,把本地电脑操作、云端长任务和企业协作收进同一个入口,直接在官网 qwenwork.cn 就可以下载尝鲜。 和千问办公一起上线的,还有阿里新一代旗舰模型 Qwen3.8-Max。这次实测,我们从头到尾用的都是这个模型。 它的总参数量为 2.4 万亿,每次推理激活 950 亿参数,支持 100 万 Tokens 上下文和视觉理解,编程与专业办公是这次升级的重点。 我把一些麻烦、琐碎,还得连续折腾好几步的活一股脑交给它,任务一路加码,甚至让它帮我开了场发布会,看看千问办公到底经不经得住这轮「拷打」。 会读文件、会跑命令,也会偶尔闹乌龙 千问办公的界面并不陌生。左边是任务记录,以及「专家套件」「技能」「连接器」「定时任务」和「IM 频道」,其中,「IM 频道」除了支持阿里自家的钉钉外,还支持接入飞书、微信等主流通讯 App; 中间留给对话和工作台;右侧会展开任务步骤与产物。第一次打开,多少能看到一点 Codex、Claude Cowork 这类 Agent 工具的影子。 选好文件夹后,千问办公就能在里面读取资料、创建文件和执行命令。你给它一个目标,它会先拆步骤,再按需调用代码、浏览器和文档处理工具。任务跑起来以后,右侧清单会逐项打勾,生成的 HTML、图片和报告也会直接落进工作目录。 刚好我这台 Mac 的储存空间快满了,在储存空间寸土寸金的当下,自然是能省一点是一点。所以第一个任务,我先让它帮我分析下,空间都被什么东西占了。 感觉现在系统剩余的空间越来越少了,帮我分析一下空间占用分布情况,用直观、美观的 HTML 呈现给我。 它从系统盘一路扫进用户目录和 ~/Library,最后交回一份可视化 HTML。报告开头先给结论:1 TB 硬盘已经使用 762 GiB,只剩 133 GiB;用户目录占了 587 GiB,其中 Samsung Smart Switch 备份、照片图库和微信数据是三个大头。 往下看,Containers、Caches 和 Application Support 又被继续拆开。哪些缓存可以直接清,哪些应用数据需要确认,哪些属于个人文件要自己取舍,它用三种标签分开标了出来。 接下来,我又交给它两个小任务:一个看页面,一个看交互。 做一个虚构电商平台的数据看板,包含销售额、订单量、访客数、客单价、近 30 日销售趋势、品类销售占比、用户来源分布和商品销售榜 TOP 5。 我让它做了一个虚构的电商平台数据看板。它交付了一张带销售额、订单量、访客数、客单价、品类占比和渠道转化率的 HTML 页面,信息层级和图表选择都算规整,算是超越及格线的表现。 看完枯燥的数据,不如让它搓个小游戏,放松一下。 做一个飞行躲避小游戏。玩家操控一架飞机在屏幕中飞行,需要躲避迎面而来的障碍物。游戏要有开始界面、计分系统和结束画面。 千问办公做出了开始界面、计分和结束画面。飞机能跟着鼠标移动,可以吃金币,擦着障碍物掠过还有额外加分。不过,贴图还是略显粗糙,经不起细看。 从苹果财报,到一场不存在的发布会 接下来,我把苹果上周刚刚披露的季报交给千问办公,让它帮忙拆解一下。 把这份苹果季报拆解、分析,制作成一份可视化、直观、图文并茂的 HTML。 它先提取并核对报表数据,再把营收、利润、产品和地区表现做成一组清楚的图表,页面顶部先给结论,图表下面补一句「怎么看」。原始数据表也被留在底部,阅读和回查都很方便。 这里有一个小插曲:它在最后校验 HTML,需要执行一条带有 rm -f 的命令。系统弹出了红色的「高危操作」提示,把会永久删除哪个文件、-f 参数有什么效果、后续还会做什么列了出来,再让我选择允许或拒绝。 这种解释在目前市面上的 Agent 应用上并不多见,但对于刚接触它们的小白来说,却十分有必要:即便不懂命令行,你也能看出它准备删掉哪个文件,以及操作能不能撤销。 不过,同样的解释到了前面的磁盘扫描里,就没那么管用了。它准备执行 kill 45499,提示会强制终止进程 45499,未保存的数据可能丢失。问题是,它没有告诉我这个进程属于哪个 App,也没有说明为什么非杀不可。因此,这个功能还是有些细节需要完善。 做完这些有现成资料可依的任务,我还想试试它的「想象力」和审美: 只给一个模糊的产品点子,它能帮我开一场完整的发布会吗? 于是我临时编了一款产品。LUMA 是一盏智能桌面灯,能读取日程,用灯光提示专注、倒计时和休息,没有屏幕、摄像头与麦克风。售价 699 元,主张是「把时间调成光」。 请从零为虚构产品「LUMA」制作一套 10—12 页的中文新品发布会 PPT。受众为科技媒体、设计师和首批用户。 LUMA 是一盏能读取日历安排的桌面灯。它没有屏幕、摄像头和麦克风,通过灯光变化提示专注时间、会议倒计时和休息间隔。用户的日程在本地处理。 已知信息: 色温范围:2700K—6500K; 六区独立灯光; 尺寸:210 × 65 × 32 mm; 重量:480 g; USB-C 供电; 雾白、石墨灰、苔藓绿三种颜色; 售价:699 元; 目标用户:长期伏案、日程密集、又不想增加一块屏幕的人。 请自行完成品牌主张、发布会叙事和视觉系统。内容需要覆盖产品亮相、交互方式、使用场景、硬件结构、隐私设计、颜色选择、价格和上市信息,但不要机械地按这份清单逐项排页。 千问办公没有急着开做,而是先列出大纲,让我从内置模板里挑一种视觉风格。最后生成了 11 页 PPT,雾白、石墨灰和苔藓绿打底,再用一条暖色光谱模拟灯光。从产品卖点、使用场景到隐私设计、配色、规格和售价,该讲的基本都讲到了。 我比较意外的是,它没有把每一页都做成同一种模板。有些页面只放一句话,有些用来展示产品,有些专门交代参数,节奏看起来还挺舒服。虽然 LUMA 从产品到图片都是临时编出来的,这套 PPT 放在一起却不显得太拼凑,甚至有了一点自己的品牌气质。 做完以后,它还问我要不要检查页面渲染、前后表述和演讲备注。我把几项都勾上,它又逐页检查了一遍有没有文字溢出、图片异常,以及前后说法对不对。 一盏不存在的灯,被它做成了一个品牌 这次,千问办公还有一个挺有意思的新功能——「专家套件」。 它有点像给千问办公安装不同工种的 skill 和工具包。套件广场里已经有市场营销、产品设计、投研分析、合同管理等选项,每一套都组合了这个岗位常用的技能,有些还会接入外部数据。 安装以后,在对话里直接调用就行,不用每次都写长篇大论的 prompt。 我先装了市场营销套件。里面组合了 8 项技能和 1 个数据连接能力,覆盖营销文案、广告合规、竞品追踪、活动策划、社媒热点、SEO、效果分析和品牌调性审查。简单说,它已经把一套常见的营销工作流程装好了。 先从最容易验收的文案开始。我让它为 LUMA 生成一套跨平台宣传文案。 千问办公分别给出小红书种草笔记、微信公众号长文和微博短帖,并配套标题备选、摘要、标签、CTA、A/B 方案和发布时间建议。 小红书文案更口语,公众号负责讲完整故事,微博则把信息压进短句里;它甚至还单独检查了《广告法》里的极限词与绝对化表述,确实有点「专家」的意思了。 文案感觉还行,我就继续加码,索性让它帮我做一整套宣传物料。 帮我给这个产品做一些宣传物料,包括包装、开箱体验、其他周边、礼盒等。 它先问了三个问题:要交概念方案还是可编辑文件,周边准备覆盖哪些品类,标准版和礼盒版如何区分。确认方向后,千问办公沿用 PPT 里的视觉系统,做出了雾白标准包装、石墨灰 First Light 礼盒、开箱内衬、光谱桌垫、色温杯垫、帆布袋、徽章和磁吸书签。 整体的一致性和美观度都很不错,可以看出这次 Qwen 3.8 Max 的多模态能力还是比较强的。 文案和图都准备好了,直接让它排成一组可以发布的小红书多图内容,自然也是不在话下。 左右滑动图片 把这几张做成适合发小红书的排版图。 它把横版效果图重新编成 6 张竖图,封面、页码、双语栏目、标题层级和统一页脚一应俱全,完成度已经达到可以直接发布的程度。 做到这里,我临时编的 LUMA 已经有了 PPT、三套平台文案、包装、礼盒、周边和 6 张小红书长图,每一次的交付物都环环相扣,确实像是同一个团队做出来的东西。 模型额度方面,千问办公新用户注册会送 2000 积分,每天登录再送 600 积分。上面这些任务全部跑完后,我的免费版还剩 1645.53 分。 至少在公测阶段,拿它做一些日常任务,都不需要担心积分不够。 这轮体验下来,千问办公最让我意外的,不是某一张图或某一份报告,而是任务会顺着往下长。一个模糊的要求,可以变成看板、PPT 和宣传物料;前面做过的内容,后面还能继续拿来用。 千问办公也不是孤立的一次产品整合。腾讯把 WorkBuddy 接进腾讯文档,字节将飞书并入豆包所在的业务体系,阿里则把 QoderWork、MuleRun 和悟空收拢起来,再准备接进钉钉。 而据虎嗅昨日的报道,阿里内部把 AI 办公定位为面向企业组织的生产力平台,千问办公与钉钉由同一个事业部负责;短期内优先看的也不是用户数和月活,而是产品是否好用,以及能不能真正跑通企业场景。 BAT(字节、阿里、腾讯)这三家大厂又在一个新战场拼起了刺刀。接下来比拼的,或许就不只是模型有多聪明,还要看谁能把文档、消息、知识库和各种工具接得更顺,让 Agent 真正进入用户每天的工作流程。 回头看 LUMA 的文件夹,最开始只有几句关于虚构台灯的设定,最后却装进了一整套发布会 PPT、平台文案、包装方案和小红书长图。一个原本没想清楚的点子,就这样有了可以翻、可以看,也可以继续往下改的样子。 所以下一次再冒出类似的念头,我大概还是会先给它建个文件夹。 *封面、部分插图由 AI 生成
对话卓驭 CEO 沈劭劼:汽车在被撞前 0.01 秒退出智驾肯定是不行的
智能辅助驾驶技术对于普通驾驶者来说,无异于「魔法」:车居然自己会开? 在深圳欢乐海岸,红旗天工和卓驭开了一家有些特殊的展厅,想把「魔法」进行解密: 车辆陈列不是这里的重点,展厅以「移动物理 AI」为主线,设置智能辅助驾驶和车载无人机两条产品线,并将感知、算法、驾驶决策等抽象技术拆解成五个互动体验区。对于普通消费者来说,这些过去藏在工程师电脑、域控制器和发布会演示视频里的东西,终于有了更直观的展示机会。 大部分的智驾供应商很少需要直接面对消费者,他们的名字可能出现在配置表里,也可能被概括成某套驾驶辅助方案,真正被用户感知的依然是汽车品牌。在很长一段时间里,供应商最重要的工作是完成开发、保证交付,然后留在幕后。 卓驭这次选择向前一步。卓驭科技 CEO 沈劭劼说: 卓驭跳出作为传统供应商,正式走向前台,去探索不仅仅是做产品、技术,也能看看 C 端到底能够传递一些什么东西。 展厅开业当天,全新一代红旗天工 08 也在深圳上市,限时权益价为 17.99 万元。新车首发搭载卓驭「高悟性端到端 4.1」系统,采用由仿生双目与长焦单目组成的「惯导三目」视觉方案。 相比于已经落地的具体车型,在展厅内的采访则聊得更远。端到端 4.2、原生多模态模型、面向 L3 的三冗余架构,以及卓驭从乘用车智驾向「移动物理 AI」延伸的方向,共同勾勒出红旗天工与卓驭接下来数年的合作路线。 这座面向所有人的展厅,某种程度上也可以说双方关系有了新的变化,智驾供应商开始走到消费者面前,车企与供应商之间沿用多年的边界,也在被新一轮技术周期重新划定。 从端到端 4.1,到「比人快 0.1 秒」 全新一代天工 08 搭载的端到端 4.1,源自卓驭在 2026 年 4 月发布的端到端 4.0。 按照卓驭 CEO 沈劭劼的介绍,4.0 已经完成完整的数据驱动,包括横向、纵向控制,以及变道和导航决策。4.1 的版本号只向前迈进一小步,模型在驾驶体验上的变化却相当明显。他说: 小版本是 4.1,没加多少,但性能变化非常大。 所谓性能变化,不只是车辆能否完成一段从 A 点到 B 点的导航辅助驾驶。系统何时变道、怎样超过慢车、面对加塞车辆如何反应,以及能否在路口和视野盲区提前减速,都会影响用户对它的评价。 沈劭劼将这种能力概括为「老司机的感觉」。它意味着车辆开始学习人类驾驶中的大量微动作:看到路边行人时略微收油,经过积水路面时降低速度,进入没有交通信号灯的路口前提前观察。过去依靠规则编写的系统,很难穷举这些细微而复杂的判断。 卓驭还计划在 2026 年内推出端到端 4.2。沈劭劼预计,随着 4.2 落地,现阶段端到端技术范式会逐渐收敛,性能大致达到「百公里安全接管一次左右」。 他给出的另一个数据,更能说明智驾技术目前的变化速度: 行业平均水平百公里平均接管,今年比去年降了 10 倍,不是夸张,而且提高的趋势目前没有减慢,还在快速提升。 燃油车时代,发动机热效率、传动效率和油耗水平通常以几个百分点缓慢进步;今天的辅助驾驶依然处在技术范式快速更替的阶段,模型、数据和算力的变化,都可能在几个月内重写原有体验。 这也是沈劭劼暂时不愿判断智驾供应商市场最终会「赢家通吃」还是「多家并存」的原因: 甚至在现在这个时候,连技术范式都还没有完全收敛。当接管率还可以一年降 10 倍的时候,技术范式锁定的时候,你不应该看得到这种级别的提升速度。 在端到端 4.2 之后,卓驭计划于 2026 年第四季度,与红旗天工首发下一代原生多模态基础模型。按照沈劭劼的说法,这套模型将在规模、训练范式和数据来源上出现较大变化,对应海外 FSD V14 所代表的新一代路线。 相比模型拥有多少参数,用户更容易感知的是车辆反应速度,沈劭劼这么介绍其中的区别: 端到端的感觉,有点像前面看到了一个东西进来了,可能过了 0.1 秒、0.01 秒之后,这个车开始有反应。到了下一代技术模型之后,你的感觉就是车先有反应,人才看到这个东西,属于车比人快 0.1 秒和车比人慢 0.1 秒的区别。 人类驾驶员的注意力需要在前车、后视镜、导航和道路两侧之间切换,车辆的摄像头则可以持续观察多个方向。当行人靠近道路、旁车出现变道趋势,模型可能在人类驾驶员意识到风险之前,便开始减速或调整轨迹。 复杂的多模态模型,最终被压缩成一个只有 0.1 秒的体验差异。但在高速移动的汽车上,这 0.1 秒会转化成数米距离,也会影响驾驶者是否愿意把控制权继续交给系统。 全新一代天工 08 将通过 OTA 获得这套模型。沈劭劼明确表示: 明年上半年一定会把比人快 0.1 秒的能力给 OTA 上去,这个平台还能打很久。 现有车型可以持续获得模型升级,硬件边界仍然客观存在。沈劭劼也提醒用户,现款天工 08 无法仅通过软件升级进入 L3。 面向 L3 的下一代天工平台计划于 2027—2028 年推出。根据双方披露的信息,该平台将采用超过 1000 TOPS 的三冗余域控制器,并配备固态激光雷达、补盲激光雷达和 4D 毫米波雷达。电源、控制、底盘和动力系统也将围绕 L3 的安全要求重新设计。 沈劭劼判断,到 2027 年中,L2 辅助驾驶将逐渐进入体验「比较满意、收敛」的阶段,装车率随之快速增长。此后,行业的主要竞争会进一步转向 L3、L4,乘用车高阶自动驾驶与 Robotaxi 的技术边界也将越来越模糊。 供应商与主机厂开始共用一张时间表 在传统汽车供应链中,主机厂负责定义整车,供应商按照项目要求交付零部件或系统。责任、成本和质量边界都可以通过合同划分清楚。 这套模式形成于一个技术周期相对稳定的年代。冯彪提到,燃油车时代,一款内燃机的更新周期往往长达 10—12 年。主机厂可以先等待技术成熟,再寻找供应商定点,双方沿着既定流程完成数年的开发和验证。 智能驾驶的技术节奏完全不同。 沈劭劼坦言: 辅助驾驶技术发展非常快,不夸张说技术范式 3 个月变一次是很正常的事。 一套刚刚形成的模型,需要经过车企立项、验证、定点和量产。等到正式上车,下一代模型可能已经出现。对于智驾公司而言,最先进的技术未必能够最快获得客户;对于车企而言,任何新技术又必须接受严格的质量与安全验证。 沈劭劼并没有回避这种矛盾: 我们自己本身作为完全的供应商,乙方供应商的角度来讲面临的最大问题,不是找不到客户,而是找不到客户用我们最先进的东西。 红旗天工与卓驭尝试建立一套更紧密的联合开发模式。双方共同定义用户场景、测评准出体系和开发节奏,研发团队从项目早期便沿着同一条时间线工作。 一汽红旗天工事业部总经理冯彪说: 我们所有现在的产品开发,无论是准入、准出的标准、用户场景的定义、开发节奏、双方联合开发的编队,它就不是供应商和主机厂的关系,就是我们联合开发的关系。能够走到台前,就是因为不是供应商的关系。 双方关系的变化,在智驾与底盘、动力和车身控制开始融合后更加明显。 沈劭劼举了一个经过水坑的例子。车辆一侧车轮驶过积水,左右车轮附着力不同,传统系统可能触发车身稳定程序,随后让辅助驾驶退出。新的处理方式可以让视觉模型提前识别水坑,选择绕行;也可以在通过水坑前主动降低速度,并协调智驾和底盘控制系统,减少突然退出的概率。 这些东西完全按照供应商的模式都扯不完,里面任何一个功能按照最后的质量条款划分都能扯半天,但是我们现在都没有这些问题。 按照过去的分工,视觉系统负责识别,智驾域控制器负责决策,底盘负责执行。发生问题后,各方很容易将注意力放在责任归属上。随着汽车逐渐成为一个更完整的智能体,这些功能之间需要更高频、更深入的协同。 冯彪认为,车辆打滑时,智驾系统简单退出并把控制权交还给驾驶员,只是当前安全边界下的解决方案。用户更期待的状态,是车辆能够联合调动转向、动力和制动,帮助驾驶员控制住车辆。 因此,红旗天工和卓驭的下一代平台合作已经延伸至智能底盘、动力域和整车控制。卓驭提供模型、感知与决策能力,红旗天工掌握底盘、动力和整车安全,原本清晰的技术边界开始相互渗透。 沈劭劼用「因为相信,所以看见」形容这种模式。车企会在技术形成早期便参与进来,与智驾公司共同完成工程化和量产验证,而非等到所有结果都已经摆在桌面上再作决定。他说: 我们会一起把最先进的东西去首发、落地,在第一天就做了这个决策我必须要用,而不是去纠结你先做出来,做出来我看着好再用。 这种深度合作也需要接受市场检验。 冯彪透露,天工 08 从 7 月 1 日开启预售,到 8 月 1 日正式上市,仅间隔一个月,预售效率较红旗以往车型高出「几十倍、几百倍」。现场没有公布具体订单数量,这一说法暂时只能反映红旗自身产品之间的纵向变化。 在天工品牌三年达到年销 10 万辆的规划中,5 米级大五座 SUV 预计贡献 20%—30%,甚至更高比例。天工 08 会是销量支柱,产品本身也会随着软件、硬件和市场需求持续调整。 冯彪说: 很难说这个时候的 08 会一直保持到那个时候。如果这样做,它也无法适应当前中国新能源市场激烈的竞争态势和新增用户的需求场景。 从智能驾驶,走向「移动物理 AI」 目前,卓驭拥有 34 家大小客户,常州第二座工厂已经投产,产能提升约一倍。2026 年以来,公司在乘用车和商用车领域获得的定点数量,已经超过过去两年之和。 卓驭的业务范围也在从乘用车向外延伸。沈劭劼透露,首款搭载端到端智驾系统的商用车预计于 2026 年 8 月投放,重卡干线物流和无人物流车将在近期展开较大规模试运行。 这些业务被纳入卓驭提出的「移动物理 AI」框架。 在沈劭劼看来,物理世界中的任务可以大致分成「移动」与「操作」两类。卓驭关注车辆、轮式设备或有腿机器人如何从 A 点移动到 B 点;机械臂和灵巧手面对的抓取、装配和手眼协同,则属于另一套数据结构: 所有移动类任务的特征都是这样的:我的传感器装在平台上,传感器运动轨迹和平台运动轨迹一样。操作类的任务特征不是这样的,它是传感器和实际操作不在一个坐标系上,它是手眼协同的过程。 汽车、重卡和无人物流车的外形、载荷与使用场景差异很大,但它们共享相近的数据关系:传感器跟随移动平台一起运动,模型需要理解空间、预测其他交通参与者,并规划一条安全轨迹。 基于这一判断,卓驭希望把辅助驾驶积累的数据、模型和工程能力复制到更多移动设备上,同时暂时避开机器人「上半身操作」任务。「移动物理 AI」由此成为一家智驾供应商扩展业务边界的方法。 不过,无论车辆还是其他移动设备,最终都需要处理真实物理世界中的安全问题。 在纯视觉与激光雷达的路线争论中,沈劭劼认为,两种方案各有能力边界。激光雷达是主动感知系统,在部分极端光照环境中具有优势;「惯导三目」依靠立体视觉,图像信息密度更高,对细小障碍物也有自身优势。 这里面有一个关键问题,是系统抵达感知边界后会采取什么动作?沈劭劼说: 任何系统都有对应的系统边界,关键是到了这个系统边界,和消费者有没有一个恰当的交互。不是说撞之前 0.01 秒退出,这肯定是不行的。 沈劭劼并不赞同为了证明传感器性能,就让车辆在大雾等极端环境中继续维持 120 km/h。更加合理的方式,是让模型根据能见度、路面状态和交通环境主动改变驾驶策略。他说: 谁说大雾的时候我要开 120 公里?如果模型本身就具备这个能力,整个系统的驾驶行为和当前的环境是匹配的。 当视野变差,系统主动降低速度;进入盲区,车辆提前采取防御性驾驶;确认无法继续处理时,再把控制权留给驾驶员。这些动作比单纯增加传感器数量更接近一名成熟司机的思考方式。 卓驭也对「人车共驾」划出了相对清晰的边界。驾驶员可以在拥堵、变道、抢车位和路线选择等效率场景中帮助系统,但在高速、高动态的安全场景里,人和车辆同时做出控制动作,反而可能相互干扰。 我们会尽一切可能避免出于安全考虑的人车共驾。 即使系统必须退出,也需要给驾驶员留下充足反应时间。沈劭劼说: 即使退出,还是那句话,别撞之前 0.01 秒退出,要退提前 5 秒钟退吧。

版权所有 (C) 广州智会云科技发展有限公司 粤ICP备20006386号

免责声明:本网站部分内容由用户自行上传,如权利人发现存在误传其作品情形,请及时与本站联系。