行业分类:
加载中...
头条分类:
加载中...
AI真的可以“工业化”产出精品游戏了么?一个AI原生游戏团队的创新实验
当AI接管代码和影像后,社媒上一度流行“一句话跑出游戏”的各种DEMO演示。 可直到今天,完全用AI打造的现象级游戏,几乎无处寻觅。为什么?在Coding Agent和视频模型高速发展的今天,AI原生游戏的困难到底在哪里? 与此同时,一个4个月前,才全面转入AI游戏赛道的团队,上线了当下定位于“AI精品游戏”的平台Elseland。 平台上已经上线了大量来自创作者和工作室的游戏。其中,更具代表性的,则是Elseland团队基于自研游戏开发工具,打造的数十款“原创游戏”。CEO刘耕提到,他们已经能把数百关体量精品游戏的生产时间,从一年降到一星期左右。成本的百倍下降,是支撑快速创新与验证的基础。 更令人好奇的是,这个团队中大多数人,在4个多月前还主要在开发和运营一款视频与短剧工具——Elser.AI。 4个月,他们到底把游戏搞成了什么样子?带着这个疑问,我们去探索Elser团队背后的故事。 一、不一样的“互动影游” 林知夏,从小镇做题家到都市白领,一路奋斗。直到40多岁时,她忽然发现自己不知不觉间已失去了一切。梦想、青春、亲人、爱人…… 没有时间陪伴重病缠身的母亲,直到母亲忽然离世;没有勇气追寻青春时憧憬的爱情,直到恍惚已半生;没有时间去多感受几分春花与秋月,微雨与落霞;甚至没睡过几个安稳的整觉。 劳碌应付、疲于奔命,转眼年华老去,猝然结束这一生,带着深深的遗憾离世……这是知夏“不值得”的一生。 好在,她重生了,回到了90年代。她放弃了大学分配的工作,回到山水如画的故乡——青河镇。新的长卷等着她去书写。 这一世,她终于可以修好母亲的那把旧椅子,陪她午后长坐,聊聊闲话;可以抓住时代的春风,把家乡滞销的农产品,精心加工,打通渠道,卖向千家万户;可以从抽屉里翻出昔日不曾打开的情书们,听凭心之所向,挑一个男孩,开启一段曾被错过的缘分;可以重新过一场大胆热烈的人生…… 这不是一部流行的“年代剧”,而是一部完全由AI制作的乙女向“混合剧游”——《回到风吹过的地方》。为什么称它为“混合剧游”而非“互动影游”? 因为《风吹》并非只是传统的影像叙事+剧情走向选择的互动模式,而是融入了城镇地图,商店经营,宝箱拆除游戏,恋爱互动多种玩法的创新形态。 这款游戏的制作人家颖提到,她希望玩家不止步于选择,等待剧情发生,然后被动回退;而是能主动去经营、闯关、拆解,通过自己的努力来主导游戏走向,并体验相应的剧中人生。 不只是《回到风吹过的地方》。他们进行了一系列融合AI影像与游戏的探索。 《魂天·彼岸》,是一部以剧情查案为核心的国风悬疑“互动影游”。它虚构了一个惝恍迷离的彼岸世界。 下城跑腿人沈烬意外卷入一桩离奇命案:死者阳寿已尽,系统却显示他仍然活着。循着一条白线、一缕冷香灰和一件彼岸花遗物,他发现命案竟与女友苏意多年前的死亡有关。追查白七,进入彼岸鬼市,翻找记录生死的账本…… 沈烬逐渐发现,凶手只是执行者,真正藏在背后的,是一套能够篡改寿命、操控命运的系统。 《魂天·彼岸》将影像叙事与证据推理、人物审问、关键抉择和多结局探索结合。玩家既要寻找线索、判断真伪,又要决定是否隐藏证据、交换记忆或阳寿。一次误判,可能导致调查失败;正确的选择,则可能揭开隐藏的真相。 制作团队希望玩家不只是观看剧情、点击选项,而是主动参与“查案、查账、改命”,增加游戏的推理深度和玩家的游戏掌控感。 《魂天·彼岸》由三人团队历时两个月制作。在开发游戏的同时,他们还沉淀了一整套AI互动影游的开发工具,覆盖从剧本到影像、配音的全流程,未来作为整个游戏Studio的一部分,开放给更多创作者和工作室。 而《老鼠追猫》,则主打诙谐搞笑。谁能想到一只乡下农场的老鼠一见钟情了来自城里的猫,这场跨越种族和身份的追求注定不容易。 为了靠近心爱的猫,老鼠必须变身“小游戏达人”。它接受了农场居民委托,得完成二合游戏,换取金币资源;还得探索大地图,躲避母鸡攻击;最终找到珍贵物品,安全带回,完成任务。 此外,游戏还引入了宝箱抽取玩法。就像追爱不只需要勇气,也需要一点运气。在喜鹊巢穴里,小鼠可以用黄宝石抽取一些幸运物品,来更靠近幸福和惊喜一些。 不仅如此,游戏还穿插了躲猫猫、平台跳跃、迷宫等独立小游戏。对小鼠来说,人类的房间不是普通的房间:洗手池像悬崖,浴室地面像冰原,一只突然落下的鸡爪,可能比整间房子还要危险。这些“小鼠的体验”通过小游戏,成为每个玩家的虚拟经历。 游戏制作人周周提到:《老鼠追猫》表面上讲的是一只恋爱脑小鼠,如何冒着被猫吃掉的风险追求爱情;但在更深处,它想讨论的是:当两个生命来自完全不同的世界,爱究竟意味着改变对方,还是努力成为更好的自己? 二、把所有游戏类型用AI重做一遍 他们的野心,并不止于这类影像+游戏的形态。他们相信,几乎所有的游戏类型,都可以用AI重做一遍。 “糖果王国”:糖果人3D“吃鸡” 这是一个完全由大模型完成3D建模的糖果风格派对射击游戏。在这个游戏里,玩家可以化身为憨态可掬的糖果小人,在各种游乐场里快速开启一场对决。 糖果王国目前开放了“大乱斗”、“警匪对战”、“乐园游览”等玩法。玩家还可以通过轻量化的地图编辑器,快速搭建自己的游乐场。 枪械、载具和建筑都是各类糖果的拼搭。子弹击中战场或角色,则会在身上和地上留下各种糖块和糖汁的痕迹,直到把战场变得五颜六色。刘耕提到这个游戏的创意来自《格林童话》的糖果屋,从小时候起,他心中就种下了一个能被“吃掉”的城市,巧克力砖墙,果汁小溪,方糖汽车…… 下一步,刘耕计划把它变成一个真正的“无限”糖果王国,包含各种地图和玩法,除了枪战外、还有赛车、经营、社交……让玩家可以在一个糖果世界里随时休闲一把。 “水豚牌馆”: 这个游戏以德州扑克的计分机制为基础,搞出了一出“狗血”的海外赌神成长+家庭复仇大戏。上一代赌王水豚先生意外输光资产后离世。小水豚不得不继承家业,从地下牌局开始逆袭,一路把水豚牌馆做大做强,击败郊狼、眼镜蛇、豹哥等众多反派。结局,他发现当年父亲意外离世的秘密,以及父母那段充满遗憾的爱情往事,和身为黑帮大佬的外公展开终局对决。 这个游戏把德州扑克搞出了五花八门的玩法,1V1PK,肉鸽闯关,双人成行,大乱斗……配上千奇百怪的游戏道具,再用漫画剧情串起来。不同于“小丑牌”的硬核肉鸽闯关,“水豚牌馆”想探索更诙谐轻松搞怪的体验,给玩家更多休闲与治愈。 “Diamond Blast”和“Hexa blast”:消除还可以这么玩? 这两个游戏则做了创新的消除机制。“三消”玩法大家早已熟悉,似乎创新空间已经非常有限。 在Diamond Blast中,他们发明了一种“三角消除”的玩法,从凑同色连线改成凑三角。点击一个宝石,周围一圈宝石就可以沿顺逆时针方向转动,只要凑出一个同色三角或多个三角,就可以清光宝石。一次性消除的宝石越多,获得的积分奖励也会更丰厚,还会有特殊功能的宝石奖励。 而Hexa Blast,则把消除和拼图结合起来,在正六边形表盘上,任何一条线填满,即可消除。当然,分数奖励也随着同时消除的连线数而激增。 目前,两个游戏都已经开发100关以上,支持长时间的娱乐体验。 因此,即便是极其成熟的玩法,依然有“大开脑洞”的机会。 土拨鼠数独(Groundhog Sudoku 3D):花园智力大作战 这个游戏把“数独”的逻辑思考和“打地鼠”的经典场景结合起来。玩家需要通过自己的逻辑推理,在花园里种上各色的花朵,把花园妆点得五彩斑斓。同时,玩家需要揪出隐藏在花园土壤里的土拨鼠,避免他们啃食根系,破坏花园。 每种花下,有且仅有一只土拨鼠;而每只土拨鼠的周围和同一条线上,也不能有其他的土拨鼠。基于这样的规则,玩家可以用智力揪出每一只土拨鼠,还花园一片安宁。 目前,游戏已经提供“无限关卡”的模式,可以不停地玩下去。未来,还将引入花园种植等模块,让数独游戏闯关的奖励变得更鲜活,更有延展场景。 《星火信使:黎明线》和《卡皮巴拉冲冲冲》 这又是“成熟玩法”结合“创新叙事”带来的新体验。 跑酷的玩法早已十分成熟,它的乐趣通过来自高速移动、金币收集、躲避障碍和节奏感带来的即时刺激。 《星火信使:黎明线》则尝试将“跑酷+运输+末日叙事”结合起来,为“跑”增加更明确的目标和意义。外星能量降临后,人类的无人机、自动货运等各种运输科技相继失效,最可靠的运输方式重新变成了:人类自己奔跑。负责穿越死地、运输关键物资的人就是“星火信使”。 玩家扮演“星火信使”,在死域中高速奔跑,躲避灾害、怪物和能量障碍,把关键物资送到濒临熄灭的人类据点。每次成功运输,都能推进据点复苏,点亮据点、净化黑暗区域,最终连接整张地图,建立“黎明线”能量网络,保留人类文明的星星之火。 当用AI生成的动感音乐响起,玩家仿佛置身《银翼杀手2049》的荒凉废墟里,开启一场快节奏的星际穿越。 《卡皮巴拉冲冲冲》则尝试将“跑酷+收集+队伍成长”结合起来。玩家从一只卡皮巴拉开始,在奔跑途中不断收集散落的卡皮巴拉伙伴,同时躲避障碍,保护队伍。 玩家可以自选不同动物伙伴,比如小兔子小狗小熊猫等。收集到的伙伴自动堆叠成塔,让玩家可以直观看到自己的成果越来越“高”。从一只到一塔,从”人“到”众“,除了跑到终点,收集伙伴、壮大队伍也是游戏的核心目标。 这也让简单的跑酷游戏多了一点人生旅程的含义:奔跑不只是为了去往终点,也是为了在沿途遇见更多伙伴,和他们一起抵达。 这些游戏,最终通过Elseland这一APP,集中向用户展现。目前Elseland上自制+创作者创作的游戏,加起来已经数百款。不同于主打一句话生成的小游戏平台,Elseland定位于每局3-5分钟,总游戏时长却可达数小时的混合休闲游戏,对游戏内容有比较严格的质量要求和审核标准。 可以看出这个团队在用AI整活上,已经是五花八门层出不穷。他们不满足于用AI快速复刻爆款游戏;而是基于爆款和用户洞察,坚持最大胆的创新。 但令人惊诧的是,这个团队全面转入AI游戏开发,不过是4月份的事情。在那之前,他们还在做一款AI视频工具——Elser.AI。 但更早开始,他们的CEO刘耕,已经独自在探索新的事情。从2月到4月初,49天,刘耕一个人带着17个Agent,搓出了一个AI 2D开放世界游戏和全套的编辑器。 那个时候,团队同学们,怀疑自己很快将会被Agent取代。毕竟CEO和Agent相处的时间,已经远远超过了和公司的所有人;甚至他开始在一堆活人的飞书群里,拉入几个Agent,然后无视活人们的感受,和agent们疯狂互动,@伏羲,监督女娲(Agent制造师)、爱迪生(剧本大师)和鲁班(建站大师)们分别出活,然后还@活人们围观学习。 种种迹象表明,当CEO从赛博宇宙出关的那一天,就是灭霸打响裁员响指的时刻。 不出所料,全员会来了。但刘耕在会上宣布的不是裁员,而是一堆更奇怪的名词,什么AI原生、Agentic组织,三三制…… 但不管CEO如何不说人话,裁员究竟未曾发生。就这样,Elser.AI团队变成了8个小组,以平台为轴,串联多个类型游戏小组和一个工具小组。 一个三十余人团队,在逆风时几乎全员留守,4个月内完成彻底转型,并交出上面的答卷……AI时代“原生组织”的进化速度,仍然超出了想象。 三、从一个人到一群人 2026年2月,Seedance2.0横空出世,席卷视频模型市场。与此同时,作为下游的视频工具,提前进入白热化竞争。 彼时,Elser.AI视频工具发布刚两个半月,月活和收入正以每月数倍的速度增长。1月登顶Producthunt日榜后,单月访问已突破20万。而新一代Agentic无限画布工具-ElserStudio,也在紧锣密鼓的开发中。此外,Elser.AI已完成海外短剧App的开发上线,并围绕工具搭建起成熟的短剧生产管线,先后拿到腾讯和Tiktok的短剧合作……从工具到AI短剧平台的布局似乎已经完成。 但这个时候,刘耕却嗅到了危险的气息。视频模型的快速进化,吃掉了AI工具上一个时代大量的工程红利;而AI Coding的发展,进一步让工具功能的壁垒降低到数天级。供给爆炸,又带来内容和流量端的残酷竞争。在内卷化下,补贴和价格成为竞争的关键要素。但作为初创企业,他们并没有那么多的弹药可打。 刘耕决定,不打视频Agent这一仗。不签Seedance年框,不补贴,推迟ElserStudio的开发上线……因为,在危险的同时,他看到更大的新机遇正在出现。Coding Agent的爆发,已经成为所有AI应用创业一个颠覆性的转折点。他需要腾出精力,聚焦更重要的事情。 在AI创业之前,刘耕对编程的理解基本出于自学。由于对游戏的热爱,为了能用Unreal、Unity开发游戏,他自学了C#,C++等语言;进入字节工作后,为了提升技术认知,他又开始自学算法……尽管涉猎众多,但由于创业和大厂工作繁忙,他始终缺乏密集的一线经验。直到AI彻底改变这一切。 25年中,他开始接触Cursor、Claude code等Coding Agent,也用N8N等平台手搓工作流。25年底,他发现Coding agent真的可以稳定交付高质量的结果了——比如快速完成一个完整的小游戏。这背后也许藏着一些平台级的新机会。因为和短剧的情绪交付相似,低门槛快节奏+长留存钩子的休闲游戏,已成为市场高速爆发的力量。 问题是如何切入?类似Sora,快速接入模型,让用户像生产视频一样生产小游戏?还是做一个类似Elser.AI和ElserStudio的专业游戏工具? 在Coding agent爆发之前,Workflow或Agent创业,往往是通过程序员开发大量的工具、工作流、知识库、记忆库和交互界面,弥补大模型在专业领域的不足,并贴合人的操作习惯,把LLM能力嵌入具体的工作场景中,来让LLM干活。但当AI搞定代码能力后,它可以在搞定产出的同时自我进化,不断武装自己的工具库、Skill、界面…… 这既意味着手握Sota模型的Coding agent,如Claude Code和Codex,可能吞噬掉此前的大量agent的创业机会;也意味着此前的工程壁垒被代码的廉价化给抹平。 但另一种叙事:比如“人人都可以做游戏”,“一句话做游戏”;却如同一句话做短剧一样,一直被刘耕所怀疑。AI可以接管代码和影像生成,但无法接管创意,更无法接管人通过持续的审美判断和精细琢磨这一艺术创造的过程。 当工程不再是壁垒,当内容生产的门槛被无限降低,当粗制滥造的“结果“雪片般飞来,AI游戏平台创业,究竟该如何起步? 2月初,刘耕先孤身开启了自己的探索,一个人探索了49天,搞了个Elseland web版。这在当时是颠覆式的创新实践,媒体报道后迅速出圈。 但投资人见了刘耕后,常说的一句灵魂拷问是:“你一个人做了个开放游戏平台?那你的团队在做什么?你为什么不裁员?” 但刘耕清楚,一个超级个体,不可能打败一支成建制的团队,更不可能独自创造一个平台。 技术革新对所有个体和组织都是共同的变量。谁能创造AI时代独一无二的新组织,用组织的创造力、速度和复利能力,乘上AI的效率,才能创造传统组织百倍的速度和价值比率。 他必须从一个人探索,快进到一群人战斗。 而不久后,他终于找到了那个答案——在人和机器之间,构建一个以Taste和数据为核心,以优质内容为组件,以Agent为引擎的系统。 他把它比喻为AI时代游戏的T流水线。 战略的执行非常迅速。全员会开完后第二天,团队围绕游戏平台和各类目小组,实现了新的架构。所有人开启新的征程,几乎没有多余适应时间。 四、批量“创新”背后——一个全新的游戏“工厂”模式 AI始终只是一个工具。或者说,它只是一个高明的模仿者,而缺乏原创能力。 很多人在测评新模型时,总试着让AI一句话生成愤怒的小鸟,甚至尤里的复仇,然后惊叹AI的超能力;但当让AI进入全新的游戏机制设计和开发时,往往对话几百轮仍然错误百出,UI粗糙丑陋,数值混乱,可玩性极差……是以在AI游戏已经如过江之鲫的当下,我们依然无法看到一个现象级的爆款。 我们如果把AI类比成内燃机,而精品游戏,就类似打造一台福特汽车,除了内燃机外,它还需要工厂,需要各种高质量的配件,还有天才的设计师和靠谱的工程师,才能打造一个稳定生产的流水线。 而Elseland正是用这种方式去重构了游戏产线。 一个个包含制作人、美术和游戏工程师的小组,和一个持续自进化的游戏工厂Elseland Playground Studio——这个Playground不再聚焦于模型套壳、Skill和Workflow,而是把壁垒建立在高质量游戏“配件”的打磨上。一个配件,可能是一个三消玩法、一个二合玩法,一个格斗玩法,一个驾驶模块,一个枪械操作模块,一个视频互动系统,一个AI NPC系统……这些代码化的玩法和游戏设计,沉淀着人类对好玩、有趣和美的Taste与理解;又有着反复打磨后的代码稳定性,能够被Agent快速调用或借鉴。 当用这套系统开发一个新游戏时,你不再需要从0到1去开发一堆错漏百出的代码,你只需要Import成熟的玩法,再加入自己天才的创意,便可极快开发一个新的游戏。 比如下面这款100多关的Fruit frenzy弹射游戏,便是刘耕调用了Playground系统里已经开发完毕的水果和动物资产系统,弹射物理,打地鼠的地鼠模块,水果爆破溅射、商店系统等,结合自己的创意,在不到2天的时间内完成100关的游戏开发,并由AI的数值管线在多次模拟中调节难度。 在积累了半年后,除了重度3D游戏外,Elseland几乎已囊括了市面上各类常见游戏玩法的核心模块。新增的创新游戏,又源源不断地为它贡献新的原创高质量配件,如糖果王国中的糖果风资产系统,3D开放世界里2000+的动作集等等。于是,它成了一个真正“自进化”的系统。 除了工厂本身持续不断地升级外,在这样奔跑了4个月后,刘耕欣喜地发现,这套系统,正把其中的每一个同学,改变成AI时代,新的游戏匠人。 以制作人张悦为例,这位美国塔夫茨大学的发展心理学硕士,职业生涯曾跨越教育、数字医疗等领域。游戏作为一种底层的帮助人快乐和认知的方式,曾浸透于她工作的方方面面,她设计过多款帮助孩子提升记忆力、反应力的小游戏。但直到现在,她独特的领域认知,结合AI赋予的技术平权,她终于能把脑中的想法变成更完整更成熟的形态,从产品经理成为一个“制作人”。 又如王志鸿,这位毕业于香港科技大学的资深程序员,如今独自开发了多款游戏。两个月前,他做的游戏还是非常简单的打僵尸、自走棋这种超轻量小游戏。如今,他已经能独立完成“海岛塔防”这种3D SLG游戏。 刘耕说:“真正令我兴奋的,并非这些制作人马上能产出爆款游戏。而是,他们率先完成了自我进化,掌握了新生产力。并不是每一辆车都能卖爆,但使用‘新流水线’的组织,最终会战胜停止进化的组织。而产业革命,从来不只关乎蒸汽机、纺织机和电力……而是更关乎产业中那群革命的人。” 五、坚持三年的AI互娱平台之梦 刘耕始终坚信,AI将带来全新的内容平台机会。 从第一次创业起,他一直在等待和创造这个机会。 2017年,他的第一个创业念头,就是一个AI低代码工具+推荐算法的游戏社区。但当时的他,对技术和产品的理解尚不成熟。2021年,他在字节萌生出短剧平台的创业想法,却因留恋抖音电商和创作者的实操学习机会,未离职创业。 这两个先后被Roblox和红果短剧验证的创业想法,并未让他产生错过机会的遗憾,反而强化了他“平台创业”的信心,因为他总能先于时代,看到那个尚隐隐绰绰的机会。 23年初,他完成了Elser第一版项目文档,对Elser的终极愿景,就是一个人和AI智能体共存,串联起IP互动、短剧和游戏体验的娱乐世界。而Elser和Elseland的意义也来自于此。他希望每个人都可以是“Elser“,随时可以开启另一种人生。而他们为平台确定的第一个切入点,就是AI漫剧。 但亦因为坚持平台之梦,Elser的这段创业经历并不容易。他们放弃很多更容易收获短期结果的机会,从23年初的chatbot,到24年的图片社区等等。离开字节后,经历了一年多的努力和探索。直到25年,他们才先后拿到种子和天使轮。 但显而易见,作为最早看准AI漫剧机会的团队,他们却并未真正吃到这波机会最大的红利。 对此,刘耕坦言: “机会对所有创业团队都是均等的,看得早并不意味你在机会发生的那一刻,你握有更多的底牌。有时候正确判断战场形势并主动撤离,比不合时机地进入一个战场更需要勇气。因为你必须面对内外部的各种质疑,带团队开辟新的战场。 当然,我们其实并未真正放弃过漫剧,因为它已成为我们创新游戏和内容能力不可分割的一个部分。我们的Elser.AI依然有稳定的用户,而服务B端漫剧和游戏客户的画布工具ElserStudio,也很快会正式发布。 但正因为从AI短剧工具和平台上的战略重心转移,我们赢得了在AI游戏平台上的一线生机。” 刘耕指出,上一代内容平台的爆发,是依托渠道革命;新一代内容平台的逻辑完全不同,它依托的是产业革命。 变革一个产业,比从web切到手机要难得多。它需要全新的“工厂”,和全新的产业人才。从漫剧产业到游戏产业,他看清楚这件事的本质。 现在是一个AI原生的组织,一个持续进化的AI游戏“系统”,和一个差异化定位的游戏平台;未来,他们要用“系统”装备无数有品味和想象力的创作者,把他们变成新时代的超级制作人。 在创业三年后,这个团队终于找到了自己,关于如何在这个时代构建内容平台的答案。 AI,正让一切变得不一样。而用审美、热爱和想象去驾驭AI的人,才是最终改变世界的答案。 他们在做的,就是先努力成为这样的答案,然后找到更多这样的答案——一起去创造,属于他们的Elseland。 在这里,每个人都可以像《风吹》里的知夏一样,去弥补自己充满遗憾的人生。 注: 1、游戏部分内容审核尺度以审批机关为准; 2、文中部分图片及视频由AI生成。
直击2026WRC:从展台到街头,机器狗进入“分赛道”时刻
《科创板日报》8月21日讯(记者 李明明)2026世界机器人大会进入第三天。 开幕当天,高德动量的机器狗途途一次发布五大应用场景:视障导盲、导览伴游、导购代办、智能巡检、末端配送。官方将其定义为"全球首款在开放环境下具备全自主行动能力的四足机器狗"。 途途不是唯一的看点。北京亦庄北人亦创国际会展中心里,机器狗已是各展台的标配。比如,伽利略的Galileo X把轮式转运、越野机动和足式越障合进了同一台本体;云深处的绝影X30展示地下管廊和变电站巡检;中坚科技携多款升级后的四足机器狗产品亮相,落地场景集中在巡检安防、物业运维、机场环保等领域。 数量之外,今年真正的变化是分工。过去机器狗在展会上比的是谁跑得快、跳得高;今年,它们开始各做各的生意——有的靠表演和科研敲开了科创板的门,有的在变电站和管廊里上了岗,有的把三种移动形态合成了同一台设备。途途选的,是还没有人走通的那一条:替视障人士带路,替普通消费者办事。 新赛道:为人带路、替人办事的机器狗 生活服务是今年的新赛道,玩家是高德动量的机器狗途途。 8月19日,途途发布五大应用场景:视障导盲、导览伴游、导购代办、智能巡检、末端配送——要做的不是封闭园区里的活,而是人流、障碍随时变化的开放公共空间。 官方将途途定义为"全球首款在开放环境下具备全自主行动能力的四足机器狗"。 高德具身产品经理顾祉宁在接受《科创板日报》记者采访时表示,市面上多数机器狗要么在封闭空间工作,要么需要人远程操控,途途的核心区别是"开放环境+全自主":不依赖预设路线,也不需要遥控器,"完全自主完成感知、决策、路径规划和行动执行,不依赖人工持续遥控"。 五个场景各有现实对应。导盲对准一个长期缺口,据中国残联统计,全国视障群体超1700万人,导盲犬保有量仅约400只。大会"盲行无界"体验区里,体验者戴眼罩、握住途途背部的力反馈牵引杆,跟随它通过坡道、台阶和窄道,牵引杆转向时平稳发力,遇险瞬间后拽制动。今年4月的亦庄机器人半程马拉松上,途途曾协助一位视障人士完成赛道挑战。 此外,导览伴游面向景区场馆,导购代办面向街区商业,智能巡检与云深处等的赛道部分重叠,末端配送瞄准无人配送车进不了小区的"最后一百米"。 谈到差异化,顾祉宁则落在数据上。无人配送车的终点是小区门口,再往里——上台阶、进楼道、绕临时摊位——那是最后100米。真正的难点不是“走进去”,是“知道往哪走”,找到“3号楼2单元左侧快递柜旁”靠的不是腿,是地址语义解析。 他给出的依据是近一亿高精度POI:“别家做无人配送要先派人去挨栋建图,我们是上来就有这张图。“ 支撑途途的是ABot全栈具身技术体系。顾祉宁对《科创板日报》记者介绍,该体系分三层:数据层由ABot-World和ABot-Earth两款世界模型组成,搭建千万级仿真训练场景,让机器狗提前掌握坡道、台阶、人流变化背后的物理规律,即使到了没走过的路上,它也能应对;模型层由导航基座ABot-N1与操作基座ABot-M0.5组成,"一个负责机器人的脚,一个负责机器人的手",其中ABot-N1仅凭一张导航地图即可完成城市级全自主导航;最上层是ABot-ER与ABot-AgentOS构成的智能体架构,负责任务决策、执行与记忆沉淀,记忆反哺整个体系自进化。 高德方面称,ABot-N1与ABot-M0.5各自在5项权威基准上取得第一,其中ABot-N1的系列工作入选CVPR Best Paper候选。 “世界模型让途途见过世面,导航模型让它认识路,智能体让它听得懂话。”顾祉宁说。 至于一家地图公司为什么做机器狗,顾祉宁表示,高德手里有三类资产:真实空间数据、经过大规模验证的导航决策能力,以及开放城市中的持续运营场景——“地图解决的是世界是什么样,导航解决的是如何在世界中行动,世界模型则进一步解决行动之后会发生什么。高德不是从地图跨界去做机器人,而是在把服务人的空间智能,升级为服务机器的物理世界智能。” 大会期间,高德动量还展出了ABot-World Studio通用世界模型工坊——输入一段文字或一张图片即可生成可实时交互的AI世界,以及轮式双臂机器人的积木算术演示。 据悉,目前高德仍在致力于开发更务实的应用场景及高价值功能,量产和商用计划暂未公布。 展台上:下得了管廊,轮车足合三为一 伽利略在大会上正式发布Galileo X,给四足赛道带来一个“异类”:官方没有叫它机器狗,而是定义为"陆行具身系统"——把轮式AGV的高精度室内转运、越野底盘的车辆级长距离机动、四足机器人的复杂地形越障,无损集成在同一台本体上,依靠多模态自适应切换,连贯完成不同环境下的作业任务。 伽利略相关技术负责人对《科创板日报》记者称,该产品并非现有产品的迭代,而是企业从零立项、自主定义,完成全流程研发与工程化验证的原创成果。 出发点是地面移动机器人长期存在的场景割裂:现实业务大多是室内作业、户外长途行进、复杂地形通行交织的复合工况,而轮式AGV、越野轮履底盘、四足机器人的硬件架构互不兼容、控制体系相互割裂,行业只能靠多台设备搭配完成作业,推高采购、运维和项目落地的综合成本。 以能源场站为例,厂房内部物料转运、数公里户外机动、碎石台阶区域巡检,传统方案要部署三类设备,Galileo X一台即可覆盖全部作业流程。支撑它的是自研的"大一统陆行具身移动系统":完成机械结构、动力驱动、环境感知、运动控制四大核心技术的全链路协同自研,搭载复合主动悬挂系统与360°无限旋转关节。 据公司介绍,这套架构从机械结构研发之初就把多模态统一控制作为原生设计目标,而非外部加装模块式的形态叠加。 场景端,Galileo X面向能源巡检、工业制造、应急救援、公共安全及特种作业,应急救援方向后续还将迭代防爆版本,适配危化泄漏等高风险场景。本次WRC首发完成架构与能力的公开验证,后续将推进工程迭代与量产。 关于行业发展方面,上述相关负责人判断,未来3-5年国内地面移动机器人行业将向通用统一形态收敛,当前融合型产品为更优技术路线。 云深处则以"一人一猫一狗"全矩阵参展:绝影X30是地下管廊、变电站巡检的熟面孔,山猫轮足机器人主打复杂地形,人形机器人DR02已完成变电站实地测试、即将商用。 无论哪条赛道,都绕不开同一道坎。宇树招股书显示,其人形机器人收入中科研与教育场景占73.6%,行业应用仅约9%——卖得最多的地方,仍然是实验室和课堂。8月20日,王兴兴在大会主论坛发表上市后首次公开演讲,表示人形机器人尚未大规模推广,"最主要原因是效率和泛用能力还是不够高";固定场景训练后任务成功率可接近100%,环境一变就大幅跳水。他给具身智能"ChatGPT时刻"的时间表是2至3年,甚至5至10年。 泛化能力不足,对这届大会上的每一只机器狗一视同仁。基准测试的高分、展台上的稳定发挥,都不等同于真实街道上的可靠交付。 本届大会将持续至8月23日。下管廊的、爬钢梯的、带路的,机器狗已经开始分头抢生意,谁能先把展台上的能力变成街头的交付,答案则在会场之外。
罗永浩公关复盘西贝预制菜事件始末:曾劝西贝“以死相谏”拦住贾国龙
快科技8月21日消息,罗永浩团队公关负责人吴加录近日在一次访谈中,从内部视角深度复盘了爆发近一年的西贝事件始末。 在访谈中,他表示:“我当时跟西贝的公关负责人也传递了这样的一个信号,我说贾总需要你去以死相谏,一定要拦住,那他也是这么做了,但是很遗憾还是没有达成。” 他指出西贝方面当时做错了几件事:第一个是推出了罗永浩菜单,第二个,就是要起诉罗永浩,对于他的这个预制菜做了很多的辩解。 最要命的就是开放厨房,请大家来参观。他们就想模仿一下海底捞的做法,很多的媒体、自媒体就真去了,去了之后就真发现了很多的问题。 所以到后面这个局面已经不是罗永浩这条微博产生的了,完全交给了媒体和自媒体,网友的二创也是非常伤害他们的。 “而上述结果导致罗老师就觉得不得不在最后做一个澄清,他就做了一次直播,那次直播流量也巨大,我的电话被打爆了。” 随后他表示在这次事件中,罗永浩方面做对了几件事:第一点不是要攻击西贝,不是要让西贝倒。这次直播是要展现预制菜整个行业透明的态度。收费贵没问题,你这个东西是预制菜也没问题,但是我们希望你能够告诉我们。 第二个,我们也希望整个行业,也希望国家能够加快这个标准的出台,那让大家能够就放心嘛。 结合此次风波,吴加录总结了应对危机的几条重点:第一个就是在危机发生的时候,千万不要直接就1号位上场,进行对抗式的沟通。 第二个就是在危机发生的过程当中,不要生搬硬套,比如说海底捞的一些经验,去给自己加很多的二次危机和三次舆情的这样的一些戏码。 第三个,就是不要去跟媒体、自媒体裹挟在一起,更不要去找水军。最后,我觉得不要去听信一些奸臣带来的没有进行背景调查的建议,这些建议都是毒药。 “他们是利用你的生气,利用你的嫉妒心去做很多的不应该做的事情,这个对你的伤害是长期的,整个过程其实还是要理性的,还是要听劝。”吴加录一针见血说道。 顺着吴加录的内部复盘视角,这场轰动全网西贝预制菜风波,再次回到大众视野。 整场风波的导火索始于去年9月,罗永浩线下就餐后发布一条日常吐槽微博,直言许久未吃的西贝菜品几乎全为预制菜,定价偏高却未提前告知消费者,言语直白引发网友广泛共鸣。 彼时风波初始只是普通的消费者体验吐槽,舆情热度有限,并未形成大规模负面扩散,本是西贝低成本化解危机的最佳窗口期。 然而面对单一网友的质疑,西贝创始人贾国龙直接下场,公开强硬否认预制菜相关质疑,高调宣布要起诉罗永浩,彻底将舆论矛盾激化。 这种高层直接对抗的姿态,瞬间让普通消费吐槽升级为知名餐饮品牌与公众人物的正面博弈,话题迅速冲上全网热搜,引发全民围观。 为自证清白,西贝仓促照搬海底捞透明化运营经验,官宣开放全国门店后厨,邀请媒体、自媒体实地探访核验。 但这一仓促之举反而成为整场危机的致命转折点。大批实地探访的自媒体、媒体直击西贝后厨,相关实拍视频、图文报道密集流出,彻底坐实了“菜品为预制半成品”的质疑,由此产生的舆情刷屏短视频平台和社交平台,彻底脱离了西贝的掌控范围。 此时的舆情核心,早已不再是罗永浩的个人吐槽,而是演变为大众对餐饮品牌预制菜不透明、信息不对称、消费知情权被侵犯的集体声讨。 面对失控的舆论局面,罗永浩团队则开启直播专场,仅通过实拍素材、行业标准、食材保质期参数,清晰拆解预制菜与现做菜的行业界定差异,传递核心观点:餐饮企业使用预制菜本身无对错,高价售卖也符合市场规则,真正的问题是隐瞒不告知、欺骗消费者。 同时,团队持续将舆论导向行业层面,多次公开呼吁完善预制菜行业国家标准,明确餐饮门店预制菜使用标注规范,补齐行业监管漏洞。 这套打法彻底扭转舆论站位,让罗永浩从“吐槽博主”变成“推动行业透明化的发声者”,而西贝则因强硬对抗、言行不一、危机失当处置,持续消耗多年积累的品牌口碑。 伴随事情发酵,西贝最终彻底放弃对抗姿态,高调撤诉并公开致歉,发布整改公告,推出九大整改举措,包括全面更换非转基因大豆油、规范预制菜品公示、优化后厨管理、透明化菜品原料与制作流程等,全面整改品牌经营与宣传中的漏洞。 而这场风波的价值,早已超越双方的舆论博弈,直接推动《预制菜食品安全国家标准》草案落地推进,加速行业规范出台,倒逼整个中式餐饮连锁行业正视预制菜公示、消费者知情权等核心问题。 自动播放
美国年轻人为何越来越讨厌AI?硅谷高管吵起来了
凤凰网科技讯 8月21日,据《连线》报道,随着人工智能快速进入工作、教育和日常生活,美国社会对AI的抵触情绪正在上升。最新调查显示,超过一半的30岁以下美国人对AI“担忧多于兴奋”,这一比例相比五年前增加了24%;超过70%的受访者认为,AI将导致就业岗位减少。《连线》认为,硅谷正在试图解释这股反AI情绪,但部分科技公司领导者可能没有真正理解公众担忧的根源。 公众对AI的不安已经不只集中在就业和数据中心建设。相关调查显示,美国人还担忧AI影响年轻人建立有意义的人际关系、削弱学生的批判性思维能力,同时认为科技公司应该向作品被用于训练AI模型的创作者支付补偿。 科技行业的一种解释是,AI面临的公众反弹与沟通方式和品牌形象有关。但Searchlight Institute近期调查显示,向受访者传递不同的AI相关信息,并没有明显改变他们对于AI社会影响的看法。《连线》称,其接触的一些投资者和科技公司高管已经开始担忧,行业可能低估了负面公众情绪对AI产品普及造成的影响。 这一分歧近期也在硅谷内部公开化。Meta CEO马克·扎克伯格本月发表一篇约6500字的文章,描述其对AI未来的乐观设想。他认为,未来每个人都可以拥有高度个性化的AI助手,帮助处理职业、兴趣甚至养育子女等事务。扎克伯格同时批评部分AI开发者的讨论充斥着对风险的悲观判断。 随后,科技投资人Gavin Baker进一步将美国数据中心遭遇的反对,与Anthropic CEO达里奥·阿莫代伊有关AI风险的公开表态联系起来。白宫AI顾问David Sacks也认为,Anthropic的一些叙事加剧了公众恐惧。 阿莫代伊随后公开回应称,AI面临的根本问题是“信任危机”。他认为,普通人并不信任企业、政府和科技行业,并怀疑这些机构会利用新技术损害自身利益,而这种不信任已经积累多年,AI只是最新的体现。 不过,阿莫代伊同时认为,对包括Anthropic在内的AI公司更准确的批评,是这些企业尚未兑现利用AI造福社会的宏大承诺。他举例称,AI未来可能帮助攻克癌症等重大问题。 《连线》认为,目前围绕AI的反弹并非简单来自科技公司高管对于未来风险的警告,也并非因为AI企业尚未兑现某些长期技术承诺,更直接的原因在于AI已经开始改变就业、教育、创作者权益以及社区基础设施等现实领域,而部分公众担心这些变化最终会产生负面影响。 这种抵触正在具体投射到AI基础设施建设上。科技公司近年来不断强调数据中心的节水、清洁能源以及社区投资计划,但《连线》指出,数据中心已经在一定程度上成为公众对AI以及科技公司与当地社区关系不满的实体化对象。 报道认为,一些AI公司的普通员工已经能够从家人和朋友那里感受到这种情绪,但处于AI浪潮中心的企业领导者仍未充分回应AI正在带来的社会变化。如果硅谷希望AI产品得到更广泛采用,如何重新建立公众信任,可能比单纯强调AI能力继续提升更重要。
Gen1.5模型带来重要进展:物理AI正在接近GPT3时刻
作者|Li Yuan 编辑|靖宇 研究人员先教机器人拿起刷子,把桌上的积木扫进碗里。 然后,他们把刷子拿走,换成一根香蕉。 机器人抓起香蕉,将它横过来贴住桌面,把积木一点点扫进碗中。 随后,香蕉又被换成了一只簸箕。机器人这次没有继续照搬「扫」的动作,而是伸出另一只手,把积木推上簸箕,再端起来倒进碗里。 重点来了,研究人员从来没有在这项任务里教它用香蕉和簸箕,它是自己推理出来的。 这就是 Generalist 最新发布的 GEN-1.5 具身基座模型展现出的能力:模型开始从大规模人类操作数据中天然存在的重复、失误与恢复,学习到训练者没有逐项教过的动作,显露出某种智能涌现的迹象。 但真正让机器人研究者兴奋的,是 GEN-1.5 还展示了一项新的能力,它称之为「physical prompting」——物理提示。 研究人员可以拿着一对简易夹爪完成一项 3 到 12 秒的操作,只需向机器人演示一遍,GEN-1.5 不进行微调,也不更新任何参数,随即开始在新的物体位置和初始状态下尝试同一项任务。 曾参与 Google DeepMind Gemini Robotics 的研究者 Ted Xiao 将这种「让机器人看一次示范,就立刻学会一项新任务」的能力称为机器人领域追寻多年的「圣杯」。在他看来,GEN-1.5 是这条路线上迄今最好的结果,那种能力突然跃升的感觉,让他想起第一次使用 GPT-3。 能够进行物理提示也说明 GEN-1.5 的基座模型已经足够强。3 到 12 秒的示范不可能从头教会机器人如何抓取、接触和控制物体,只能告诉它「现在要做什么」。用 Generalist 的说法,这更像是在提醒模型一件它几乎已经会做的事。 这些瞬间之所以打动人,是因为它们和我们熟悉的机器人形成了鲜明反差。 过去的机器人演示往往动作缓慢、环境固定,物体位置或工具稍有变化就可能失败。它们像是在忠实复现一条训练过无数次的轨迹,而不是理解自己最终要完成什么。 而这一次,机器人给人的感觉开始有点像大语言模型了。 大语言模型真正令人惊讶的,往往不是它复述出了标准答案,而是面对一个新问题,它会给出一种人没有写进提示词里的回答。这个回答未必更聪明,甚至未必正确,但你能感觉到,那是模型根据问题自己组织出来的。 Generalist 也有意把这种变化与 GPT-3 相比。GPT-3 之前,语言模型已经偶尔表现出看几个例子就能完成新任务的能力;GPT-3 的不同,在于这种现象突然在广泛的任务上变得明显。只看一个例子,它的平均准确率约为 45%;看到约 100 个例子后,可以达到约 65%。 Generalist 并不是具身智能创业潮中公众最熟悉的公司。它不生产一款像 Figure 那样不断出现在聚光灯下的人形机器人,而是试图为不同形态的机器人训练同一种底层智能。但在机器人研究和产业圈,它一直是被密切追踪的公司之一。 原因是,它几乎把过去两年的全部赌注都压在同一个判断上:物理智能也可以 scaling。 2025 年 11 月,Generalist 用 GEN-0 展示,增加真实物理数据、模型规模和计算量,可以让一组下游任务共同进步;2026 年 4 月,数据规模超过 50 万小时后,GEN-1 将若干简单任务的平均成功率从上一代的 64% 推到 99%。 而此次 Gen-1.5 的发布,同时伴随着 Generalist 宣布,是学习新任务所需的训练正在消失。所谓一次「梯度更新」,就是用新任务的数据调整一次模型参数。Generalist 将这个过程从过去的数百次,压缩到数十次、10 次、1 次,最终变成 0 次:模型不再需要重新训练,看一遍就能开始做。 目前,GEN-1.5 只看一次示范,在 10 项新任务上的平均成功率为 59%;使用 5 分钟数据、调整 10 次参数后,可以提高到 83%。它离一台可以放心交付工作的机器人还有距离。 但它已经出现在一条清晰的 scaling 曲线上。机器人的智能涌现,已经近了。 01 机器人也可以有 prompt 了 Generalist 这次一共展示了 GEN-1.5 学习和使用新能力的三种情况。 第一种,是面对没见过的变化,直接换一种办法。 机器人学过把积木放进碗,但没有见过碗被纸盖住,它会先移开纸;乐高卡在一只夹爪上,它会用另一只手取下;只学过单手开罐,有时也会换成双手。 这里没有重新提供数据或训练模型。任务本身学过,变化没有学过。GEN-1.5 展示的是对新工具、新障碍和意外情况的直接泛化。 第二种,是只看一次示范,就开始做一项新任务。 研究人员在机器人面前拉开一次拉链、拧开一次罐盖,或者从钱包里抽出一张纸币。演示只有 3 到 12 秒,GEN-1.5 不调整任何参数,随即便会在物体位置发生变化的情况下尝试一次。 Generalist 把它称为「physical prompting」——物理提示。它和给大语言模型一段 prompt 很相似:示范没有被训练进模型,只是临时告诉它,这一次要做什么。在 10 项新任务上,这种一次提示的平均成功率为 59%。 物理提示还可以组合。研究人员分别示范两个任务,GEN-1.5 会把它们接成一套连续动作,并补上示范里没有的调整位置、换手和重新抓取。来自模拟器的动作也可以提示现实中的机器人;在部分实验中,人直接用双手示范,机器人也会随后尝试复现。 第三种,是用几分钟数据,快速把一项新任务学得更稳。 研究人员提供 1 到 5 分钟、约 10 到 50 次演示,再调整 1 到 10 次模型参数。使用约 5 分钟数据和 10 次调整时,10 项任务的平均成功率可以从一次提示的 59% 提高到 83%。这仍然是训练,但已经从过去的数百次调整压缩到了几次。 三种情况并不相同,却指向了同一件事:GEN-1.5 的基座模型已经提前学会大量基础动作和物理规律。面对新变化,它可以直接调用;看到一次示范,它可以临时组合;得到几分钟数据,它又能迅速变得更稳定。 按照 Generalist 的公开说明,GEN-1.5 会同时处理视频、其他传感器、语言和机器人自身的状态。示范被放进一个 30 秒的上下文窗口,其余空间持续加入机器人最新看到的画面;模型以 100Hz 输出动作轨迹,在执行中继续观察和修正。 而预训练时的数据,只是从家庭、仓库和工厂活动中随机截取的连续片段。测试时突然插入一段来自别处的动作,原本是训练中没有刻意安排过的形式,模型却知道应该接着做。 为什么会出现这种能力,Generalist 目前也没有确定答案。 一种猜测是,人类工作中天然充满重复:拧完一颗螺丝,通常还要拧下一颗;收好一个物体,往往紧接着处理另一个。模型在海量连续动作中,可能已经无数次练习了「看见前一个实例,延续下一个实例」。 另一部分线索来自失败。人会失手、调整、重新抓起物体,然后继续工作。如果这些不完美的过程没有在数据清洗时被剪掉,模型看到的就不是一条只有正确动作的轨迹,而是完整的「失误—修正—继续」。英伟达机器人研究负责人 Jim Fan 认为,这可能正是 GEN-1.5 会恢复和换办法的重要原因。 02 Generalist 是谁? 此次 Generalist 并没有公布 GEN-1.5 的准确参数规模、从头训练比例,也没有给出论文级别的完整训练配方。但从这家公司一贯的路线中,仍然可以看到一些端倪。 Generalist 成立于 2024 年,但直到一年后才正式走出隐身状态。它的三位联合创始人来自两条机器人技术主线:Pete Florence 和 Andy Zeng 曾在 Google DeepMind 从事机器人研究,参与过 PaLM-E、RT-2 等具身模型;Andrew Barry 则曾是 Boston Dynamics 的资深机器人研究员。团队里还有来自 OpenAI、自动驾驶和机器人公司的成员。 如果只看大众传播,Generalist 的知名度远不如不断发布人形机器人视频的 Figure。 但在机器人研究、创业和投资圈,它一直是被密切追踪的公司。一次采访中,投资人陈哲讲道,Generalist 和 Sunday Robotics 对行业的推动「巨大」:它们总能拿出一些此前少见、事后看来又很合理的设计。 这也解释了 Generalist 的公司形态。它不打算再造一款明星人形机器人,而是想训练一套可以进入不同机械臂、夹爪和工具的底层智能。Figure 把模型和一具完整的人形身体一起交付;Generalist 更关心的是,同一种智能能不能换一双手、换一台机器,仍然继续工作。 Generalist 过去两年的技术路线,也可以概括成一个词:scaling。 2025 年 11 月发布 GEN-0 时,Generalist 已经积累超过 27 万小时真实操作数据,每周还在增加约 1 万小时。公司用不同大小的模型反复实验,发现数据并不是越多越有用:10 亿参数模型很快就学不动了;60 亿参数开始明显受益;到 70 亿参数以上,海量物理经验才更稳定地转移到新任务。GEN-0 随后被扩大到 100 亿参数以上。 Generalist 想证明的,正是机器人也存在一条类似大语言模型的规律:数据、模型和计算量一起增加,一组不同任务会共同进步,而不是每项任务各自从头训练。按照公司的测试,GEN-0 扩大预训练后,16 组新任务的动作预测误差同时下降,真实机器人的成功率也随之提高。 到 2026 年 4 月的 GEN-1,数据已经超过 50 万小时。Generalist 报告称,使用约 1 小时机器人任务数据后,一组简单任务的平均成功率从 GEN-0 的 64% 提高到 99%,折盒和手机包装等任务的速度也提高到此前系统的约 3 倍。 这套数据并不是靠遥操作采集出来的。 传统遥操作要求人通过 VR、手柄或另一台设备控制机器人。每增加一名采集者,往往也要增加一套昂贵的机器人。Generalist 采用的路线更接近 UMI:让人拿着一只带相机的「机器人手」,直接在家庭、仓库和工厂里干活,再把动作转换成机器人能够学习的数据。 公司公开确认的是低成本手持设备和简易夹爪,并称已经在不同地区部署数千套采集硬件,采集设备看起来简单,公司称,训练系统一天可以读取相当于 6.85 年的人类操作经验。 2025 年 11 月,Generalist 已经积累了 27 万小时数据,并以每周超过 1 万小时的速度继续增加;到 2026 年 4 月,GEN-1 使用的数据已经超过 50 万小时。GEN-1.5 没有公布最新总量,但可以想见数据量应该有不少新增。 鹿明机器人联合 CTO 丁琰曾估算,即使完全照着 Generalist 已经公开的采集方式重建,仅制造采集硬件就需要四到六个月;若要积累 27 万小时数据,至少需要约 1000 人持续采集大半年甚至一年。他认为,对一个刚刚起步的团队来说,「半年到一年追上」都过于乐观。 这种影响甚至改变了中国投资人对数据路线的判断。接受采访的时候,深度机智创始人陈凯曾提到,Generalist 用大规模人类操作数据展示出模型能力,随后又以 27 万小时数据跑出清晰的 scaling 结果。原本被认为难以迁移到机器人的人类数据,开始成为资本愿意下注的技术路线,也改变了投资人对自己路线的认可程度。 Generalist 对模型本身也做了一个不太主流的选择。公司披露,GEN-1 约 99% 的参数从头训练,并不依附 Gemini、GPT 或其他已经读过互联网图文的模型。它认为,机器人过去需要借用语言和图像模型,是因为物理数据太少;当真实操作数据达到几十万小时,模型可以主要从物理经验中建立自己的能力。 因此,Generalist 一直拒绝把自己的模型简单称为 VLA 或 world model。前者通常把看图、理解语言和生成动作接在一起;后者通常先预测一个动作之后世界会怎样变化,再据此规划。GEN-1.5 公开展示的方式更直接:看到当前画面和刚才的示范,持续决定下一步怎样动。它内部很可能也形成了某种对物理世界的理解,只是公司没有公开一个单独预测未来的模块。 GEN-1.5 与 GEN-1 几乎同时启动,连续预训练超过八个月。随着训练推进,新任务所需的参数调整从数百次降到数十次、10 次,再降到一次,最后变成完全不用调整。 即便调整 10 次,模型内部参数的整体变化也不到 0.15%。用 Generalist 的说法,这已经不像从头学习,更像是在提醒模型一件它几乎已经会做的事。 今年 7 月,Generalist 还为 GEN-1 接入五指手、夹钳、电动螺丝刀、打蛋器等不同工具,以及大约 9000 种标准夹爪的改装形态。它想证明,物理智能不必被锁在一双人形机器人的手上:夹爪、吸盘和专用工具,都可以是同一个模型与世界接触的方式。 资本已经为这条路线给出了高价。今年 6 月,Generalist 完成 4 亿美元融资,累计融资超过 5 亿美元,估值达到 20 亿美元。Radical Ventures 领投,英伟达、Bezos Expeditions、8VC、Union Square Ventures、Norwest 和 Spark Capital 等参与。早期投资方 Boldstart 回顾投资理由时,强调的也不是某一款机器人,而是 Generalist 的「数据手」以及由此建立的数据循环。 03 机器人的 GPT-3 时刻? 九个月前,Generalist 发布 GEN-0,用 27 万小时真实世界操作数据证明机器人模型也可以 scaling。那次发布被一些业内人士称为机器人最接近「GPT-1 时刻」的一次尝试:重要的不是机器人已经有多聪明,而是数据、模型和计算量增加后,能力开始沿着一条可以预测的曲线提高。 这一次,Generalist 把参照物直接换成了 GPT-3。 事实上,用更少演示适配新任务,已经是近期机器人基础模型共同追赶的方向。 Generalist 真正显眼的是速度。2025 年 11 月,GEN-0 还在证明物理数据可以 scaling;五个月后的 GEN-1,用约 1 小时机器人数据把一组简单任务推到平均 99%;再过四个月,GEN-1.5 已经把新任务所需数据压到几分钟、一次演示,最后不再更新参数。 这也是为什么一次提示只有 59% 的成功率,仍然会引起机器人圈关注。它不是一个足以部署的数字,却是 scaling 曲线上一个新的现象:随着模型看到更多物理经验,新任务需要的专门训练从数百次参数调整一路降到零。 行业已经开始围绕同一方向加速。 Jim Fan 对 GEN-1.5 的判断是「谨慎乐观」。他认为,人类数据中的重复和错误恢复很可能是关键,也提醒一次示范究竟能不能成立,取决于新任务离预训练数据有多远。如果测试里的拉链、罐子或钱包,与模型过去见过的东西非常接近,「看一遍就会」和真正学会陌生工作仍然不是一回事。 目前的公开结果也留下了足够多的未知。10 项任务都比较简单,平均成功率只有 59%;物理提示对复杂柔性物体、长时间任务和完全陌生场景是否有效,还没有答案。所有核心数字都来自 Generalist 自己,公司也没有公布足以让外界完整复现 GEN-1.5 的论文、参数和训练细节。 但正确理解这些限制,不等于忽略这次进展。 GPT-3 刚出现时同样会生成大量错误。它真正改变世界的地方,是让人们第一次相信,同一个模型可以通过 prompt 临时学会许多不同任务。GEN-1.5 现在展示的,是这个接口在物理世界里的早期形态。 过去,每增加一种机器人用途,都要重新采集数据、训练模型、上机测试,再由工程师一轮轮修正。机器人本身或许可以买到,真正昂贵的是让它在一个新现场可靠地做一件新工作。 physical prompting 指向的另一种可能,是把任务留在眼前:机器人不必为每一项工作永久改变参数,使用者只需要告诉它,这一次要做什么。如果这种能力继续提高,被压缩的不只是示教时间,还有为每个新任务准备数据、占用机器人和投入工程师的成本。 这不会消除安全验证、现场集成和硬件维护,也还不是今天就能兑现的部署方案。但它可能改变部署成本中最难下降的一部分:每增加一种用途,都要重新教一遍机器人的代价。 今天的机器人还远没有学会一切。但让它继续变强、也让每一种新用途变得更便宜的那条 scaling 曲线,已经开始显现。
美国硅谷大谈机器人未来,现场主角却来自中国
凤凰网科技讯 8月21日,据《商业内幕》报道,旧金山机器人大会Actuate吸引了约1500名投资者、创业者和工程师参与,但现场展示的机器人数量却远少于预期。在人工智能从软件领域向现实世界延伸的背景下,机器人行业正迎来投资热潮,但硬件供应不足、训练数据短缺以及供应链限制,成为行业进一步发展的关键挑战。 硅谷最热门的机器人技术大会上为数不多的机器人之一 报道称,Actuate大会由机器人软件公司Foxglove主办,今年参会人数较2025年增长约3倍。Foxglove联合创始人兼CEO Adrian Macneil表示,如果不受场地限制,大会门票销量可能超过2000张。 资本市场正在加速押注机器人产业。根据Crunchbase数据,全球机器人初创企业2025年融资规模达到150亿美元,2026年至今融资额进一步达到188亿美元。“Physical AI”(物理人工智能)成为大会高频讨论话题,指的是能够感知并作用于现实世界的人工智能系统。 不过,现场情况显示,机器人产业仍面临“硬件缺口”。报道指出,大会展区内,提供机器人训练数据服务的数据企业数量超过机器人硬件企业。包括Uber AI Solutions、Instawork等公司都在展示如何采集和标注现实世界数据,用于训练机器人系统。 与聊天机器人可以依靠互联网海量文本训练不同,机器人需要理解真实环境中的动作、空间和物体交互,目前并不存在类似规模的现实世界数据资源。Foxglove CEO Adrian Macneil表示,目前行业正在围绕机器人训练数据展开大量投入,包括数据生产和数据采购。 Foxglove首席执行官Adrian Macneil 硬件供应问题也受到美国监管政策影响。报道称,美国联邦通信委员会(FCC)此前对新的外国制造“先进机器人设备”实施限制,引发行业讨论。部分美国制造商认为相关措施有助于保护本土企业,但一些创业公司和研究人员担忧,限制廉价海外硬件供应可能影响美国机器人产业发展。 报道援引数据称,中国企业去年约占全球人形机器人出货量的90%。谷歌自动驾驶项目Waymo创始人之一Sebastian Thrun在大会上表示,FCC相关监管“存在问题”。制造机器人系统的Multiply Labs CEO Fred Parietti也表示,目前公司仍依赖中国制造的人形机器人完成部分生产环节,“现在没有替代方案”。 在大会现场,中国机器人企业宇树科技(Unitree)成为少数受到关注的硬件厂商之一。随着宇树上市后股价大涨,两台宇树人形机器人参与了大会上的机器人格斗活动。不过报道指出,机器人对抗过程中真正发生碰撞的场景较少,部分机器人出现攻击落空或动作失误。 机器人格斗赛 整体来看,机器人行业正在经历从资本关注到产业落地的转变,但相比人工智能软件领域,机器人仍需要解决硬件供应、数据获取以及产业链成熟度等问题。随着更多企业进入“Physical AI”赛道,如何规模化制造机器人并获取高质量训练数据,成为行业下一阶段竞争重点。
Token经济转点:OpenClaw、Hermes到本地自研的Agent进化之路
去年年底,硅谷掀起了一股风潮——“Token Maxing”(最大化token使用量),科技公司创始人和工程师们争相晒出账单,比谁家Token消耗更吓人,以此彰显对AI的全力押注。但到了今年年中,成本失控和虚假生产力让这场烧钱竞赛到达了转折点。Uber在四个月里烧穿了全年的AI预算,Meta被迫给员工设定token使用上限,一些公司会提醒员工使用AI的时候注意成本。大家开始认真思考:如何更经济地使用Token? 这期节目的嘉宾黄东旭,就是Token Maxing热潮的亲历者。他曾经只用最前沿的模型,每天账单三四百美元。让他转变的,是前沿模型的智力碾压和中国开源模型们的崛起——Fable 5可以一句话终结Agent群的讨论,同时大量的日常任务可以做到“只烧电费,不烧Token”。他的结论是:不是前沿模型用不起,而是本地开源模型底座+前沿模型的搭配,成本可控,更具性价比。 我们聊了这半年Agent产品的进化史——从OpenClaw,到Hermes,到Agent蜂群的智能涌现潜力,Agent消耗Token的趋势不会停止,未来还会有更复杂的A2A网络。亲历了互联网、移动互联网、AI三波浪潮的张宏江认为,Token Maxing折射出的是所有人在面临AI浪潮时的不知所措,AGI奇点已经到来,现在做Agent是好时机,但关键是:别做容易被大模型碾压的应用。 以下是这次对话内容的精选: 01 Token Maxing,到底值不值? 泓君:今天我们要聊聊Token Maxing策略,宏江老师,您觉得大家疯狂地烧Token这件事背后,大市场里有没有泡沫? 张宏江:去年12月我就说没有泡沫。2024年底大家怀疑Scaling Law撞墙、过度投资,但今天看远远没达到。我们所面临的,是一个非常fundamental的革命,跟互联网最早的基建、美国铁路网公路网来相比,从GDP占比看比那些都小。即使从宏观的角度来说,也远远没有到所谓的过度投资。 另外一点就是,其实Token价格过去几年一直是每年降10倍这样的速度。我不觉得技术和应用存在太大泡沫,股市是另一回事。这次革命如此迅猛,很多企业不知所措,一开始放开用,突然发现Token超了预算,又往回缩,这是个自然的过程。 黄东旭:我完全认同。首先今天看AI基建,就像上世纪五六十年代看计算机,一个房间的电子管,好大好贵,但没有它就没有后来的个人计算机。在充分的基建之后才会诞生出新需求,新需求会刺激更多基建。第二,从工程或架构上看,Token的高效使用还有很多优化空间,只是大家想先发散看看通过花Token有哪些低垂的果实可以先摘下,之后再考虑优化的事情。所以短期可能回落,长期来看,仍有大量需求还没被看见。 泓君:过去8个月硅谷的策略可以叫Token Maxing,黄仁勋在GTC上说,要求工程师烧Token,Meta有Token排行榜。但是到今天,我觉得发生转折了——Uber四个月烧穿全年预算,把发给员工的Token额度收回去了;我去Stripe时看到内部弹窗提醒“Opus 4.8很贵,大家可以先用其他模型”。所以我觉得今天我们聊的这个时间点很好。怎么样更加经济地使用Token,这背后也包含着一系列Agent的变革。东旭,你一直在玩AI Agent,你有没有账单爆掉的时刻? 黄东旭:当然有。我先说一下我Token Maxing的历史,虽然我现在已经不是这个流派了。我当时属于“无脑用最强”。 我去年11月开始用Opus从0到1构建我能想到最复杂的软件——分布式数据库。我想看看当时的AI对于这样复杂的大系统来说边界在哪。在这种最复杂的任务上,我没有办法精确地评估最强的模型跟第二强的模型的差别是什么,所以最好的策略就是:永远选最好的模型。Token Maxing在那个时候是一个好的策略,但在社区里面大家都把它误解了。它是个结果,是滞后指标,经过思考的Token Maxing才能产出好结果。但大公司里领导要,大家就刷榜,产生很多无效调用。 泓君:那时你一天账单多少? 黄东旭:一天四五百美金,而且还是在已经用了Claude Code Pro Max订阅的情况下。 泓君:帮你提升了多少效率? 黄东旭:我觉得超值。我举个例子,就很多时候,一件事情从0到1,我觉得我肯定做不出来,但是用上最强的AI以后,它能让我做出来了,你说它的ROI是什么?比如说像我做的那个软件,我们的销售期待那个软件很长时间了。我确定,如果能做出来,质量做到七八十分,一年就能多1000万美元的直接收入。以前我受限于人力、技术的水平,做不出来。但现在我能一个人用三个月就做出来了。这是一个真实的例子,那个项目叫db9,是我新做的一个云原生的分布式数据库,开发时间是从去年的12月份到今年3月。 02 OpenClaw:普罗米修斯的火种 泓君:在那段时间OpenClaw出来了,它对你有帮助吗? 黄东旭:OpenClaw是另外一个故事,它不是为重度软件工程设计的,更像是个人助理,通过Agent的能力去连接现实世界。当时我觉得它代表了一个信号,它把Claude Code、Codex这些编程Agent代表的一个理念——Agentic loop加上工具调用——变成了一个对普通用户来说门槛更低的东西,让它走进了千家万户。 图片来源:OpenClaw 张宏江:Peter作为OpenClaw的作者,花一个礼拜就把OpenClaw做出来,我觉得这代表大模型的能力过了一个坎,它的推理能力如此之强,它的编程能力如此之强,能让一个架构师级别的工程师,能够在很短时间内做出一个系统,标志着从研究进入工程,从模型进入Agent。 泓君:你觉得是哪一版模型的能力出现的这样一个跨越? 张宏江:Claude的Opus 4.5,就去年11月份。 黄东旭:我觉得是从GPT 5.4 开始,去年七八月份吧。 泓君:在OpenClaw出来的时候,很多创始人给硅谷101写信,说他们也搭建了像OpenClaw这样的Agent产品,效果不比它差。所以当时为什么是OpenClaw火了? 黄东旭:首先OpenClaw是一个开源软件,开源在今天天生更具有传播力。极客圈子对闭源商业软件多少有一点点抵触心理。而且OpenClaw一开始的理念叫“local-first”,所有隐私数据都配置在本地。Peter这么做,完全是一个极客会做出的选择。极客这个圈子的传播力还是挺强的,有点像当年的Linux。 张宏江:我记得Peter自己也说,他一直觉得大公司会做,等了好几个月大公司没做,就自己hack出来了。这个故事也说明了,当大势准备好之后,其实就需要一个人捅破一张纸,而OpenClaw正好是捅破了这张纸。 而且开源社群很有意思,几天后出了一个MoltBook(Agent社交网络),本身也是一个非常好的传播事件,让人们意识到Agent达到了某种自主能力。 另外,从时间点上来说,大家用Chatbot这件事已经用了三年多,OpenClaw出现正好让大家意识到,你日常在PC、手机上做的事情,其实Agent基本上都能做。 泓君:OpenClaw有哪些不足呢? 黄东旭:第一个不足,宏江老师提到了,Peter一个人Vibe Coding了一个礼拜做出来的东西,他自己可能也完全没看过代码,给极客用没问题,但大众都在用的时候,配置难度和系统稳定性都成问题。这件事给我的启发是,好的软件工程习惯和经验还是非常重要的。当你这个软件的复杂性超过一个临界点以后,你要花更多精力去提升体验和稳定性,资深的研发团队还是非常必要的。 第二是起太早了,我觉得它更像一个实验性的项目。大家也看到,Peter去OpenAI之后,现在OpenAI也把精力慢慢从OpenClaw,转到了它自己的Codex上面了。能否有持续的资源投入也成了问题,它的天花板也就是这样了。OpenClaw扮演了一个普罗米修斯的角色,把这样的产品形态、这样的产品能力让世人知道了,它的历史使命就完成了。 03  “Agent动力学”进化 泓君:在OpenClaw出来以后,有一段时间里我身边挺多人都在玩,我看大家提的觉得最不好用的一个点,就是你怎么让它记住你的历史偏好,让它有一个更好的记忆功能。因为如果你用得越多,你就会发现它老忘事。当你不去做记忆储存的时候,它会不停地回滚,特别消耗Token,也会带来很多记忆的混乱。之后又出现了Hermes,它是一个Web3的机构Nous Research做出来的,东旭,你用过这个Agent吗? 图片来源:Hermes 黄东旭:我是Hermes的重度用户,它出来后,我很快就从OpenClaw切到Hermes了。刚才你提到的memory这个点,现在仍然尚无定论,没有谁家解决得非常好。Hermes的亮点在于,它巧妙地绕开了记忆的问题,它的Agent的框架里有一个很强的倾向,去不停地总结成功经验变成skill。你用一段时间就发现它长出了很多最佳实践。“小龙虾”的Agent Loop里边缺少一个反思的过程,你除非主动要求。 泓君:可不可以理解成它的运营很强,因为它会沉淀成各种skill? 黄东旭:对。另外Hermes显然是经过精心设计的一个软件架构,它是团队精心在打磨的一个东西,所以你的上手流程体验、各方面稳定性,都会比OpenClaw更好。OpenClaw更像一个大集市,每个人有什么想法直接往里面提交。 泓君:Hermes怎么赚钱? 黄东旭:当你有足够的用户量,能够帮不同的模型厂商带Token的消耗,你的商业模式简直不要太多。举个例子,在Hermes里面我可能跟模型厂商去谈一个渠道,以更低的折扣拿到Token。就像刚才宏江老师说的,今天已经成为了一个工程问题,其实谁都能做,但最后这个入口会变成兵家必争之地。 泓君:有点像移动互联网时代的超级应用。 黄东旭:甚至往下推演的话,它也许会变成唯一的应用,因为未来每个人跟数字世界打交道的入口,可能就没有APP了。你想象一下,今天“小龙虾”出来以后,我再也没打开过我的Gmail,我都是每天让OpenClaw来帮我看邮件,看看哪些需要回复,哪些是广告该删掉。我是一个智能原教旨主义者,我相信,比如说一个Opus 4.8,如果它判断这封邮件是重要的邮件,那么我自己来判断,大概率也是重要的邮件。 不仅是邮件,你有没有发现,最近越来越多地开始依赖Agent作为入口去消化订阅的文章,而不是再跑到《纽约时报》或者说跑到Hacker News上去一篇篇地去看。 泓君:我觉得这个对媒体行业的冲击很大。 黄东旭:这个已经发生了好久了。你想象一下,像你的个人Agent是拥有你所有访问足迹,你的偏好……之前有个词我觉得特别好,叫“养龙虾”,就是你会不停地去迭代,让它更理解你。它颠覆的是可能传统媒体的推荐系统,真正终极的推荐算法一定是来自在你本地、观察着你数字世界的、甚至物理世界的所有事件的一个智能。 泓君:之后你转到了Slock(后更名为Raft),它是Kimi CLI的负责人钱宇超创立的,这是一个什么样的Agent? 图片来源:Raft 黄东旭:我是Slock的第一个天使投资人,也是它最早期的用户之一。它有点像Slack聊天,但是里边在聊天的都是Agent,这些Agent互相不分享自己的运行上下文,它们唯一分享的是聊天频道里边的信息,这跟MoltBook有一点点异曲同工之妙。 Agent之间的讨论,可能80-90%都是车轱辘话,但Agent它没有ego,所以当某一个瞬间,某一个Agent提出了一个大家没有看到的想法,大家马上就会发现你说得有道理,这条重要的信息就会再次触发这些Agent的讨论。 我常用Slock做复杂代码审查,10个顶级模型Agent,一起给这段代码挑刺,互相启发,持续迭代,可能Token Maxing一下。你就会发现它会比单个模型在One-shot上去review这份代码挑出来的问题和改进的深度是完全不一样的。代价就是,Token消耗量可能是普通的10倍。 我觉得Slock团队发明了一个很有意思的词,叫做“Agent动力学”。今天的Harness也好,Loop Engineer也好,就在优化一件事情:怎么能让一个Agent在一个特定任务上持续不停地干活。 04 Token经济学拐点 泓君:我听下来,你使用Agent已经有一个过渡了,从自己搭建Agent框架,到OpenClaw、到Hermes、到Slock;从使用单个的Agent到使用Agent群组,让这些Agent相互check;同时又让它们持续不停地工作……这是终点吗? 黄东旭:我曾经觉得这是终点,前面说的是我今年三四月份时候的认知。过了三个月又迭代了。其中有三个关键事件:GPT 5.5、DeepSeek V4、Fable 5。对我刚才说的那种Token Maxing的认知发生了一个巨大的改变。 泓君:开始要转向Token-efficient了。 黄东旭:是的。我就从Fable 5开始说起,GPT 5.5也有点类似。Fable 5的模型强大到,一群Agent讨论了半天讨论不出来的东西,可能在Fable 5的绝对智商面前,一次就精准搞定了。而且它还没有之前的上下文,是绝对的智商碾压。 第二个就是DeepSeek V4的出现。以前我是不信任开源模型的,尤其在我一些主要的复杂软件开发工作中。但是从DeepSeek V4开始,我发现它的质量已经非常高了。GLM-5.2出来后,又把我对开源模型的认知往前推了一大步。 这标志着,我可以用顶级的模型与这些便宜又很聪明的开源模型做协同,很像一个企业,真正出现管理学意义上的分工了。 泓君:开源模型你是搭在本地? 黄东旭:都是本地,在我自己本地运行的是DeepSeek V4的Flash,是在一台我的Mac Studio上去运行的。它其实可以在你家里的电脑上运行,大概能到30Token每秒,这个速度跟你在网上用OpenAI的API速度已经差不多了,这是最近的一个认知的更新。 泓君:当你在本地搭了DeepSeek V4的模型以后,有一些任务你不用去调API接口了,然后你所有的消耗就是电费跟你的电脑折旧的费用? 黄东旭:成本在它完成的任务面前,可以忽略不计,一个月电费二三十美元,而且还是在满载的情况下。我现在在用开源模型做两件事情:一个是大量的重复性的日常工作;第二个事情,是以前我不敢让Opus放开干的,就是我特别喜欢看论文,比如CVPR几百篇论文全总结一遍,用API太贵了,干不了。当时我就在自己的开源模型上就跑一个工作流,让它持续在那跑着。 我觉得开源模型会解锁非常多以前我不敢在付费的模型上做的事,这更多的是心态上的变化,并不是我掏不起几百美金,而是觉得这个东西不受我控制,你不知道它会跑出多少的API、多少Token的价格。 泓君:你把你的Agent一部分放在云端,一部分是在本地模型,这样组合之后你的账单降到了多少? 黄东旭:我现在的账单也就一个月两三百美金了,就是一个正常的账单。当然这也跟我的workload变化有关,那个项目已经过了代码疯狂堆积的阶段了。 泓君:这个是你的终局吗?还会有再一步的进化吗? 黄东旭:我过去这一年学到最大的事情,就是千万别随便说什么叫终局。第二,永远相信Scaling Law,永远相信智能。我相信不久的未来,会出现一个moment,哪怕是开源模型,你都没有办法评估它,因为它太强了,我们已经没有参考系了,我觉得这天其实是能看得见的。 泓君:你觉得从你最大化使用Token到开始经济地使用Token这一套转变中,你预测未来像硅谷的这些大公司它们会多久把这个工作范式转过来? 黄东旭:我觉得现在正在发生。 泓君:那Claude和OpenAI的API消耗和ARR还会持续增长吗? 黄东旭:我觉得还会增长。Agent为什么消耗Token这么多?其实原理很简单,每个Agent内部有一个类似发动机的东西叫Agentic Loop,就是一个内部循环。每一次循环都会调用大语言模型去对话,然后在这个过程中去调用外部工具,把工具的输出变成对话上下文。复杂的长程任务下,这个循环可能跑几百步,每一步又有大量工具调用,输入输出都变成上下文。 这种范式导致Agent的Token消耗比Chatbot时代涨了100倍不止,只要是这个范式成立,就会有更复杂的系统出现——今天我们聊的还只是单个Agent的架构,但面对更复杂的问题,必然需要多Agent协同,协同之上又有更抽象的loop,这种分层结构已经在出现了。 泓君:所以本地化Agent节省Token只是优化单点问题,整体消耗还在持续增长? 黄东旭:是的。类比计算机历史——早期家酿俱乐部分享几百行BASIC程序,一个程序员几千行汇编就结束了,但今天Photoshop是数千万行代码。今天Agent解决的问题还太简单,一旦Agent能力到达一定程度,要去解决更复杂问题的时候,必然出现Agent to Agent network和Agent Harness软件工程,那时Token消耗又会上一个台阶。 张宏江:东旭说的这个现象在经济学里叫杰文斯悖论(Jevons Paradox)——技术越成熟,价格越低,但消耗量越大,市场也变得越来越大。未来开源闭源、本地云端哪个胜出,更多是生态竞争,今天很难判断哪个最后能胜出。但有一点我同意:单个智能会越来越强,会消耗更多Token,同时Token价格降得也更快,最终ROI不一定受到太大影响。而且东旭也提到,更高智能可能让Agent不需要那么频繁地反复问模型,对话频率也可能降下来,所以实际消耗不一定会增加。 未来一定是超级强的Agent,加上超级大的蜂群一起做事。蜂群里的每个Agent可以很专精、很小、很便宜,也可能是由一两个强大模型驱动,这需要不断迭代,会有一些涌现的智能出现。清华大学有篇文章说“三个臭皮匠超过诸葛亮”,Agent群的智能不是简单相加,而是可以涌现出一个更强的智能,这也是我们对于Agent群的期待。 泓君:刚才东旭说他搭了一个Agent群互相讨论没解出的问题,直接丢给Fable 5一次就解决了。模型智力的碾压式提升,能强过蜂群吗? 张宏江:好问题,但其实当超级模型变强的时候,蜂群里的每个Agent也可以用上这种更强的智能。 黄东旭:所以涌现出insight的概率会更高。我不相信绝对中心,这太危险了,真正的有韧性的系统一定是大规模基于简单规则连接的分布式系统,抗打击能力和处理复杂问题的能力都最强。 05  Agent创业:在碾压中寻找护城河 泓君:我们聊AI创业跟投资机会的时候,所有创业者最苦恼的一个问题就是,模型能力一升级,就把我这个Agent做的所有的工作都碾压了。那根据刚刚大家新的判断,现在是不是创建AI Agent的好时机? 张宏江:是不是好机会?显然是。但是,你的harness的能力或者Agent的工作能力是不是能够让你能领先或者持续地领先,不会被碾压?这块可能更核心的在于,你是不是能够掌握企业级的一个垂直应用的数据?数据的护城河可能会更重要。 黄东旭:当我们大家在去讲Agent的时候,其实在把很多东西混在一起,有很多人说Agent,是在说应用,老百姓用的某个场景,相当于过去的APP;有些人说Agent,是说这里边用到的软件和硬件的基础设施,或者说一些通用的协议,那这是一大类infra。 所以我觉得这里边得分层次来看。工程问题是集中在memory、搜索、sandbox environment、协同、harness……这一系列,这些都是在大的infra范畴里边,这部分是我觉得有很多机会的。 但是最终端的面向纯客户的一些“APP”这类的Agent,可能还稍微有点早。就像刚才说,模型能力提升碾压的其实真就是应用这部分。 泓君:现在整个硅谷的创业公司可能都是AI类的创业公司,除了模型和一些Neolabs,大量都是做Agent的。大家怎么去判断一个创业公司是不是值得投,什么样的特质和方向,是你们特别看好跟特别喜欢的? 黄东旭:首先我自己有个原则,我不投我自己看不懂或我自己用不起来的东西。因为作为一个做infra这么长时间的工程师,还是相信一点手感的。我现在对基础设施类的软件项目,尤其是能在多个Agent之间更高效地让Agent产生更好结果的东西比较感兴趣。比如说你正常用一个模型只能产生50分的结果,但如果我用上了这一套东西,能够交付出80分甚至90分的结果。去看哪些基础设施能够帮助这个模型产生更好的结果?数据平台、记忆以及context management,这个我觉得是一个很重要的赛道。 第二个关键的环节是可观测性。当你要让Agent team去解决更复杂问题的时候,你怎么去让更高级的智能或者说更有经验的人类能进去提升整个系统的迭代速度?我们今天其实没有任何办法,因为我们对于这个系统的可观测性不足。就比如说Token Maxing,所有的CIO都在问你一个问题:我这些Token到底花在了哪些事情上?哪些是白白浪费的?谁能够给我回答这个问题,我就买谁的东西。我觉得这种基础设施层面的机会是有的。 第三个是入口层面,做出Agent应用的入口级别的机会,比如说Agentic Cloud。我相信未来在Agent时代会有Agent时代的Oracle,有Agent时代的AWS。 泓君:跟现在的云厂商会有什么不一样? 黄东旭:比如我最近投的InsForge,定位就是Agent Cloud。以前的云是把很复杂的IT系统的管控打包成一个标准的东西,卖给开发者,或者说人类。但未来Agent-Native应用的基础设施面向的是Agent本身。所以怎么设计给Agent好用的接口和资源分配模式?今天我们谈的Agent应用,像Hermes配合一些特别的Skill,每个终端用户的需求都是通过Agent触发的,这和传统云计算逻辑完全不同。 这些Agent完成任务最好的办法是给一台沙箱或云计算机,让它在里面干任何事情。但这种类型的应用如果放到传统云上,成本根本cover不住。成千上万个Agent,如果每个都要去拥有一台计算机,成本肯定不行。所以需要找一个Agent-friendly和cost efficiency的折中。我觉得这里就有很多Serverless技术怎么跟Agent环境、Agent runtime结合在一起。 泓君:今年整个环境看起来非常ToB。OpenClaw、Hermes,大企业在搭建工作流,OpenAI和Anthropic在做FDE,全是ToB。那前两年火的Manus、Genspark这类ToC Agent还香吗? 黄东旭:我不觉得它们是ToC,仍然是ToB,只是to Professional。Manus用20美金便宜的市场策略吸引个人用户,但它真正重要的客户是那些一个月付200美金的专业人士。人家是拿它干活的,有自己的业务在里面。这类还是很香的,你可以看它收入涨得很快。 张宏江:过去无论是ToB还是ToC,最终用户都是人。但接下来,目标用户会变成Agent本身。东旭提到的infra相关的机会,都是这个方向。为什么FDE这么热?微软刚成立6000人的团队Microsoft Frontier Company专门做这个。因为大家看到了一个核心命题:怎么把企业的know-how、IP、workflow这些竞争优势,转移到Agent上去。过去说转成垂直模型,现在更重要的是转成超级Agent或Agent群。这是我希望看到的投资机会,这要求你更垂直、数据飞轮更能转起来。如果还做移动互联网APP做的事情,把AI仅仅当成效率工具,大模型能力提升一定会把你横扫。 泓君:怎么判断一个公司是不是Agent native?有没有核心的判断点? 黄东旭:我首先会做个思想实验——把AI或Agent的元素去掉,如果你这件事仍然成立或者还能做,那不好意思,你不是AI native。但如果你把Agent去掉之后这件事完全不成立了,或者成本涨了一千倍,那就有意思了,你就是Agent native。 第二,看团队的思维模式。Agent native企业的创始人一定是Agent first的思维。任何一件事,你先问自己“用AI或Agent会怎么做”,而不是“我想怎么做然后指导Agent去做”。 泓君:决策权在Agent,你要相信Agent的决策比你的决策更靠谱。你现在是相信的? 黄东旭:我完全相信。 泓君:但是我觉得有的时候Agent不像人会去理解一句话背后的意思跟一些默认的人类规则。你见过它们为了达到目标,有超出人类认知的操作吗? 黄东旭:太经常了。我先说一个正面的例子吧。我经常让Claude Code帮我做PPT文件,把大纲发给它,它去生成,有些细节不满意,就要做微调。有一天我怒了,我跟Claude Code说,“我有要修改的需求,你帮我把生成的这个事情考虑进去”。结果,它不仅给我生成了PPT,还同时给我生成了一个轻量版本的Google Slides。它可能觉得手搓一个软件也没多难,显然人类是不会干这种事情的。 负面的当然也有,它把我的生产数据库删了,最后互相甩锅。这种我是可以忍的,因为我觉得它删了,不是因为它犯错了,而是我的底层的infra的软件没有跟上。我相信,随着模型的能力包括基础的工具越来越完善,未来这类问题会越来越少。我觉得现在处在这场革命的早期,连黎明都还没到,不要过嗨了,stay humble。 06  Token经济学的未来 泓君:你信任AI,是因为觉得AI智力已经超过人了? 黄东旭:这是个哲学问题。我的信念是构建一个autonomous(有自主权的)机制,能让整个这个系统能够脱离人这个不确定因素,尽可能地自主运行。我也不是相信说AI一定会产生一个AGI,我觉得AGI是一个营销术语,A不AGI无所谓,但是,我想造蒸汽机。哪怕一开始第一代的蒸汽机会犯一些非常傻的问题,可能跑得比马车还要慢,但我知道它的上限更高,长期能解放更多的生产力。 张宏江:其实人们对AGI没有一个明确的定义。我在几次讨论会上讲过,过去6个月发布的模型的IQ测试放在人类正态分布上,无论是visual IQ,还是general IQ,它们都在100(人类智商平均值)的右边,你说这是不是AGI呢?作为一个程序员,我看到现在的Coding的能力已经超越了平均工程师。我认为智能的转折点,也就是奇点,已经到来了。奇点到来的意义在于,机器的学习的能力超越了人的学习能力,你赶不上它了。我认为这个点就是AGI的点。 泓君:宏江老师,刚刚您提到,未来推理成本一定是会大幅降低的,我很好奇,推理成本的降低是哪些因素驱动的? 张宏江:其实不用细究是GPU降价还是存储降价。所有技术成熟时成本都会大规模降低,但使用量增长远超成本降低,市场反而越来越大。我们看到,Token成本其实在过去三四年,一直是每年降10倍,远远超过摩尔定律了。你看英伟达每个产品都比以前贵,但单位成本比以前便宜很多。我们观察到的推理能力,以前每7个月double一次,现在每三四个月double一次。当技术跨过一个门槛后,大家就会聚焦怎么把成本降下来,有时是主动的,有时是技术本身就解决了。40年代末占几个房间甚至一层楼的计算机系统,算力还不如今天一台手机,所以这个判断更多是基于对过去整个时代观察后的一种信念。 泓君:二级市场关注OpenAI和Claude的ARR增长,最近不是靠ToC带动,而是主要靠Token经济学拉动的。您觉得未来对大模型公司来说,ToB和ToC哪一端是更赚钱,增长更快? 张宏江:如果我们看过去几百年从工业革命开始的技术落地,会发现一个规律——新技术几乎都是先进入ToB。蒸汽机首先进到工厂,而不是进到你家厨房帮你做饭。AI也一样,因为提高效率是ToB最核心的追求。所以第一步先进入ToB,我觉得非常正常。 基本上每一个技术都经历过这样一个过程:大家先开始拥抱,然后突然发现这东西很贵,再接着技术成本降下来,应用开始更快速、更广泛地深入。从这个角度看,今天我们可能正好处在这样一个阶段——大家发现AI能力很强,但是怎么在自己的公司里用、怎么获得想要的ROI,这个大家还在挣扎。之前大模型能力没过那个坎,所以用的场景没那么多。写PPT、做会议总结,大家都开始用了,也看到了价值,这价值很好,但还没有达到比如把两个工程师的效率放大10倍。而今天我们看到了,当对编程Agent的信任度超过了对一般程序员的信任度的时候,这个账就比较好算了。你一天花300美金买Token,而你一天雇一个软件工程师远不止这个价钱。所以我觉得,慢慢人们会开始算这笔账。 至于公司里Token用量超预期,一种可能性是KPI本身就不对,下一步应该是看:你消耗了多少Token,创造了多少效率,或者code的产出增加了多少。慢慢这个坎会过去,我还是非常有信心的。股市的反应本身就充满了情绪,但这也有它的好处,它可能会过度反应,从而起到纠偏的作用,所以你看到股票有跌有涨,本质上就是人们不断思考的过程。 泓君:所以您觉得未来ToB还是更值得关注的大的爆发点? 张宏江:我恰恰觉得可能ToB这块,不太容易被大模型或一个通用的Agent来碾压。 泓君:有分析认为,Token的优化是利空模型厂的,同时利好三大云厂商的。好比说,模型厂是在造车,云厂商是在收过路费。大家怎么看Token经济学下,谁是一个大赢家?谁在往下坡的方向走? 张宏江:要看什么样的时间范围。我觉得今天,智能还属于一个稀缺状态,未来是不是会像电一样?我相信它会达到那一天。之前你做发电机的可能最赚钱,到今天的话可能是电网更赚钱。显然这个会不断地evolve进化,我看不出来在今后两三年大模型的能力会过剩。我前天在开车的时候听一个Podcast聊到,你就想象着这个派对从晚上7点钟开始,一般的到早上4点钟结束,现在才11点钟的时候,派对还有很长时间去走。
脉脉上线AI人才标签体系,企业可直接筛选三类AI人才
凤凰网科技讯 8月21日,招聘平台脉脉宣布上线AI人才标签体系,并同步推出脉脉AI招聘和海外人才库等功能升级,帮助企业通过标签筛选、智能匹配等方式识别AI相关人才。 据介绍,脉脉人才银行此次升级包含三方面内容。其中,AI人才标签体系将AI人才划分为AI技术底座人才、AI应用开发人才、AI业务效能人才三类,企业用户可在搜索栏、人才列表和人才详情页面查看相关标签。 脉脉表示,AI招聘功能进一步覆盖岗位理解、人才匹配、候选人筛选和意向沟通等环节。企业HR可通过自然语言描述岗位需求,包括“不要频繁跳槽”等隐性条件,系统将据此匹配候选人。据官方介绍,该功能匹配准确率达到90%以上,并通过7×24小时AI帮聊持续沟通求职意向,每日可帮助HR节省约4小时。 脉脉创始人兼CEO林凡在活动中表示,随着AI能力逐渐成为岗位基础要求,未来科技公司可能只招聘具备AI能力的人才。对于企业而言,AI人才建设需要区分外部招聘和内部培养,其中AI技术底座人才和AI应用开发人才更依赖外部引进,而AI业务效能人才更适合通过组织内部培养。 林凡认为,对于多数职场人而言,成为能够利用AI解决实际业务问题的AI业务效能人才,是更现实的发展方向。他表示,真正掌握Coding Agent能力的人才,应能够提出明确业务目标,让工具自动运行任务超过1小时,并持续验证和交付结果。 在活动现场,摩讯国际创始合伙人金星亮表示,AI时代招聘逻辑正在发生变化,人才价值更多由稀缺性决定。他指出,优秀AI人才通常不会主动寻找机会,企业需要通过社交平台、技术论坛和实验室等渠道建立持续更新的人才Mapping体系,而不仅是依靠传统简历搜索。 北京大学汇丰商学院管理学教授张坤表示,企业AI转型不能依赖一次性投入或短期项目推进,也不能简单通过智能体数量、Token消耗等指标衡量效果。企业需要持续优化工作流程,同时避免盲目引入与业务需求不匹配的技术人才。 脉脉表示,平台目前覆盖互联网、人工智能、具身智能、芯片、智能硬件、新能源汽车等多个新经济行业人才群体,未来将继续通过人才银行和AI招聘产品,帮助企业提升AI人才识别、连接和招聘效率。
DeepSeek多模态模型终于来了!一张图最高只要0.001元
智东西 作者 | 陈骏达 编辑 | 李水青 智东西8月21日报道,就在刚刚,DeepSeek宣布全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp(实验性质模型)上线DeepSeek API 平台。 DeepSeek同步公布了这一模型的详细基准测试结果。根据模型名字推测,DeepSeek-V4-Flash-Vision-Exp是在DeepSeek-V4-Flash基础上打造的,基准测试中其纯文本能力(Agent、推理、世界知识等)与DeepSeek-V4-Flash正式版持平。 在需要视觉理解的Agent Benchmark上,DeepSeek-V4-Flash-Vision-Exp相比DeepSeek-V4-Flash实现了大幅提升,多模态Agent能力已接近Opus 4.8。 要使用这一模型,开发者需将模型参数设置为deepseek-v4-flash-vision-exp,即可通过API调用V4-Flash-Vision-Exp的图像理解能力。 计费上,图片会先转换为token再计入用量,单张图片最多按384 tokens计算,价格与V4-Flash模型持平。据此计算,高峰时段用该模型理解一张图片的最高价格为0.001152元。 调用方式上,这套多模态API同时兼容Chat Completions、Messages、Responses三种格式,支持图文混合输入,方便接入各类Agent工具;图片传入支持base64内联和外部URL两种方式。 此外,DeepSeek还同步上线了免费的Files API,开发者可以先把图片上传到平台,后续请求中凭file_id直接引用,同一张图片无需重复上传,能省下一笔重复传输的开销。 DeepSeek官方称,V4-Flash-Vision-Exp在各类Agent框架内展现出了较好的多模态适配能力,能够有效支持用户借助多样化的Agent工具解锁更多实用的工作场景。 比如,用户可以用V4-Flash-Vision-Exp制作PPT内容,模型可以理解真实摄影图片风格、野性、原始、探索感等较为抽象的风格化要求。 V4-Flash-Vision-Exp还可以被用于视觉编程任务,比如对DeepSeek Harness官网进行二次创作,加上黑蓝深海、玻璃UI和ASCII原子像素等视觉要素。 可以看到,V4-Flash-Vision-Exp打造的网页视觉特效还是较为精美的,动画流畅,文字质感不错。 值得一提的是,8月19日,DeepSeek Harness已经先行更新,将多模态能力作为升级重点,覆盖多模态输入、子代理协作、终端体验、工具调用和开发者支持等多个方向,既补齐了Agent处理图片等多模态任务的能力,也进一步完善了子代理协作、终端交互和工具调用体验。 今天,DeepSeek Harness再次更新,DeepSeek模型适配器新增DeepSeek-V4-Flash-Vision-Exp多模态模型选项,并支持配置原生图片请求。 结语:DeepSeek多模态API,终于补齐 多模态理解早已是主流大模型的标配能力,截图、文档、网页、UI界面,许多真实工作大多绕不开看图这一步。但在这条赛道上,DeepSeek长期是个例外,直到今年4月底,DeepSeek才以灰度测试的方式上线识图模式,6月在网页端和App全量开放,而面向开发者的多模态API,则一直等到了今天。 随着DeepSeek多模态模型的上线,DeepSeek Harness+V4-Flash-Vision-Exp的组合可能会衍生出更多有趣玩法。这一模型还符合DeepSeek一贯的定价风格,多模态调用的价格门槛,大概率还会被再拉低一档。
Counterpoint预测2026年全球智能手机出货量下降14.3%,三星、华为逆势增长
IT之家 8 月 21 日消息,受存储芯片供应短缺及成本上涨影响,Counterpoint Research 预测市场下行压力预计将持续至 2027 年,2028 年方能迎来复苏。 Counterpoint Research 今日发布了最新《智能手机市场展望追踪报告》,预测 2026 年全球智能手机出货量将同比下降 14.3%,预计 2026 年第二季度主流手机使用的 LPDDR4 和 LPDDR5 价格较 2025 年第四季度增长约两倍,供应紧张局面可能持续至 2027 年下半年。成本压力正迫使厂商提高售价、削减低利润配置,并收缩产品线。 各大厂商在此次下行周期中表现分化。三星电子凭借其垂直整合的供应链、广泛的产品组合及成熟的渠道网络,预计 2026 年出货量逆势增长约 0.8%,有望从苹果手中重夺全球智能手机市场头把交椅。 Counterpoint 首席分析师 Yang Wang 表示:“三星重返榜首,关键在于其内部元器件自给能力、丰富的产品组合,以及与运营商和零售渠道长期稳固的合作关系。” Counterpoint 预测苹果 2026 年出货量将下降约 2.1%。苹果 iPhone 17 系列需求强劲,但 iPhone 18 系列可能更高的起售价及两代产品 Pro 版与基础版错峰发布的节奏,或将影响季度出货表现。苹果计划于 2026 年第三季度推出其首款折叠屏手机,分析师预计该机型出货量为数百万部级别,尚不足以显著改变苹果整体出货趋势。 中国主要智能手机厂商因产品集中于中端价位、用户对价格敏感且在新兴市场占比较高,预计将承受更大压力。报告预测部分中国厂商 2026 年出货量降幅在 15% 至 34% 之间。厂商预计将通过降低内存配置、采用旧款 SoC、对不盈利产品提价或停产等方式应对,整体上优先考虑财务纪律和核心市场,而非死守市场份额。 不过,华为是例外,受益于中国国内市场需求及海思芯片业务的持续进展,Counterpoint 预计华为 2026 年出货量增长约 8%,2027 年再增长 4.3%。 展望未来,Counterpoint 预计 2027 年市场将继续小幅萎缩 1.4%,2028 年将迎来约 4.8% 的增长。随着 6G 设备在 2030 年前实现商业化,有望推动一轮增量换机周期,帮助市场回到 2024 至 2025 年的出货水平,但预计不会催生超级周期。
苹果 Apple Music 不想放过任何一首 AI 音乐
苹果最近在 AI 上又有了新动作。 8 月 20 日,苹果向创作者群发邮件,敲定 Apple Music 的 AI 透明度规则: 今年晚些时候,曲目、封面、音乐视频等页面会出现「Made with AI」(由 AI 制作)的可见标签。凡是「AI 被用于创作内容的实质部分」的作品,包括完全由生成式 AI 产出的整轨歌曲,提交时必须主动申报。 这不是「建议」,是强制。任何沾上 AI 的作品都绕不开这层申报。这也意味着,苹果正式把 AI 内容的身份问题,从后台管理推到了前台用户面前。 所有 AI 音乐,都要打上「标签」 其实早在今年 3 月,苹果就下过通牒。当时苹果宣布,Apple Music 将要求创作者对新上架的封面图、曲目、编曲作品和音乐视频披露 AI 使用情况。 当时这还只是一纸通知,外界并不清楚披露内容会不会真的出现在用户眼前。 在落地的细节上,相较于 「AI 生成」的用户可见,更重要的是苹果明确了「必须打标」的门槛。 邮件里声明,只要 AI 被用于创作内容的实质性部分,内容提供方就必须贴上 AI透明度标签,包括由 AI 平台直接生成的曲目。 苹果还把「AI 平台生成内容」定义得非常严格——任何主要由生成式 AI 服务产出的内容,都算。换句话说,哪怕一首歌是人类写的、编的,只要其中有一块实质性的东西是 AI 做出来的,就得如实交代。苹果同时引导创作者查阅官方《音乐风格指南》,获取更细的规则说明。 苹果给出的理由是:为听众提供尽可能多的透明度。 把这个政策放到整个流媒体行业,苹果并不是一个先驱者。 Spotify 最近宣布,默认将 AI 人设(AI Persona)生成的内容排除在编辑推荐和算法推荐之外;Deezer 去年就把纯 AI 生成曲目剔除出推荐流和编辑歌单,上个月还公布了一个标志性数字——纯 AI 生成音乐首次超过了平台每日新增上传量的一半。 各家平台都在用不同的方式给 AI 音乐划出边界,只不过苹果选了最「用户可见」的一条路:不隐藏、不降权,直接把标签亮在你脸上。 图|Spotify 真正值得玩味的是 Apple Music 负责人 Oliver Schusser 上周在 Billboard 播客上给出的两组数据:每个月上传到 Apple Music 的音乐中,有超过三分之一是纯 AI 生成的;但这些 AI 内容在平台上的播放量,加起来不到 0.5%。 机器正在以极高的速度往平台里灌水,而听众几乎没人买账。 苹果选择在这个节点把「Made With AI」标签推到前台,也是在提前给内容池立规矩:AI 生产的内容可以存在,但必须在人工内容面前「亮明身份」。 AI 写 App,苹果管得更严 这也不是苹果的临时起意,是苹果对于生成式 AI 一贯的态度。 今年 3 月,The Information 披露,苹果开始阻止包括 Replit、Vibecode 在内的一些 Vibe Coding 应用更新。这些应用的共同特点,是允许普通用户通过自然语言描述需求,然后让 AI 自动生成游戏或者应用程序。 随后,事情进一步升级。Anything 因类似问题一度被苹果直接从 App Store 下架。 苹果给出的依据并不是一条专门针对 AI 的新规定,而是一条已经存在多年的 App Store Review Guidelines 2.5.2。 这项规则要求 App 必须保持相对「自包含」,不能下载、安装或者执行能够改变自身或其他 App 功能的代码。教育类编程 App 存在有限例外,但代码需要向用户完整开放并允许编辑。 Vibe Coding 恰好撞上了这条红线。 传统 App 在提交 App Store 时,苹果审核的是一个相对确定的软件包。如果一个 App 可以根据用户的一句话实时生成新的代码,并直接在 iPhone 内运行,理论上同一个经过审核的 App,可以在安装之后变成成千上万种不同的软件。这意味着苹果审核过的东西,和最终在手机上运行的东西,可能已经不是同一回事。 苹果一面下架第三方 Vibe Coding 工具,一面自己却在 Vibe Coding 上押了重注。 今年 2 月推出的 Xcode 26.3,直接让 Claude Agent 和 OpenAI Codex 进了 Xcode,用来搜索文档、查看项目结构、自动迭代构建。一句话,苹果并不反对「AI 帮你写代码」,它反对的是「用户在商店审核之外,通过第三方 App 生成并执行新代码」。 图|Applelnsider 所以苹果并没有禁止「AI 写代码」,而是严格限制这个代码必须在苹果原有的安全和审核机制之下运转。 看到这,虽然 Apple Music 和 Vibe Coding 看起来是两件完全不同事件,但能看出苹果处理它们的逻辑其实高度一致:把 AI 关进苹果设计的笼子里。 AI 可以在苹果的地盘上存在,但必须服从苹果制定的规则——谁创造的内容、由谁创造、如何被看见,都得由苹果说了算。 这或许就是一家以用户体验和隐私保护为立身之本的公司,面对 AI 时代给出的最符合自身气质的答案:不是拒绝,不是拥抱,苹果选择的是控制。 作者|方俊鸣 编辑|肖钦鹏
国内首个!摩尔线程张建中宣布:全功能GPU已打通具身智能训练链
快科技8月21日消息,摩尔线程创始人、董事长兼首席执行官张建中今日在2026世界机器人大会上宣布,公司全功能GPU作为具身智能国产算力底座,已贯通训练全流程。 从合成数据生成、基模训练、后训练与强化学习,到仿真评测与Sim2Real,摩尔线程为具身智能发展提供从数据到部署的硬核算力支撑。张建中强调,摩尔线程是国内极少数可以支撑具身智能训练全流程的GPU企业。 传统具身智能开发中,物理仿真使用专用物理引擎,图形渲染用图形显卡,AI训练用专用AI芯片,三者相互割裂,开发者不得不在三个异构平台之间反复切换,研发效率极低。 摩尔线程基于自研MUSA架构打造的全功能GPU,单颗芯片能同时支持AI计算、图形渲染、物理仿真、科学计算与超高清视频编解码,从根本上解决了这一问题。 这一优势在单卡层面解决了异构难题,同样也天然适用于大规模集群扩展。 摩尔线程构建以全功能GPU为根基的夸娥智算集群,从万卡向十万卡持续扩展,并以此构建贯通训练、推理、智能体的一体化AI工厂,包括模型训练工厂、词元生产工厂和智能体生产工厂。 夸娥集群提供了硬件算力底座,而要真正支撑具身智能的训练与部署,还需要将算力转化为可用的仿真与开发工具链。 早在今年5月,摩尔线程发布了国内首个全栈国产化具身智能仿真平台MT Lambda。该平台搭载MT Photon光子引擎,融合光线追踪与混合渲染能力,同时引入3DGS和自研AI生成式渲染能力。 在此之上,MT Lambda进一步提供上层具身策略开发与训练平台MT Lambda-Lab,以及高保真物理仿真与渲染平台MT Lambda-Sim,形成从算力到引擎再到工具链的完整方案。
产品涨价最高25%:美国政府退税后罗技没退,罗技被消费者集体起诉
IT之家 8 月 21 日消息,当地时间 8 月 18 日,美国律师事务所 Cotchett, Pitre & McCarthy LLP(CPM)在加利福尼亚州北区联邦地区法院圣何塞分院提起集体诉讼,将罗技(Logitech)告上法庭。 原告代表美国消费者,指控罗技在 2025 年以上调关税为理由涨价最高 25%,并在相关关税被美国最高法院裁定违法、政府向企业退款后,没有将消费者此前承担的相关成本退还给消费者。 诉状显示,罗技在 2025 年 4 月提高了美国市场至少一半产品的零售价,平均涨幅约 14%,部分产品涨幅最高达到 25%。例如,MX Master 3S 鼠标价格从 99.99 美元(现汇率约合 673.9 元人民币)提高至 119.99 美元(现汇率约合 808.7 元人民币),K400 Plus Wireless Touch 键盘则从 27.99 美元涨至 34.99 美元。 罗技管理层此前也曾在财报电话会议中明确提及此次涨价旨在抵消进口关税带来的成本压力。罗技首席财务官 Matteo Anversa 在最近一次财报电话会议上透露,涨价举措为公司带来了约 150 个基点的毛利率提升,而关税预计造成的成本约为 70 个基点。 此次诉讼的背景是美国总统特朗普在 2025 年依据《国际紧急经济权力法》(IEEPA)对进口商品实施一系列关税措施。美国最高法院于 2026 年 2 月 20 日裁定 IEEPA 并未授予总统征收相关关税的权力。 最高法院判决后,美国政府启动了相关关税退款流程。根据此次诉讼方公布的信息,截至目前政府已经向数千家受影响企业退还约 1,000 亿美元(现汇率约合 6,739.39 亿元人民币);而消费者此前通过商品价格间接承担的关税,并不会由政府直接退还给消费者。诉状称,此次相关关税累计征收金额约 1,660 亿美元(现汇率约合 1.12 万亿元人民币)。 罗技在 2026 年 7 月公布的 2027 财年第一季度股东信中也披露,公司当季非 GAAP 毛利率受到 6100 万美元关税退款的推动。该公司表示,这笔退款与汇率、产品组合及产品成本下降等因素共同影响了季度毛利率。 CPM 在诉状中进一步指控,罗技已经从美国政府获得与关税相关的退款,却没有向此前承担价格上涨成本的消费者返还相应金额。 律师 Joe Cotchett 表示,罗技此前以关税为由提高价格,而相关关税随后被最高法院裁定违法,因此消费者应当获得相应退款。 此次针对罗技的诉讼并非个例。2026 年 4 月,美国两名消费者在华盛顿州西区联邦地区法院起诉任天堂,要求其将因关税导致的价格上涨对应退款返还给消费者。诉讼涉及 2025 年 2 月至 2026 年 2 月期间购买相关任天堂产品的美国消费者。 任天堂 2026 年公布的财报还显示,其 2027 财年第一季度营业利润同比增长 150.5% 至约 1,425 亿日元(IT之家注:现汇率约合 60.47 亿元人民币),其中包括约 3 亿美元(现汇率约合 20.22 亿元人民币)美国关税退款对销售成本的影响。
微信 AI 修图抢先体验:能用够用,但还不够好用
你没猜错,微信又在灰度测试新的 AI 功能了。 这次灰度测试的功能叫做「AI 修图」,它会出现在微信聊天的图片窗口中,和原本的「查看原图」按钮并列把底下一排塞满: 无论是你发的图还是接收到的图,在预览窗口点击「AI 处理」之后就可以看到 3 大类共 11 个小类的预设功能: 常见功能比如美颜、加滤镜、翻译文字、自动打码和超分等等一应俱全,点击就会跳转到微信小微对话框中开始工作: 至于小微修图的质量嘛……只能说还行。 经过测试,小微在美肤、扩图、调整比例和消除杂物之类的功能上表现尚可,虽然能看出破绽,但对需要边聊边做的轻量编辑完全足够了—— 但如果你也被灰测到了微信主界面左上角的小微入口的话,那直接进入小微对话框把要求发给它,和使用那些快捷开关其实是完全一样的: 不过目前看下来,小微的修图能力在「编辑」和「信息提取」方面还算不错。 可一旦涉及重绘或者生成新内容,就比较吃用户的提示词水平了—— 通过直接询问小微,我们得知它目前使用的还是微信定制的 WeLM 模型,大概率是之前已经在对话、小程序里面上线的 WeLM-80B 版本。 而纵观 2026 年至今,我们可以清晰地看到一件事: 哪怕像微信这种「牵一发而动全身」的超巨型 App,也开始非常积极地拥抱 AI 功能了。 从 3 月首次出现微信研发 AI Agent 的消息、到 6 月初确定使用形式,再到小微的灰测和拓展,我们可以梳理出微信的 AI 时间轴: 重点在于,微信没有急着再造一个豆包或者 ChatGPT,而是在把尝试把一个综合模型能力和入口拆开,塞进微信原本已经存在的功能里。 目前可见的就是,除了主页左上角的小微聊天框之外,「小微功能」其实已经渗透进了微信的方方面面—— 而 WeLM 底层模型也是围绕这种「方方面面」来设计的。比如腾讯在最新的财报中首次披露: 微信团队定制的 WeLM 在设计时就重点考虑了微信场景和推理效率,目前公开的 WeLM-HD4-80B 和 WeLM-HD4-617B 总参数量分别达到 800 亿和 6170 亿,但实际激活的参数只有 30 亿和 230 亿。 图|X @Weixin_WeChat 微信团队还提出了诸如 Hidden Decoding 之类的技术,通过将每个 Token 扩展成多个内部计算流,提高单 Token 的计算量,同时用 Stream-Factorized Attention 控制额外的注意力开销。 这些技术参数背后,其实不是腾讯的技术边缘,而是微信最现实的问题:算力成本。 截至今年 6 月,微信及 WeChat 合并月活已经达到 14.39 亿。小微一旦全面进入搜索、图片、朋友圈、公众号乃至小程序场景…… 每一次推理成本乘上十亿级用户规模,都会变成一个天文数字。 图|财联社 所以 WeLM 如此强调推理效率,表面能力看上去往往只是「差不多得了」,其实不是模型限制,而是微信的巨大运营成本压力。 更重要的是,相比腾讯的 WorkBuddy,微信小微走出了一条完全不同的推广路径。 微信手握 14 亿月活,以及无数人每日高频使用的功能场景,根本不需要去「给模型造 App 入口」,反而是让小微尽可能淡化唯一入口的概念、拆分进具体功能里。 然而世界是物质的,哪怕是微信这种地位的 App,也无法完全避免谈钱的问题。 根据财报相关资料,腾讯最新季度资本开支达到 528 亿元,同比增长 176%;自由现金流则转为负 138 亿元,其中重要原因就是 AI 相关的算力采购和预付款。 腾讯披露,这些基础设施正在支持模型、WorkBuddy、CodeBuddy,以及微信 AI 项目的训练和推理。 图|彭博社 另一个数字更直接——腾讯当季 Non-IFRS 营业利润为 756 亿元,如果剔除元宝、WorkBuddy、CodeBuddy、小微等 AI 产品的影响,实际上的利润则是 861 亿元。 也就是说,按照腾讯自己的财务口径,新 AI 产品目前正拖累着腾讯集团约 105 亿元的季度经营利润。 这也是腾讯接下来必须回答的问题:AI 已经有产品、有用户、有使用量,但什么时候真正变成一门生意? 图|新浪财经 微信上线 AI 修图这件事本身并不大。真正的重点是,两个月前还藏在主界面角落里的「小微」,正在逐渐成为一个 Gemini 一样「无处不在」的 AI。 继续沿着这条路线走下去,小微不会成为一个「AI 小程序」,而是微信的 AI 能力本身。
突发|DeepSeek 多模态模型上新,鲸鱼终于开天眼了
DeepSeek 终于「开眼」了。 就在刚刚,DeepSeek 推出了一款面向 Agent 时代的多模态模型:deepseek-v4-flash-vision-exp。 目前,该模型已经上线 DeepSeek API 平台上,用户可以通过设置 model=’deepseek-v4-flash-vision-exp’ 访问该模型。 官方介绍,这是一个实验性质的模型。该模型在保持 DeepSeek-V4-Flash 文本能力的基础上,新增视觉理解能力,可以处理图片输入,并进一步提升多模态 Agent 任务表现。 与此同时,DeepSeek Harness 0.1.1 版本也加入了对该模型的原生支持,开发者可以直接调用 deepseek-v4-flash-vision-exp,将图像理解能力接入现有 Agent 工作流。 这意味着 DeepSeek 的多模态能力开始从单纯的「看图问答」走向更复杂的任务执行场景。 从文本模型到多模态 Agent 过去一段时间,AI Agent 的竞争重点逐渐从模型生成能力转向任务执行能力。 一个能够完成真实工作的 Agent,需要理解用户输入的信息,也需要读取文件、识别图片、调用工具,并根据环境变化调整行动路径。 在这一过程中,视觉能力成为重要组成部分。 DeepSeek 表示,deepseek-v4-flash-vision-exp 在文本能力方面与 V4-Flash 保持一致,包括 Agent 能力、推理能力以及世界知识。 同时,该模型在多模态 Agent 基准测试中,相比 V4-Flash 有明显提升,模型表现接近 Opus-4.8 等高端模型。 目前,deepseek-v4-flash-vision-exp 支持混合文本和图片输入,图片可以通过 Base64、外部 URL 或 Files API 方式提供。 开发者可以通过 Chat Completions、Messages 以及 Responses API 调用该模型,使图片理解能力接入不同类型的应用。 例如,在办公场景中,Agent 可以读取截图、分析文档页面、理解表格内容;在开发场景中,它可以识别界面问题、分析错误信息;在内容生产场景中,它可以根据图片素材辅助生成内容。 比如我们可以用 deepseek-v4-flash-vision-exp 生成商业定制西藏自驾游 PPT。 再比如,我们还可以用它对 DeepSeek Harness 官网进行二次创作。 简言之,多模态能力的加入,让 Agent 能够处理的信息范围进一步扩大。 定价延续 V4-Flash,图片按 Token 计费 从 API 价格来看,deepseek-v4-flash-vision-exp 延续了 DeepSeek-V4-Flash 的价格体系。 模型输入和输出均按照 token 数量计算费用,其中图片会根据尺寸转换为 token,与文本 token 一同计费。 官方表示,每张图片最高会换算为 384 tokens,并按照 V4-Flash 的价格标准计费。 ▲ https://api-docs.deepseek.com/zh-cn/quick_start/pricing/ 目前,deepseek-v4-flash-vision-exp 的百万 tokens 输入价格如下: 缓存命中情况下,空闲时段价格为 0.05 元,高峰时段为 0.10 元。 缓存未命中情况下,空闲时段价格为 1.5 元,高峰时段为 3 元。 输出价格方面,空闲时段为每百万 tokens 4.5 元,高峰时段为 9 元。 其中,高峰时段为北京时间每天 9:00 至 12:00,以及 14:00 至 18:00,其余时间按照空闲时段价格计算。 相比一些主打多模态能力的大模型,DeepSeek 继续保持相对较低成本的 API 策略,希望降低开发者调用视觉模型的门槛。 Files API 解决图片复用问题 伴随视觉模型上线,DeepSeek 同步推出 Files API。 此前,开发者调用视觉模型时,通常需要在每次请求中重新上传图片。当图片需要在多个请求、多轮对话或者 Agent 任务中重复使用时,不仅增加网络传输成本,也会受到请求大小限制影响。 Files API 提供了一种新的方式。 开发者可以先上传图片文件,随后通过 file_id 在不同请求中引用同一文件,无需重复上传。 ▲ https://api-docs.deepseek.com/zh-cn/guides/files\_api 目前,Files API 支持 JPEG、PNG、GIF 和 WebP 格式,单个文件最大支持 64 MiB,单用户最大存储空间为 25 GiB,最多可以保存 10000 个文件。 对于复杂 Agent 工作流来说,这类文件管理能力的重要性正在提升。 例如,一个需要长期分析产品资料的 Agent,可以先上传大量图片、文档素材,之后根据任务需要反复调用,而无需每次重新传输数据。 值得一提的是,DeepSeek 此次上线 deepseek-v4-flash-vision-exp,并没有单独强调图像生成或视觉娱乐能力,而是将重点放在多模态 Agent 场景。 从行业趋势来看,AI Agent 正在从处理文字指令,走向理解现实世界中的各种信息。 文字是人类交流的重要方式,但大量真实工作依赖图片、文件、界面和环境信息。一个只能处理文本的 Agent,很难真正进入办公、设计、开发等复杂场景。 因此,多模态能力正在成为 Agent 进一步发展的基础设施。DeepSeek 通过 V4-Flash-Vision-Exp、Files API 以及 Harness 生态支持,正在尝试补齐这一环节。 只能说,那个熟悉的 DeepSeek 终于又回来了。
2部安卓手机中继复活过期银行卡,演示成功支付500美元
IT之家 8 月 21 日消息,科技媒体 cybersecuritynews 昨日(8 月 20 日)发布比文本,报道了“僵尸卡”攻击方式,可借助 2 部支持 NFC 的安卓手机,中继篡改已过期 Visa 非接触式卡片,完成最高 500 美元(IT之家注:现汇率约合 3,370 元人民币)支付。 在 USENIX 安全研讨会上,来自美国马萨诸塞大学阿默斯特分校的研究人员展示名为“僵尸卡”(Zombie Card)的攻击方式,可让已过期的 Visa 非接触式银行卡在销售终端完成真实支付。 研究指出,EMV 非接触式支付的卡片到期机制主要由终端执行本地策略检查,芯片私钥不会因卡片印刷到期日失效,用于离线数据认证的证书也可能在换卡期后继续有效。终端会以明文读取“应用到期日”字段,并据此判断卡片是否过期。 研究团队使用 2 部支持 NFC 的安卓手机搭建中间人中继:1 部手机在 POS(销售点终端)旁模拟卡片,另 1 部手机在实体卡片旁模拟终端,二者经 Wi-Fi 通信。该方案可在交易的数据读取阶段实时拦截并改写 APDU(应用协议数据单元)数据。 测试覆盖 EMV Kernel 2(对应 Mastercard)、Kernel 4(American Express)、Kernel 6(Discover)和 Kernel 3(Visa)。 Kernel 2、4、6 会把到期信息纳入签名记录或交易哈希数据,篡改会导致签名验证失败。Visa 使用的 Kernel 3 未将到期日字段纳入签名动态应用数据,攻击者把过去日期改为未来日期后,终端仍可通过本地校验。 研究还发现,Kernel 3 向发卡行传送全为 0 的终端验证结果字段,银行无法获知终端的本地验证曾遭篡改。部分卡片标志还可强制交易转为在线授权,即使到期检查失败,持有仍有效主账号的过期卡也可能抵达发卡行授权系统。 以上图源:论文 针对美国五家主要银行的测试结果显示,业界对于处理即将过期的银行卡尚无统一规范。其中一家银行批准了金额高达 500 美元(现汇率约合 3,370 元人民币)、涵盖多种商户类型的 " 僵尸交易 ";另一家则始终拒绝此类交易,并提示用户改用新换发的银行卡。
小米18 Pro系列屏幕重磅升级:黑边不到1mm
快科技8月21日消息,小米18 Pro系列已经入网,将在9月正式发布。 据博主数码闲聊站透露,小米18 Pro系列将采用全新极窄四等边屏幕,黑边不到1mm,配合上大R角的设计,屏幕观感会进一步提升。 此外,这块屏幕还将采用Pol-less去偏光片定制基材,支持1nit超低亮度调节,覆盖BT.2020广色域,拥有1-165Hz LTPO自适应刷新率,兼顾画面色彩、暗光护眼与功耗控制,解决直屏机型常见的反光、低亮度频闪等问题。 新一代超级像素技术也是必不可少,采用全RGB无损排列,子像素达到938.9万,对比之下,传统2K类钻排只有921.6万,实现超2K清晰度,同亮度比1.5K功耗更低。 性能方面,小米18 Pro系列则会首发搭载台积电2nm打造的骁龙8 Elite Gen6 Pro,晶体管密度较上代3nm提升30%,功耗控制、持续性能均有显著优化。 采用第三代Oryon 2+3+3三丛集八核CPU与16MB二级缓存,搭配Adreno 850 GPU、18MB专属图形缓存,支持LPDDR6高速内存,端侧AI算力、光追游戏、本地大模型运行能力刷新历史。 影像方面,Pro Max独享2亿像素LOFIC超大底主摄+2亿像素大底长焦微距,再搭配上一颗超广角,形成双2亿的三摄组合;Pro则搭载2亿像素超大底主摄+2亿像素大底长焦微距镜头,并不支持LOFIC。 电池方面,Pro作为小屏机配备7000mAh级别大电池,Pro Max则达到了8000mAh级,均支持100W闪充+无线充电。
国补后1996元起!雷鸟新款AI眼镜仅34克,支持两天续航、全天候记忆
智东西 作者 | 杨京丽 编辑 | 李水青 智东西8月21日报道,刚刚,雷鸟iO AI眼镜发布。这款产品重34克,日常续航可达两天。眼镜搭载DeepSeek和千问大模型,其“AI全天智记”功能支持连续记录18小时。 设计方面,雷鸟iO采用皇冠框型设计,前框使用镁铝合金,镜腿采用双层钛合金结构,提供“极夜”和“沙丘”两款配色。 显示方面,雷鸟iO采用单绿色显示,搭载自研蓝湖光波导和萤火光引擎Nano。蓝湖光波导显示区域透过率为93%,非显示区域透过率超过98%,萤火光引擎Nano体积仅0.085cc,可实现等效33英寸显示及1800尼特入眼亮度。 AI方面,雷鸟iO围绕知识、表达和记忆三类场景设计功能。眼镜接入DeepSeek和千问大模型,支持联网问答、实时提示、提词及55种语言翻译;“AI全天智记”可将对话转写为文字,并自动整理每日总结、待办事项及个人偏好。 这款眼镜没有配备摄像头和扬声器,不支持第一视角拍摄、视觉识别及声音播放等功能。 售价方面,雷鸟iO定价2499元,限时首发价2349元,叠加国补后为1996元。 雷鸟iO充电夹售价99元,2000mAh充电眼镜盒售价349元,可以为眼镜完整充电5次。眼镜与充电盒套装限时首发价2648元,国补后为2250元。 此外,同场发布的还有雷鸟V4 AI拍摄眼镜32GB版本。雷鸟称,受存储成本持续上涨影响,此次面向存储需求较低的用户推出低容量版本。该产品主打第一视角拍摄,保留V4的大底方形传感器、AI双芯架构和长续航,支持IP64防尘防水,售价1999元,国补后为1699元。 一、重34克,日常场景续航两天,AI连续记录18小时 雷鸟iO前框采用镁铝合金,边缘平均宽度为2.25毫米,镜腿采用双层钛合金结构,镜腿最薄处为1.15毫米,主板、电池等元器件被放置在镜腿后部,以降低前框和鼻托区域的压力。 为了更为舒适的体验,眼镜的镜框与镜腿连接处设有5度外倾角,镜腿处还配备了镜腿硅胶套。 雷鸟iO提供“极夜”和“沙丘”两款配色,整机重34克,其中前框重17克。在镜框和镜腿衔接处,雷鸟设计了5度的外倾角,让iO能够更好的贴合面部轮廓。 右侧镜腿配备Smart Crown智能旋钮,可切换不同功能。产品支持IP54防尘防水,可应对雨天通勤及一般户外使用。 显示方面,雷鸟iO采用单绿色显示,搭载自研蓝湖光波导和萤火光引擎Nano。蓝湖光波导使用三层光学结构,据雷鸟介绍,其显示区域透过率达到93%,比此前多数波导眼镜提高超10个百分点;非显示区域透过率超98%,色差指标达到Delta E 2.52。 萤火光引擎Nano针对单绿色显示重新设计,体积为0.085cc。光引擎与光波导组合后,可以实现等效33英寸显示,入眼亮度达到1800尼特。 近视适配方面,雷鸟iO支持0-1000度近视配镜,并提供包括1.67高折射率镜片在内的多种方案。 续航方面,雷鸟iO在日常使用场景下可使用两天,开启“AI全天智记”后,典型功耗下支持连续记录18小时,开启翻译功能,可连续翻译6.2小时。 二、自动整理全天对话,支持提词和55种语言翻译 雷鸟iO的AI能力主要围绕知识、表达和记忆展开。 知识方面,眼镜接入DeepSeek和千问大模型,支持实时联网查询,可以将问题答案、新闻及天气等信息显示在镜片上。 雷鸟还为其开发了“实时提示”功能。开启后,眼镜会识别环境对话中的疑问句,并将模型生成的答案显示在用户视野中,用于访谈、交流及临时问答等场景。 表达方面,其提词功能可以将预先准备的稿件显示在镜片上。系统通过识别用户声音匹配演讲进度,实时高亮正在说的内容,并显示剩余文字进度。 翻译功能上,雷鸟iO支持超过55种语言及109种口音,可以将面对面对话或视频中的外语内容翻译后显示在镜片上。雷鸟与翻译服务商时空壶合作,通过手机本地运算处理部分翻译任务,据官方介绍,本地优化后翻译响应速度提高75%,延迟约为1.2秒。 记忆方面,雷鸟iO配备骨传导麦克风及四麦克风阵列。在用户授权并开启功能后,眼镜会将用户本人及周围人的对话实时转写为文字并保存,不保留原始录音文件。 “AI全天智记”可以在典型功耗下连续记录18小时。每天晚上,系统会根据当天记录的内容生成总结,提取重要对话、待办事项及情绪状态。长期使用后,系统还会整理用户的性格、饮食、音乐及表达习惯,形成个人记忆数据库。 用户可以查询此前的会议重点和口头约定,系统也会将识别出的待办事项推送至眼镜端,用户点头即可确认、摇头则取消。雷鸟称,其全天候记忆引擎单次可以处理接近100万Token的上下文内容。 结语:AI眼镜开始“记住”用户 雷鸟iO围绕知识、表达和记忆构建了一套较完整的AI功能:既能联网回答问题,也能提供实时提示、提词和翻译,还能持续整理对话、待办及个人偏好。雷鸟iO开始尝试利用长期上下文理解用户,AI功能有一定新意。 34克机身、两天日常续航和18小时连续记录,也让它成为一款定位清晰、产品思路较完整的轻量显示型AI眼镜。不过,由于没有配备摄像头和扬声器,它不支持第一视角拍摄、视觉识别和声音播放,使用场景仍存在边界。其转写准确率、长期记忆效果及隐私保护能力,也有待真实使用检验。

版权所有 (C) 广州智会云科技发展有限公司 粤ICP备20006386号

免责声明:本网站部分内容由用户自行上传,如权利人发现存在误传其作品情形,请及时与本站联系。