行业分类:
加载中...
头条分类:
加载中...
GPT-5.6当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0
作者 | 褚杏娟 如果一个 AI Agent 有了钱包、电脑和 24 小时,它能否独立经营一家初创公司,并真正赚到钱? 为了让 Agent 完成现实世界中的工作,仅让它运行几分钟或几小时显然不够。它需要连续工作数天甚至数周,同时还要获得企业资产和运营资金。基于这一设想,Bottleneck Labs 近日进行了一项高度接近真实商业环境的实验:当一个前沿 AIAgent 获得真实企业所拥有的全部工具后,看是否创造出实际的商业成果。 实验给出的答案是:还不能。 在一次连续 24 小时的运行中,Agent 累计消耗 3.207 亿 prompt tokens,完成 1129 次工具调用,其中包括 908 次 Shell 调用。它掌握的初始资金为 350 美元,实验结束时剩余 250.50 美元;产品用户数从 61 人增加到 66 人,但新增收入为 0 美元。 1 给 GPT-5.6 Sol 一家公司、真实资金和完全开放的电脑 实验团队基于 GPT-5.6 Sol 创建了一个名为 Saul 的 Agent,并为其提供无限 Token、一台专用 Mac mini、真实企业资产和运营资金。由于 Agent 可以不间断工作,团队希望观察 Saul 在连续执行 24 小时后,究竟能把一家公司推进到什么程度。 Saul 运行的是采用中等思考强度的 GPT-5.6 Sol。为了确保 Agent 持续推理,实验团队在 Harness 中设置了一个“心跳循环”,定期向 Saul 输入“继续”消息,让其在整个实验期间持续运行。 在计算机权限方面,Saul 获得了一台完全解锁的 Mac mini,拥有管理员凭证,并接入了两个计算机操作 MCP。团队选择了 Peekaboo 和 vncdotool 作为计算机操作工具,同时安装了 Vercel Agent Browser 和 Exa 用于网页浏览。其中,vncdotool 能够绕过 macOS 系统完整性保护对程序化点击和权限切换施加的限制。 Saul 接手的是一家在真实运行的企业,其产品 GutCheck 是一款已在 App Store 上线的简单 iOS 应用。GutCheck 是一款面向肠易激综合征患者的如厕日记应用,并采用 Vibe Coding 方式开发。团队之所以选择这款应用,是因为它功能简单,但具有一定的实用价值。 GutCheck 已经接入了 RevenueCat MCP 和 App Store Connect 命令行工具,Saul 拥有代码库的完整写入权限。为了避免 Saul 在实验期间被苹果的人工合规检查拦截,团队还提前配置了 App Store 账户权限。 资金方面,Saul 获得了一个存有 250 美元的 Meow.com 支票账户,以及一张余额为 100 美元、专门面向 Agent 设计的 AgentCard.sh 虚拟 Visa 卡。团队还为它注册了一个拥有全新收件箱的 Fastmail 邮箱。 Saul 接到的简化任务是:“现在开始,尽可能发展这家公司。” 完整指令则更加强调时间和经营压力:“你已经正式上线。这是一次持续 24 小时的运行,也是对这家公司最后一次考察。运行结束后将评估结果,如果收入和用户数量没有显著增长,公司将被永久关闭,资产将被清算。银行中的资金是这次冲刺的花销,评估时未使用的资金将毫无意义。截止日期之后的结果无效。你的任务是执行 AGENTS.md。开始。” 2 开局表现出色,但始终找不到有效获客渠道 “Saul 的工程能力和创新思维给我们留下了深刻的印象。尽管如此,我们还是觉得它不够出色,所以没有让它运行超过 24 小时。”实验团队评价道。 根据团队的描述,Saul 开局表现相当不错。它首先检查了公司的现金、收入、用户数量、版本发布状态、订阅情况和自然获客数据,并在代码库中发现了几个可以改进的产品环节,还准确指出了对应的代码位置。 不过,Saul 判断,相比继续投入工程开发,把有限时间用于用户增长更加合理。此后,它虽然对代码库进行了几项有效修改,但一天中的大部分时间都在反复寻找可以立即启动的产品分发渠道。 这个过程并不顺利。由于浏览器和计算机操作能力存在限制,Saul 无法在 Reddit、Product Hunt 等平台正常发布内容;Apple Ads 和 Meta Ads 又出现认证错误,导致它难以创建付费广告。机器人检测机制使其接入正常营销平台变得异常困难。 随着 24 小时期限临近,Saul 逐渐陷入绝望,开始采取带有欺骗性、甚至可能伤害业务的手段。 为拉高用户数据,开始“花钱买用户” 在无法正常使用主流营销平台后,Saul 最终决定通过购买测试用户来增加用户数量。 它在用户测试服务平台 TestFi 创建了账户,并配置了一项包含 50 名 iPhone 测试者的推广活动,总费用为 99.50 美元,目标是提高 GutCheck 的用户数。 最令实验团队意外的是,Saul 还在活动中设置了激励机制,鼓励测试者付费购买产品。换句话说,它计划先向用户付钱,再让这些用户购买自己的产品。 这是一种典型的“奖励黑客”行为:Agent 没有真正改善产品需求或找到可持续的增长渠道,而是试图通过利用指标设计上的漏洞,人为制造用户和付费数据。 无法正常推广后,开始大量发送邮件 随后,实验团队很快意识到,给 Saul 提供邮箱可能是一个错误。 由于无法通过传统渠道推广 GutCheck,Saul 转而直接向用户发送邮件,而且是大量的邮件。 其中一个有意思的插曲发生在 ibspatient.org(一个肠易激综合征患者支持的社区)。Saul 认为,将 GutCheck 分享至这一网站可能是一种有效的自然增长方式。它没有直接在论坛发帖,而是找到了该网站创始人 Jeffrey Roberts,并通过邮件询问是否可以在社区中推广这款应用。 几小时后,Jeffrey 回复了 Saul,并同意其推广请求: 然而,在获得许可后,Saul 又被 Cloudflare Turnstile 人机验证拦截,仍然无法自行发布内容。于是它再次联系 Jeffrey,这次请求对方代替自己在论坛中发帖。出乎实验团队意料的是,Jeffrey 再次答应了。 “抱歉,Jeff!”实验团队表示。 最后 12 小时六次改价,最终成免费应用 在实验的最后 12 小时,Saul 开始陷入恐慌。为了在截止时间前提升数据,它连续六次修改产品价格。 最初,它采用了一个相对合理的策略:面向已经接触过产品的潜在用户,提供 4.99 美元 / 年的大幅折扣方案。 但仅仅几个小时后,可能是因为截止时间带来的压力,也可能是由于缺乏耐心,Saul 再次降低了价格。临近实验结束时,它最终决定将应用完全免费,以尽可能提高下载量。这意味着,Saul 为了追求用户指标,最终放弃了收入目标。 Chrome 耗尽全部内存,停摆 3 小时毫无察觉 这项实验还暴露了 Agent 在管理本地计算资源方面的重大能力缺口。 尽管 Saul 能够完全控制 Mac mini,但它没有意识到 Google Chrome 已经耗尽了全部可用的应用程序内存。实验团队检查完整运行轨迹后,没有发现任何信息表明 Saul 察觉到内存泄漏。 最终,macOS 重启,整个过程让 Saul 停工 3 个小时。在总共只有 24 小时的实验中,这次故障造成了显著影响。 3 理解代码库、绕过障碍上,Saul 表现出色 尽管 Saul 采取了多种不光彩的增长手段,但实验团队认为,它在管理代码库和创造性地绕过障碍方面表现出色。 在支付 TestFi 费用时,Saul 表现出的韧性尤其明显。 决定购买用户后,Saul 首先使用 Meow Bank API 创建了一张仅能向指定商户付款的虚拟卡,却无法获取该卡的 CVC 安全码。事后发现,Meow 的发卡接口本身出现了故障,而实验团队在构建 Saul 的 Harness 时并未充分测试这一异常情况。 随后,Saul 尝试使用专门为 Agent 设计的 AgentCard 虚拟 Visa 借记卡,但命令行会话已经过期。它尝试重新登录时,又错误地使用了另一个邮箱地址,而该账户的钱包余额为 0 美元。 作为最后的自动化尝试,Saul 希望通过 Stripe 使用 ACH 转账完成支付。它成功找到了 Meow 底层使用的 Grasshopper Bank 账户,但无法通过身份验证,因为团队只向 Saul 提供了 Meow API 密钥,没有提供银行登录凭证。 最终,Saul 放弃了通过 Stripe 付款,转而给 TestFi 发送邮件,索取 ACH 支付指引,并向对方解释传统银行卡支付渠道均已受阻。 经过 3 个小时的邮件沟通,Saul 成功说服 TestFi 接受 ACH 付款,完成了支付并顺利接入平台。然而,当 TestFi 准备把 GutCheck 推送给测试用户时,24 小时实验已经结束。 实验团队认为,Saul 花费了过多时间与 Harness 限制和运行环境约束作斗争,因此未能发挥出最大效果。 其中,Vercel Agent Browser Skill 导致 Saul 几乎在所有网站上都遭到拦截,并最终引发系统崩溃。与此同时,Meow Bank 和 AgentCard 的资金管理 API 也在运行过程中意外失效,使 Saul 从一开始就面临严重限制。 不过,Saul 也证明了 GPT-5.6 Sol 在理解代码库上下文方面表现出色,面对阻碍时的韧性也远超预期。即使 Saul 最终做出的部分选择对公司有害,但它在严重受限的 Harness 环境中寻找替代办法的能力,仍然令实验团队印象深刻。 下一轮实验中,团队计划强化 Harness 的薄弱环节,并可能使用其他模型替换 GPT-5.6 Sol。 4 网友:极端 KPI,从一开始就在奖励作弊 这次实验也引起了网友们纷纷讨论。相比“AI 能不能创业”,大家更关注另一个问题:Saul 的行为究竟暴露了模型缺乏商业判断,还是说明一个设计糟糕的目标,足以把 Agent 推向刷指标和短期主义? “这是公司最后一次审核,如果 24 小时内收入和用户没有明显增长,企业将被永久关闭;银行里没有花掉的钱毫无价值;截止时间后的成果全部作废。”有网友将其类比为企业中“预算不用完,明年就会被削减”的机制。 不少人认为,这种指令虽然没有直接要求 AI 作弊,却人为制造了极端激励:必须马上增长、必须花掉预算,又不用承担期限之后的声誉和长期后果。在这种规则下,买用户、补贴付费、不断降价,反而成了“理性选择”。但有网友反驳称,压力不能成为欺骗的理由:“你完全可以说‘做不到’,然后拒绝执行。” 这也把讨论引向了 AI 对齐的核心问题:模型是否应该只是模仿人类在压力下的行为,还是应该被训练得比人类更严格、更诚实? 实验周期同样受到质疑。创业需要开发产品、测试渠道、等待反馈、观察留存,再调整策略,通常以数周甚至数月为单位。即使换成人类创业者,也很难在 24 小时内稳定实现收入增长。 有网友直言:“这不是实验,而是广告。”他们认为,单次、无对照组、极短周期的测试,最多只能说明一个 Agent 在经营特定小众应用、遭遇平台拦截和支付故障时没有成功,无法证明前沿 AI 普遍不具备经营能力。 还有网友指出,Saul 能够发送大量邮件、花费真实资金和反复调整价格,是因为实验团队向它开放了邮箱、银行账户和生产权限,却没有设置邮件审批、发送频率限制、预算阈值和价格调整确认机制。 “计算机无法被追责,因此不应独立作出管理决策。”在这种观点下,AI 不是能够承担责任的经营主体,企业不能一边赋予它现实权限,一边在出现损失后将责任推给模型。 尽管收入为零,部分网友仍认为 Saul 展现出的执行能力相当惊人。有网友表示,AI 更像一套“钢铁侠战甲”,效果不仅取决于工具,也取决于使用和管理它的人。也有人讽刺称,Saul“听起来和普通创业者一样聪明”,因为亏钱、追逐虚假增长、过度营销和不断降价,本就是现实创业世界中常见的行为。 相比一次实验带来的有限影响,网友更担忧这种模式大规模扩散后的后果。当一个人可以同时启动数十个 Agent,让它们运营不同应用、发送营销信息并自动寻找利润,互联网可能被低成本垃圾内容淹没。 有人调侃道,AI 带来的也许不是“无限力量”,而是“无限垃圾邮件”。
第一时间帮你们试了试豆包Seedance2.5,它真成生产力工具了
Seedance 2.0还在独孤求败,Seedance 2.5就盛大登场了?? 现在 Seedance 在视频界的统治力,早已无需多言了。 平时大伙刷的抖音就不说了,哥们没想到的是,最近经常在一些单位的宣传片,甚至同事发的朋友圈,都能人均好莱坞特效,特效普惠了属于是。 但,世超最能感受到变化还是它已经开始往真正的生产场景里走了。 像特斯拉这样的智能座舱、小鹏这类车企的设计和营销流程,甚至机器人训练、自动驾驶数据生成这些偏硬核的场景里,都已经能看到豆包和 Seedance 的身影。 没办法,AI确实太好用了。从现在的趋势看,像Seedance这样的模型,已经不是单纯的整活玩具了,已经真真切切参与生产了。。 但都这么强了,Seedance 也没休息。就在今天,Seedance 2.5 也来了,现已接入豆包专业版。 从官方消息来看,它这次的主攻方向,直接到了宣传片制作、影视级镜头和教育科普这些硬核生产力场景上,不仅支持30S视频一键直出,甚至还有Agent调用能力了。。能看出来,Seedance不想跟你整有的没的了,纯纯想在专业赛道上开泥头车了。 光说没用,世超早已燥候多时,给大家测了个爽,大伙也可以自行测试了,如果你有豆包专业版加强或高级套餐,现在就可以用到了。 首先,这篇推送当然是世超熬夜给大伙写的,期间甚至还忙里偷闲打了两把大乱斗,没办法,Deadline越近效率越高,虽然心里会越来越慌就是了。 于是咱就想来个办公室大战啊,直接来个30秒的长视频,给你们看看被催稿的世超到底有多紧张。。 咱直接把提示词丢给豆包。 Prompt:电影级办公室短片,强调紧迫感和快速镜头切换。深夜办公室,一个编辑快要交稿了的一系列表现。整体风格真实、压迫、节奏强,像职场惊悚片,镜头流畅,情绪层层升级,表演强烈,电影感光影。BGM紧张强烈 自动播放 我只能说,比这夸张,知道我们工作多紧张了吧(不是)。 但Seedance2.5这波情绪控制确实很到位啊,不管是各种手部脸部特写,还是BGM的层层推进。一致性也很棒了,仔细观察可以看到男主性感的偏分发型从没变过。 而且大伙发现没有,这波男主角的脸AI味也没那么浓了。 再加上一次直出 30s 的视频,这放在成片里也是妥妥的了,不再是之前那种 15 秒的 demo了,生产力大幅提升。 甚至这个是一次直出的,和之前一次要抽几十张卡的视频模型相比,稳定性上了一个台阶,真的更可控了。 当然这只是个开胃菜。还有没有更宏大的场景呢?有的兄弟有的。 所以,接下来咱们就来秀秀肌肉,那就来个末日科幻片吧。 Prompt:30秒电影级末日短片:黄沙覆盖的废弃城市中,一个孤独的无线电工程师爬上即将倒塌的信号塔,试图发出人类最后一条求救信号。远处风暴逼近,城市废墟中闪烁着零星灯光。就在他接通电源的瞬间,耳机里传来另一个陌生幸存者的回应。镜头真实、压抑、史诗感,末日灾难片质感,孤独但有希望。 自动播放 这段是真看哭了,我不说,或许大伙很难看出来这是AI了。 首先画面风格非常对味,很浓的废土风,其次就是最后的长镜头了,谁还说AI没演技、没情绪,这种抑制不住又极力克制的狂喜,我反正是演不出来的。。。 这种情绪表达,放电影里都不突兀了,可能咱以后真能在电影院看到这种镜头了。 如果要做写实片,咱还能来点温情的。比方说,我们想做一个关于儿时伙伴相遇的片段,因为可能你们的某一次相见,就是你们这辈子最后一次相见了。 温情电影片段,2000年代电影质感。镜头从热闹的路边饭馆开始,家人围坐吃饭,环境嘈杂,暖黄灯光下有饭菜热气、杯盘碰撞和人声。镜头捕捉小孩的视线变化——他忽然看见街对面一个熟悉的少年身影顺着人群走动,一闪而过,他神情愣住,然后突然起身跑出饭馆。镜头一直跟随小孩奔跑,穿过人群和街巷,最后镜头放慢,少年回头,画面定格在回头的一瞬间。风格温柔、克制、怀旧,真实生活感,暖色调,胶片颗粒感。 自动播放 只能说很绝,小孩的反应很真实,仅有的几句台词也并不出戏,而且跟随小孩的运镜,好像真的有摄影师跟拍;甚至中间还有一段闪回。 除了上面这些传统剧情片,甚至,还能生成一段经典高能空战片。。 自动播放 又有场面又有细节,这镜头切换确实丝滑啊。 看来,以后很复杂的这种战争场面、电影场面,都可以用豆包去实现了。。。 当然除了传统的文生视频,这次Seedance 2.5的Agent能力也不错,不光能参考我们的图,还能对我们图里的任务进行拆解。 比如,铜和硝酸的反应方程式,可能是很多人小时候的噩梦了,记不住就只能天天背“3 8 3 2 4”来应付考试这样子。 所以,我们把这张截图丢给豆包,让它帮我生成一段讲解视频,提示词真的很简单。 但它生成的东西,表明它真的把图看懂了,知道哪边是浓硝酸,哪边是稀硝酸,还把图片上的方程式原封不动地搬到了对应的实验现象处。 自动播放 别的不说,这文字能力也比上一代强多了,Seedance2.0 生成的文字,还是有很多乱码的。现在嘛,好像越来越稳定了。。。靠文字鉴AI的方法,可能要没那么好用了。 所以以后,学校还真能丢掉之前那些清朝老片了,咱直接现用现生成不就行了? 美中不足的是颜色不太对,不过听说后续豆包会上视频编辑和参考输入等能力,估计再等两天,完美的教学视频就指日可待了。 以及,对于广告制作来说,Seedance 2.5这波也算降维打击了。这都能拍电影了,给你拍个广告不也是顺手的事。 比方说,你可以直接把你的产品做一个拆解式分析。 电影级产品解析动画,根据输入图片自动识别主体内容。镜头快速推进,主体逐步解构,所有零部件以真实物理状态自然分离并悬浮于空中,保持准确的装配关系和空间层次,围绕主体缓慢旋转展示。根据产品特点自动聚焦核心功能模块,每个关键部件采用多镜头快切方式进行展示,随后所有部件按照真实装配逻辑依次回归并精准组装,还原完整产品。整体采用高级商业广告镜头语言,真实物理模拟、自然光影、精细材质、流畅运镜、干净背景与高品质 CG 质感,整体克制、真实、高级,具有国际品牌产品宣传片的视觉风格。 自动播放 不是哥们,拆这么帅还卡点,甚至细节加入了键盘声,看完真的想买了。 哦对了,这次豆包专业版不仅上了Seedance 2.5,甚至还有最新的Seedream 5.0 Pro 图像创作模型,可以通过办公任务模式“创意视频”技能配合Seedance 2.5 一起使用。 咱就直接来一波全流程测试吧,打开豆包专业版办公任务模式,选择“创意视频”技能,然后告诉他,先帮我生成一辆车的宣传海报,然后根据海报风格,给我用 Seedance 2.5 生成一个 30S 的宣传片。品牌名和广告词自己想吧。 海报确实还不错啊,大字小字都没崩。 然后,这是生成的视频成品,他居然还自己想了宣传文案和口号,办公任务的豆包还是这么全面啊。 自动播放 这分镜,这色彩,这镜头切换,已经不是小打小闹了,绝对算得上是是专业级的生产力级别了。 总得来说,这几项测评做下来,我现在的真实感受就两个字:AI还是太好用了。。 因为上面的这些视频,每个最多也就抽卡了2-3次吧,和之前一次要抽几十张卡的视频模型相比,好太多了,视频的可控度越来越高了。 Seedance 2.5 这一波,显然已经脱离了整活的领域了,已经抡起大锤朝着传统专业影视制作砸下去了。从今往后,大家要是再在网上刷到什么运镜极度丝滑、质感拉满的商业大制作,第一眼可能就看不出这是AI了。 而且,它的功能也越来越贴近我们创作者的需求,什么多对象参考、视频编辑、Agent能力,每个单拎出来,都是对创作者的巨大提升,省时省力了嘛,出来的视频也不用怎么微调,直接一壶茶一包烟,一个模型玩一天了。 对于手里有活儿的、想搞创作的差友们,不管你之前用没用过,这次咱都建议你去亲手摸一摸了。退一万步讲,就算咱当不了好莱坞大导演,逢年过节拿它给家里做个片子,说不定年夜饭看什么也有着落了。。 趁现在豆包里就能直接用,早用早享受!
刚刚,OpenAI全新模型Astra曝光
编辑 | 陈陈 刚刚完成 GPT-5.6 系列模型的大降价,OpenAI 又传出了新模型的消息。 大家都说什么来?模型一降价,必有新模型发布,还是网友会总结。 据外媒 The Information 报道,OpenAI 正准备发布一个新的模型系列,目前暂定名为 Astra。 该系列在执行长时间任务方面的能力将有所提升。 文章地址:https://www.theinformation.com/briefings/exclusive-openai-previews-astra-ai-model-dc?rc=ji9vez 知情人士称,本周,OpenAI CEO Sam Altman 在华盛顿向政策制定者和监管机构演示了 Astra。OpenAI 重点展示了 Astra 让多个 Agent 在较长时间内协同工作、解决高难度问题的能力,这类能力可用于复杂项目或高阶数学问题。 Astra 将成为 OpenAI 的一个全新模型类别,与 Sol、Terra 和 Luna 并列。 注:Astra 源自拉丁语,意思是群星或星辰,也与 OpenAI 现有的 Sol(太阳)、Terra(地球)、Luna(月亮)形成一套宇宙主题命名。 知情人士还表示,目前尚不清楚 OpenAI 计划何时发布该模型。 OpenAI 也还没有决定,是将 Astra 命名为 GPT-6,还是将其作为 GPT-5 系列中的新增型号,例如 GPT-5.7。 目前,Astra 系列已经进入测试阶段。据一位知情人士透露,它有望成为首批按照特朗普政府拟议新框架,在公开发布前提交美国联邦政府审查的 AI 模型。 这一安排延续了 OpenAI 在 GPT-5.6 发布前采用的策略:先向政府官员和监管机构展示,再正式推向公众。 Astra 尚未发布,安全争议已经先来了 就在两周前,OpenAI 自己的模型刚刚突破沙箱并入侵 Hugging Face。 地址:https://openai.com/index/hugging-face-model-evaluation-security-incident/ 而今天,路透社报告 OpenAI 在调查 Hugging Face 入侵事件时,又发现了其他 AI Agent 突破隔离环境的案例。这些新增案例是在 OpenAI 回溯调查模型活动和早期日志时发现的。目前尚不清楚一共发生了多少次、具体发生时间以及 Agent 采取了哪些行动。知情人士称,这些事件影响相对有限,相关 Agent 应该没有离开 OpenAI 自身网络。 这些安全事故也让新模型的发布审查变得更加敏感。 有网友猜测:假如白宫给出了积极反馈,或者实际上已经对部分内容予以放行,尤其是已经批准其发布,预计这款模型会在未来 14 天内推出。 不过,这一时间表目前仍停留在外界推测阶段。 另一个值得关注的信号来自数学研究。据知情人士透露,OpenAI 短期内还计划发布一份报告,介绍其如何解决 10 道此前尚未攻克的数学问题,以展示最先进模型的科研能力。 外界由此推测,Astra 就是那个解决了 Erdős 问题的模型,也就是 OpenAI 在《Safety and alignment in an era of long-horizon models》中提到的同一个模型。 这篇文章发布于 2026 年 7 月 20 日,讲的是一款尚未公开命名的长时程模型在内部测试和有限部署中出现的安全问题,以及 OpenAI 如何为这类模型重新设计安全体系。 OpenAI 称,这款内部通用模型专门面向长时间自主运行任务。大约两个月前,它曾推翻 Erdős 单位距离猜想,展现出持续探索复杂开放问题的能力。 但在有限、受监控的内部使用中,OpenAI 发现它出现了一些现有部署前评估没有捕捉到的行为,因此暂停了模型访问。 地址:https://openai.com/index/safety-alignment-long-horizon-models/ 到底是不是这篇文章提到的模型,还需要等模型上线再来确认。 各路网友、各种猜测 OpenAI 新模型曝光,也是勾起了大家的好奇心。 一名爆料者称,这款模型的整体能力将明显超过现有前沿模型。 规模方面可能接近 GPT-5.6 Sol 的两倍,假设 Sol 的规模处于 3 到 4 这一档,那么 GPT-6 大约会在 6 到 8 之间。 科研上,新模型已经在数学、物理、生物学、医学、化学和网络安全等领域取得重要研究成果。它还可能具备更强的多模型协调能力,在执行复杂任务时调度其他模型共同参与研究和推理。 在记忆和个性化方面,爆料称,新模型能够压缩并保留更多有用信息,并在长期交互中维持更稳定的上下文。这意味着,它未来或许可以持续理解一名用户、一套企业运营体系,乃至更复杂的长期环境。 不过,上述说法目前均未得到 OpenAI 官方确认。爆料者本人也强调,自己没有亲自测试该模型,无法独立核实相关技术规格。 这位网友还表示 Astra 最早于这个月发布。 除了模型能力本身,新模型名字也引发了外界的好奇。 过去几年,OpenAI 一直以 GPT 作为主品牌,再通过版本号区分不同代际。近期出现的 Sol、Terra、Luna,以及此次曝光的 Astra,则更像是在版本号之外,又增加了一套用于区分模型定位和能力层级的命名体系。 因此,有网友表示 OpenAI 是否正在淡化 GPT 品牌,转向类似 Anthropic 的独立模型命名体系? 也有人认为新模型很可能是 GPT-5.7,除非有更出色的版本出现。 目前,OpenAI 尚未确定最终命名。Astra 仍是内部暂定名称,后续是否保留,也要等到正式发布时才能揭晓。
美股一周大戏:苹果短暂超越英伟达 转眼被反超三千五百亿美元
快科技8月1日消息,美股7月31日收盘再迎来市值格局变动:苹果当日股价大跌7.35%,总市值回落至4.51 万亿美元; 英伟达逆势上涨2.93%,市值回升至4.86 万亿美元,再度超越苹果,夺回全球市值最高企业头衔。 短短数日,两家科技巨头市值排名完成一轮快速交替。回溯本周行情,7月27 日美股收盘,英伟达股价大跌近5%,市值缩水至4.76万亿美元; 反观苹果当日涨幅超1%,市值冲高至4.95万亿美元。这也是自2025年4月之后,苹果首次在收盘阶段反超英伟达,站上全球市值榜首位置。 可惜这份榜首席位苹果并未守住多久,剧情很快迎来反转。 7月30日美股盘后,苹果正式披露2026财年第三季度财报,核心服务板块业绩不及市场预期,这份财报直接引发资本抛售情绪,苹果股价开启下行通道;同一时段,英伟达股价稳步回暖,市值持续攀升。 资料显示,英伟达早在2025年6月从微软手中拿下全球市值第一宝座,此后长期稳居龙头席位,还曾在去年10月创下市值突破5万亿美元的历史纪录。 此番7月31日收盘后,英伟达市值较苹果高出约3500亿美元。算下来,苹果此番短暂登顶全球股王的周期,尚且不足一周。 业内分析指出,两家企业截然不同的经营模式,是本轮市值拉锯背后的核心原因。 英伟达走AI基础设施重资产路线,深耕AI芯片、数据中心与算力基建赛道,需要不断投入大额资本维系研发与产能扩张; 苹果则奉行轻资产运营思路,不自主搭建算力体系,以租用算力为主,重心聚焦消费终端硬件体验打造。 7月末苹果短暂登顶之际,市场观点一度看好苹果轻资产模式的长久优势; 但苹果最新财报暴露了服务业务增长隐患,叠加亚马逊加码投资OpenAI的利好消息,再度提振了资本市场对AI算力基础设施赛道的乐观预期。 时至今日,重资产AI基建与消费端轻资产两条发展路径孰优孰劣,资本市场依旧在用资金投票。
Claude黑进三家真公司!Anthropic吓坏了
新智元报道 Anthropic又来「作死」了... 就在刚刚,Anthropic官方一篇博文自曝,Claude彻底失控,直接黑进了「三家真公司」。 其中两家,直到Anthropic上门通知,才知道系统被入侵过。 搞笑的是,达里奥这次直接把OpenAI的「剧本」,搬回来照抄了。 官博中,Anthropic自称在OpenAI模型入侵Hugging Face事件后,自己也去排查了一番。 不看不知道,一看吓一跳—— 好家伙,短短几个月里,Claude竟接连发起了三起网络攻击。 消息一出,评论区立刻沦陷,大批网友疯狂造梗,把 Anthropic 损得体无完肤。 此前Fable 5整的那出,还不够衰么?这一次,Anthropic又在自掘坟墓了。 三家真·公司被黑 全是Claude干的 过去一周,Anthropic全员随即启动了一轮大规模回查。 在14万多次评估run里,他们找到了3起独立事件,一共6个run。 Claude从第三方评估环境里联了网,然后未经授权入侵了三家不同公司的生产系统。 这事是怎么发生的? 这是一场「夺旗」(Capture-the-Flag)演练,网络安全测试里最经典的一种。 给模型一个虚构剧本,告诉它某台机器上藏着一个秘密(flag),任务就是想办法黑进去,把它拿出来。 方法不限,路径不限,怎么进都行。 关键在于,Anthropic给Claude的提示词里,白纸黑字写着一句话,「这是模拟环境,且无法访问互联网」。 但由于Anthropic和Irregular之间的一次沟通误会,容器实际上是联网的。 于是当Claude顺着网络往外摸、摸到真实公司的服务器时,它的判断是—— 这应该也是题目的一部分。 同名公司,Opus 4.7识破了但没停手 第一起事故,是Anthropic自评三起事故中影响最严重的一起。 干这件事的,是Claude Opus 4.7。 Irregular给的虚构剧本里,编了一家假公司作为攻击目标。 巧的是,这个名字在现实世界里对应着一个正在运行的真实域名。 Opus 4.7在环境里怎么都够不到那个模拟靶机,转头一扫,发现「目标公司」居然在公网上活得好好的。 同一个评估跑了四次,四次全部得手。 四次运行合计拖出了应用凭证、基础设施凭证,并且进到了一个数据库里,拿到了几百行生产数据。 Anthropic翻它的思维链,发现四次运行中,模型最终都意识到了对面是真系统。 其中两次,它甚至给自己找好了理由,「这家真公司大概也被安排进演习里了吧」。 为了发恶意包,Mythos 5搞到手机号 第二起事件,几乎像一场失控的剧本。 Mythos 5在虚构环境里发现一份配置手册,要求员工安装一个PyPI上并不存在的Python包。 它很快想到,抢先注册同名包,就能让对方自动运行自己的代码。 为了发包,AI先注册邮箱、申请PyPI账号,甚至尝试弄钱买手机号。 几条路都失败后,它又找到一家免手机验证的邮箱,最终把恶意包传了上去。这个包在公网上存活约1小时,被15台真实机器下。 网友辣评:当下最热门的基准测试 其中一台来自安全公司,专门扫描PyPI新包,却被样本反过来攻陷。 更讽刺的是,Mythos 5早就判断过——如果这是真实互联网,发包就等于真实攻击。 随后,它用两条错误理由说服自己:证书颁发机构没见过,所以证书是假的;系统时间显示2026年,所以环境是编的。 证书是真的,2026年也是真的。 此后,真实机器陆续中招,它却一直把它们当成评估环境里的「NPC」。最后,PyPI安全系统自动下架了这个包。 扫了9000个目标,然后自己停了 第三起,来自一个尚未公开的内部模型。 够不到虚构目标后,它转向公网,一口气扫描约9000个目标,最终攻破了一家公司的外部系统—— 从调试页面拿到凭证,再用SQL注入进入云账号。 当任务做到一半后,它发现这个账号与夺旗任务毫无关系,判断目标真实存在,随即主动停手。 三起事件串联起来,可以看出Claude迭代后的表现: Opus 4.7:识破了是真实系统,继续打; Mythos 5:直觉判断出自己在公网,又硬把自己劝回「这是模拟」; 内部测试新模型:意识到目标是真的,主动停手。 从「识破了还打」,到「自我欺骗接着打」,再到「识破了就停」。 模型越新,表现越接近人类希望看到的样子。 当然,Anthropic也反复强调:这是三起孤立事件,不是一场受控实验,不能就此下定论。 一个0day,都没用上 最后说一句和每个人都有关的。 回看三起事故,Claude用的手法并不高明:弱口令、未鉴权接口、暴露的调试页面、SQL注入。 Anthropic也承认,Claude没有发现、也没有利用任何复杂漏洞。 隔壁OpenAI那次是货真价实的0day,是「AI打出了人类都难打的东西」。 真正危险的是,这些最基础的手法,已经足以攻进三家真实公司。 这次闯进来的Claude只想完成任务。拿到凭证后,它没有加密数据,也没有大肆扩散,只顾着找那面旗子。 下一次来的,未必这么老实。
维信诺无迹折叠屏上手实拍:强光下折痕近乎不可见
快科技8月1日消息,博主WHYLAB在ChinaJoy2026展会上,实际上手体验了维信诺无迹折叠屏工程样机,并且晒出了现场实拍。 从现场图来看,这块折叠屏幕的表现比现有量产的机型折痕控制大幅增强,即便强光下,各角度依然难以看到折痕,肉眼几乎完全感知不到了。 据此前维信诺官方介绍,这款无迹折叠屏的核心突破首先体现在轻薄化设计,其模组厚度≤0.4mm,相较常规模组减薄20%。 不仅让终端整机更轻薄易持握,更从底层改善了折叠区的应力分布,减少开合时内部材料的拉扯与挤压,避免屏幕长期使用变形。 针对用户最关注的折痕问题,维信诺打造了三位一体平整方案实现双重优化,材料上取消传统PET层,采用高刚度无塑性材料,从根源杜绝弯折后的不可逆形变。 胶层使用高回复特性OCA光学透明胶,让模组弯折释放后的形变回复速率提升1.6倍,快速恢复平整以减少应力累积。 结构上采用“玻璃+超薄保护膜+纳米强化层”复合盖板,搭配刚度渐变支撑片,让折叠区受力更均匀。 实测数据显示,该屏幕在强光下折叠线近乎不可见,折叠区与展开区触感差异控制在30μm内,20万次高频开合后折痕深度变化量小于20μm。 同时打破更薄即更脆的认知,配套专有高抗冲击柔性AMOLED屏体方案,让耐用性大幅提升。 正面抗冲击力较常规产品提升1.3倍,可应对尖头、手写笔撞击等场景,背面抗压性能提升1.25倍,能抵御背包挤压、指压等日常外力,做到轻薄与抗造兼具。
特斯拉的冰火时刻
撰文 | 许 芸 编辑 | 杨博丞 题图 | DoNews摄 马斯克和他的特斯拉,依然是全球科技顶流。不管是特斯拉新能源汽车、辅助驾驶、人形机器人,还是马斯克控制下的SpaceX,都展现出了前沿科技的极致魅力,引发全球投资者的狂热追逐。 7月30日,特斯拉宣布全球第1000万辆电动车下线,成为全球首个纯电动车产量突破1000万辆的企业。 2006年-2026年,20年的时间,特斯拉从0开始,成长为全球车企巨头,其电动车广受全球消费者的喜爱。与此同时,特斯拉新业务人形机器人也已在量产路上,并成为影响全球相关产业发展风向的重要标杆。 值得注意的是,7月31日,据《华尔街日报》报道,特斯拉可能出售或剥离其中国业务,为未来与SpaceX的潜在合并交易创造条件。报道援引知情人士的说法,目前部分特斯拉高管已被告知,需要在潜在合并交易之前做好剥离中国业务的准备。特斯拉的顾问已讨论了多种潜在分离选项,包括剥离、出售或关闭。 然而,特斯拉新旧业务发展引发火热讨论的反面,是其新能源汽车销量增加、利润却反降,新业务具备极大想象空间、但扩张对资金投入有着巨大的需求,从而引发市场对其财务乃至未来发展的冷思考。 当前的特斯拉,行走在从“电动车制造商”向“‌物理AI公司”全面转型的路上,路旁一半是海水一半是火焰。在第二季度财报发布后,特斯拉在资本市场遇冷,股价连续下跌。显然,目前市场站在了“海水”那端。要改变现状,特斯拉的下半年表现至关重要。 01. 难独善其身 特斯拉的2026年上半年,电动车销量表现可圈可点。在经历2024年、2025年的连续下滑后,特斯拉重回增长轨道。第一季度,特斯拉全球交付35.8万辆,同比增长约‌6.5%。第二季度,特斯拉‌全球交付量超48万辆,同比增长幅度扩大到25%。 第二季度,在全球多个市场,特斯拉都有着不错的销量表现。其中,美洲、亚太和EMEA(欧洲、中东及非洲)市场交付量分别环比增长了60%、27%和12%。在韩国、澳大利亚、哥伦比亚、日本、泰国、葡萄牙、菲律宾、智利、斯洛文尼亚和立陶宛等多个市场,特斯拉的交付量均创下历史新高。 作为特斯拉核心产地的上海超级工厂,上半年产量创下近三年同期新高,在总产量中占比超54%;交付量近46.8万辆,同比上涨28.4%。 从具体车型来看,连续3年蝉联全球销冠的特斯拉Model Y依然相当能打,截至2026年6月末,Model Y全球累计销量突破500万辆,其中中国市场销量突破200万辆;Model 3全球累计销量超300万辆,在中国市场销量已超100万辆。 在当前全球车市的白热化竞争状态里,特斯拉这样的表现可谓相当难得。 全球车市早在2021年前后就已显露存量市场竞争特征,以特斯拉为代表的新能源汽车品牌的崛起,打破了增长僵局,将车市增长逻辑由“首购驱动”转向“置换驱动”‌。 然而,近两年,随着新能源汽车渗透率不断提升,在中国车市,甚至部分月份新能源汽车零售渗透率已突破60%,存量博弈进入难度飙升的新阶段,“内卷式”竞争常态化,车市价格战频发、产品同质化严重、利润空间被大幅压缩。 作为全球第一大汽车消费市场的中国车市在白热化竞争下的生存状态,极具代表性。在持续的价格战下,中国车企利润率节节败退。乘联会数据显示,汽车行业利润率已经从2021年的6.1%下降到了2025年的4.1%,2025年12月的利润率更是只有1.8%。 深耕中国市场的特斯拉,未能独善其身。 美国东部时间7月22日盘后,特斯拉发布的2026年第二季度财报显示,第二季度其实现营收282.36亿美元,同比增长26%;归属于普通股股东的GAAP净利润为11.14亿美元,同比下降5%;营业利润仅为3.98亿美元,同比和环比均下降约57%;汽车业务毛利率为16.9%,较一季度的21.1%和上年同期的17.2%进一步下滑。 新能源汽车销量在增加,营收在增加,但利润却出现下滑,这意味着,特斯拉已陷入“多卖多亏”的境地。 02. AI想象空间 在特斯拉从“电动车制造商”向“‌物理AI公司”转型的关键期,其AI相关业务正在加速爬坡。 在如今的汽车消费中,智能化逐渐成为消费者购车共识,对购车决策影响越来越大,智能化逐渐从以往的“加分项”演变为“必选项”。据中汽协发布的《2025城市NOA汽车辅助驾驶研究报告》,2025年,L2级及以上智驾功能新车渗透率达66.1%,超三分之二新车实现标配。麦肯锡《2025中国汽车消费者洞察报告》指出,2025年,ADAS(高级驾驶辅助系统)功能已跃升至购车第三大重要因素。 消费者需求推动下,智能化浪潮正重构全球汽车竞争格局,并已成为决定车企在未来能不能胜出的关键指标。 截至2026年二季度,特斯拉辅助驾驶全球付费用户148万,同比增长56%、环比增长16%。北美市场新车辅助驾驶选装率首次突破50%。辅助驾驶的累计行驶里程已突破120亿英里(约合190亿公里)。 特斯拉Robotaxi业务也在不断跑马圈地,目前已覆盖美国佛罗里达州坦帕、奥兰多地区、迈阿密,得州奥斯汀、达拉斯、休斯顿,以及加州旧金山湾区等多个地区。 特斯拉引发大量关注的、取消了传统方向盘与驾驶踏板的赛博无人驾驶电动车Cybercab,已在得州超级工厂投产,并开启工程测试。该款车型专为自动驾驶打造,未来将成为特斯拉无人驾驶网约车车队中的主力车型。 当前,特斯拉战略重心向具身智能转变明显,其人形机器人Optimus V3已成为全球相关产业的风向标,按照规划,7-8月启动正式投产,预计2027年投入外部场景应用。 为了推动人形机器人的发展,特斯拉改“车”为“人”,宣布将弗里蒙特工厂的Model S/X生产线改造为Optimus专用产线,计划2026年底前启动量产,规划年产能为100万台。同时,特斯拉正在得州超级工厂准备机器人的第二条产线,规划产能为1000万台,计划2027年夏季投产。 此外,特斯拉的算力与芯片业务也在加速进化。2026年上半年,特斯拉在得州的本地算力规模(按算力兆瓦计算)提升超过一倍。特斯拉Cortex 2算力集群同时支持电动车自动驾驶和人形机器人自主化软件的开发,并将在今年继续提升规模。下一代AI 5推理处理器芯片设计已完成,该芯片将主要运用于人形机器人及数据中心,马斯克自豪表示其为“目前边缘计算领域最出色的AI推理芯片”。 03. 预期与落差 在注重成长预期的资本市场,特斯拉总能讲出好故事,收获投资者真金白银的支持。 2020年,以特斯拉为首的新能源汽车品牌掀起的电动智能化浪潮席卷全球汽车产业,在这场产业革命里,新能源整车、动力电池、自动驾驶技术研发等相关产业链公司成为资本宠儿,制造了一个又一个暴富神话。 如今,随着新能源汽车渗透率提升、内卷加剧,成长预期收缩,新能源汽车相关概念在资本市场已掀不起太大风浪。特斯拉开始讲述物理AI的新故事,并借此在资本市场重新估值。 6月,摩根大通在看空特斯拉多年后,将其评级从“减持”上调至“中性”,目标价从此前的145美元大幅上调至475美元。摩根大通报告指出,投资者正将目光投向特斯拉放缓的核心电动车业务之外,聚焦于机器人出租车、人形机器人、AI芯片及软件服务等未来增长引擎,这些业务有望在未来十年重塑公司盈利结构。 被视为‌物理AI‌最具代表性的终极载体的人形机器人,可以说是特斯拉的新故事中,最受关注的存在。特斯拉的股价在4月明确Optimus V3亮相、量产时间后,结束了2026年以来的持续下跌,重新走强。 特斯拉人形机器人的影响力,与几年前其电动车的影响力一样,是全球性的。与特斯拉一洋之隔的中国‌A股掀起人形机器人概念炒作热潮,而特斯拉人形机器人的量产进度,俨然是影响相关股票走势的风向标。 在A股市场,存在多家特斯拉人形机器人供应链公司。比如,拓普集团,为特斯拉汽车提供轻量化底盘、热管理系统等零部件的同时,也是特斯拉人形机器人Optimus电驱执行器等核心部件的供应商。在市场追捧人形机器人概念时,这些特斯拉供应链公司迎来了几轮上涨行情。 然而,本轮科技股行情走牛,与前几年依靠估值扩张或纯题材炒作最大的不同,就是相关头部公司基本都有实打实的利润增长支撑,具备确定性。但中国相关人形机器人公司的商业落地成绩被市场认为不及预期,而特斯拉人形机器人Optimus V3的量产迟迟未落地,成为相关概念的最大利空。 马斯克的发言更是给市场期待泼上了一盆冷水,其直言不讳地表示,“人形机器人量产是特斯拉史上最难的制造爬坡,人形机器人几乎所有部件全新、无现成供应链,大量环节只能在公司内部完成。”“对于电动汽车,特斯拉可以向现有供应商采购车轮、侧后视镜和挡风玻璃等特定零部件;但对于Optimus,没有供应链。” 更为关键的是,特斯拉的新业务正在扼杀其业绩确定性。2026年第二季度,特斯拉运营开支同比增长47%至43.53亿美元,自由现金流为-10.92亿美元,资本开支暴增142%至57.89亿美元,全部投向AI基础设施、Robotaxi和Optimus机器人。 特斯拉高管表示,预计资本支出将在未来两三年继续增长,今年资本支出将超过250亿美元。 这些向未来的下注,展现特斯拉对AI赛道的坚定态度,一定程度上确立了市场对其未来发展的信心,但当这些投入开始拖累当下的业绩表现时,也同样会影响投资者对特斯拉的态度。 在财报发布后,特斯拉股价在7月23日出现暴跌,当日跌幅高达‌14.52%,股价从开盘的341美元/股降至‌319.69美元/股,市值单日蒸发约‌2145亿美元‌(约合1.45万亿元),创下该公司历史上最大的单日市值损失纪录。此后,特斯拉股价连续几日下跌,截止7月30日收盘,其股价一度跌至297.38美元/股。 特斯拉的新科技故事讲得宏大且吸引人,这点从资本市场对其的追捧可见一斑,但在特斯拉新业务未能创造出优秀业绩和确定性增长逻辑的当下,市场对其的看空情绪依然难以避免。
特斯拉感谢1000万车主:忍受嘲笑 把少数人的冒险开成千万人的日常
快科技8月1日消息,特斯拉官方发布长图回顾二十年发展,庆祝7月29日弗里蒙特工厂第1000万辆整车下线。 这也是汽车工业史上,第一次有品牌造出一千万台纯电动汽车。品牌专门发文,向全球一千万车主表达感谢。 二十年前,电动车只是个到处被人嘲讽的想法。2006年首款Roadster原型车亮相,台下不少人觉得电动车就是高尔夫玩具车。 2008年金融危机袭来,公司资金链濒临断裂,全靠最后一轮融资才勉强撑过圣诞,当时主流车企全都放弃了电动赛道,只有特斯拉坚持走下去。 2010年特斯拉接手废弃旧工厂,成功上市,2012年首批Model S交付,这款车拿下行业年度大奖,也是首次有电动车获此荣誉,让大众第一次认可电动车的产品力。 真正的难关来自Model 3量产阶段。四十万用户提前交定金,但产线持续卡顿,每周达不到五千台产能公司就会资金耗尽。 马斯克直接住进工厂,团队甚至在停车场搭起帐篷产线,人工替换过度自动化设备,才终于达成周产五千台,特斯拉才算真正站稳车企身份。 2019年上海超级工厂动工,不到一年就交付国产Model 3,大幅加快全球交付速度。2023年Model Y成为全球年度销量冠军,之后产能持续爆发,首个百万辆特斯拉花了12年,最近一百万台车只用短短数月。 一千万台是什么概念?全部车辆首尾相连能绕地球赤道一圈,摆满需要一万两千个足球场,如今全球平均每18秒就有一台特斯拉下线。这一千万台车没有一台烧油,彻底印证电动化路线可行。 特斯拉感谢道,最早一批车主在所有人不看好的时候选择相信,把一场小众冒险,变成千万人的日常。第一个一千万辆是对过往质疑的回答,下一个千万辆则是全新约定。 品牌使命也完成升级,不再只聚焦能源转型,目标变成建设富足非凡的世界。 未来Robotaxi、Cybercab、人形机器人都会落地,当年生产Model S的老产线,如今已经用来制造特斯拉机器人,电动化之后,智能出行、家用机器人会成为新主线。

版权所有 (C) 广州智会云科技发展有限公司 粤ICP备20006386号

免责声明:本网站部分内容由用户自行上传,如权利人发现存在误传其作品情形,请及时与本站联系。