<?xml version="1.0" encoding="UTF-8"?><rss xmlns:atom="http://www.w3.org/2005/Atom" xmlns:itunes="http://www.itunes.com/dtds/podcast-1.0.dtd" version="2.0"><channel><title>华尔街见闻 - 资讯 - 最新</title><link>https://wallstreetcn.com/news/global</link><atom:link href="http://feed.wallstreetcn.com/wallstreetcn/news/global" rel="self" type="application/rss+xml"></atom:link><description>华尔街见闻 - 资讯 - 最新 </description><generator>华尔街见闻</generator><webMaster>contact@wallstreetcn.com</webMaster><itunes:author>华尔街见闻</itunes:author><itunes:explicit>false</itunes:explicit><language>zh-cn</language><image><url>https://static.wscn.net/logo.png</url><title>华尔街见闻 - 资讯 - 最新</title><link>https://wallstreetcn.com/news/global</link></image><lastBuildDate>Fri, 25 Sep 2026 14:45:32 GMT</lastBuildDate><ttl>5</ttl><item><title>报道：特斯拉Optimus机器人产能已提升10倍，目标年底周产千台</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;特斯拉人形机器人Optimus的量产推进远比外界预期复杂。尽管近几个月产量已大幅提升，但生产线上的技术难题、供应链约束以及AI能力不足，正在制约这款被马斯克视为公司&quot;最重要产品&quot;的机器人走向商业化。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;据知情人士透露，&lt;strong&gt;特斯拉上月Optimus周产量已达数百台，较今年二季度小批量测试阶段的每周数十台增长约十倍。管理层已向员工传达目标：年底前建立一条连续自动化生产线，实现每周逾千台的产能。&lt;/strong&gt;然而，这一目标距离公司最终规划的每周约两万台仍相去甚远。与此同时，目前从加州弗里蒙特工厂下线的Optimus V3并非计划向客户销售的最终版本，商业化版本须满足更严格的耐用性与可靠性标准。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;上述挑战对投资者评估特斯拉向AI公司转型的进程具有直接影响。&lt;strong&gt;马斯克曾多次调整Optimus的量产时间表，今年4月承诺年中展示新版本，但该节点已过去而未见发布&lt;/strong&gt;。他在7月财报电话会议上坦承，Optimus将是特斯拉有史以来最难规模化的产品。&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;生产线问题集中于手部组装与自动化设备&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;Optimus量产面临的核心挑战之一，在于机器人手部的制造工艺。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;据知情人士透露，&lt;strong&gt;Optimus的手部与前臂共包含逾100颗螺丝及其他小型零部件，目前仍需工人手动组装。手部触觉传感器的可靠性也存在问题。为此，特斯拉开发了一款包含触觉传感器的&quot;感应手套&quot;，可在不更换整只手的情况下单独替换，计划于明年将该系统纳入量产版本。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;在生产线层面，负责组装手部、关节及安装软件、测试电子元件的多个工位，均存在夹具无法每次精准定位零件的问题。Optimus零部件远比汽车零件细小，装配精度要求更高，导致下线后需返工的机器人数量增加。部分新开发的工装与自动化设备在生产线高速运转时也无法稳定运行。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;今年5月初，特斯拉关闭了弗里蒙特工厂的Model S和Model X生产线，将部分工人和工程师调往Optimus测试线，并从Model Y生产线抽调数十名工程师协助推进。&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;供应链高度依赖中国，质量一致性存隐患&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;在供应链层面，特斯拉面临的挑战同样不容忽视。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;马斯克曾在财报电话会议上指出，Optimus的供应链几乎需要从零构建，商业化人形机器人行业尚未形成成熟的供应商网络。目前，特斯拉在自研核心技术的同时，依赖外部供应商提供电机及驱动关节运动的精密齿轮等关键零部件，而上述零部件的生产大量集中在中国。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;据知情人士透露，特斯拉正在测试和认证新供应商，同时向部分供应商施压，要求其在中国以外建厂，并以更大订单作为激励。然而，部分供应商虽能在原型或小批量阶段保证质量，但在产量提升后难以维持一致性。&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;AI能力不足，机器人仍依赖特定任务训练&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;除硬件制造外，Optimus的AI系统同样尚未达到商业化所需的水平。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;据三位知情人士透露，Optimus目前仍高度依赖针对特定任务的训练与编程，一旦遭遇未经训练的任务或场景，其表现难以预测。特斯拉正尝试为机器人建立一套基础动作库，通过组合基础动作来应对不同任务，而非针对每项工作从头训练，但机器人学习基础任务仍需数天时间。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;在数据积累方面，特斯拉目前已拥有逾50万小时的训练数据，并计划在年底前将这一数字翻倍。为此，公司今年夏季开始在科罗拉多州、亚利桑那州和佛罗里达州等地建立训练中心，由数十名数据采集人员佩戴配备摄像头的头盔和背负电脑的背包，采集第一人称视觉数据。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;特斯拉的长期目标是构建一套类似其驾驶辅助软件的反馈闭环——部署在真实环境中的机器人持续生成数据，用于改进AI系统，再将更新推送至整个机器人群体。&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;商业化路径：租赁优先，目标客户锁定类特斯拉工厂&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;在商业化策略上，特斯拉计划初期以租赁而非销售的方式向外部商业客户提供Optimus，以便在租约到期后回收、升级或翻新机器人，同时利用客户工厂和仓库中采集的数据持续优化AI系统。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;特斯拉已拟定一份潜在客户短名单，目标通常是拥有与特斯拉设施类似的工厂或仓库布局的企业，以降低机器人适应新环境的难度。马斯克此前表示，Optimus最终面向公众销售的目标价格区间为2万至3万美元。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;目前，大多数下线机器人被用于内部测试、训练和数据采集，包括在特斯拉帕洛阿尔托办公室及工厂内受严格管控的区域运行。在这些场景中，机器人被编程执行特定任务，而非作为通用或远程控制设备运作。特斯拉表示，将随着机器人性能的持续改善，逐步扩大其作业范围。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782550</link><guid isPermaLink="false">3782550</guid><pubDate>Fri, 25 Sep 2026 13:47:03 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/c9acb6fd-7d4e-4eb1-bb17-20a9ae637082.jpeg"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/381b1c64-abe6-4704-8de1-7eeaa8fee99f.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:05:07</itunes:duration></item><item><title>马斯克放话：Colossus 2部署的英伟达芯片年底或增加一倍</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;马斯克旗下人工智能公司xAI正在加速扩充AI算力。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;当地时间9月25日，马斯克在社交平台X上表示，其AI计算集群Colossus 2目前已部署&lt;strong&gt;11万颗英伟达GB200和44万颗GB300，共计55万颗芯片&lt;/strong&gt;，年底前芯片数量可能超过目前水平的两倍。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;马斯克透露，Colossus 2还将迎来密集扩容：&lt;strong&gt;22万颗GB300预计下周正式投入运行，另外22万颗将于11月上线；如果进展顺利，12月底前还可能再上线22万颗GB300。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;按照这一扩容计划，Colossus 2到年底最多可能新增66万颗GB300，芯片总数将达到&lt;strong&gt;121万颗左右&lt;/strong&gt;，较目前的55万颗增加约120%。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;这也意味着，Colossus 2将在未来几个月迎来大规模算力扩张，新增芯片几乎全部来自英伟达GB300。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;马斯克同时披露，Colossus 1目前拥有&lt;strong&gt;15万颗H100、5万颗H200和3万颗GB200&lt;/strong&gt;。此前，xAI曾表示，计划到2026年让其位于美国孟菲斯的数据中心配备&lt;strong&gt;100万颗GPU&lt;/strong&gt;。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;此次马斯克进一步公布Colossus 2的扩容时间表，显示xAI仍在快速扩大AI基础设施规模。随着GB300芯片持续上线，xAI的数据中心算力将在今年年底前进一步提升，以支撑其AI模型训练和推理需求。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782549</link><guid isPermaLink="false">3782549</guid><pubDate>Fri, 25 Sep 2026 12:44:03 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/956b7ddb-dbaa-4846-976c-ed816429fb9a.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/889e110b-74cd-4c58-b277-2d7ab5addf16.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:01:29</itunes:duration></item><item><title>美国8月耐用品订单环比初值 0%，预期 -0.3%，前值 1.1%</title><description>&lt;p&gt;美国8月耐用品订单环比初值 0%，预期 -0.3%，前值 1.1%。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782548</link><guid isPermaLink="false">3782548</guid><pubDate>Fri, 25 Sep 2026 12:30:18 GMT</pubDate></item><item><title>俄发言人称俄美乌三方会晤或近期举行，泽连斯基给出“10天”时间表</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;已持续四年半的俄乌冲突迎来新进展。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;据央视新闻，俄罗斯总统新闻秘书佩斯科夫9月25日表示，&lt;strong&gt;俄罗斯、美国、乌克兰三方会晤可能在近期举行，但目前没有具体细节。&lt;/strong&gt;佩斯科夫在评论美方提议在阿联酋组织三方技术级会晤时作出上述表态。佩斯科夫称，这一讨论发生在近期普京与特朗普的通话期间。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;佩斯科夫还确认了俄总统特别代表德米特里耶夫访美的事宜。德米特里耶夫继续就经济领域的潜在互动，与美方谈判代表威特科夫和库什纳接触。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;乌克兰总统泽连斯基周五公开证实这一消息，&lt;strong&gt;并给出了“10天”这一具体时间表。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;泽连斯基在通过WhatsApp举行的记者会上表示，“美方已提议……以三方形式举行技术级会议”。他补充说，乌方正在等待美方就日期提出方案，而美方已建议阿联酋作为可能的地点。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;泽连斯基透露，本周与特朗普会晤后，乌克兰谈判代表已与美方同行就“具体细节”进行了讨论。&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;10天关键窗口&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;泽连斯基将此次拟议会谈定义为“技术级”的“三方形式”。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;他未进一步说明技术级会议的具体议题范围，&lt;strong&gt;仅表示美方“已建议阿联酋作为可能地点”，乌方“正在等待美方就日期提出方案”。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;本周稍早前，据环球网援引路透社等媒体报道，泽连斯基在于纽约举行的联大会议期间同美国总统特朗普进行约40分钟的会晤，双方探讨了乌俄能源领域停火以及如何结束冲突等议题。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;会谈后，乌克兰谈判代表与美方同行随即就具体细节展开对接。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;泽连斯基给出了明确的推进节奏：&lt;strong&gt;乌克兰方面将与欧洲方面沟通并讨论这些细节，美方将与俄方沟通，“我们将在10天内带着新的视角或结果回来”。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;乌克兰多地遭袭 泽连斯基呼吁美欧落实对俄制裁&lt;/h2&gt;
&lt;p&gt;外交接触出现新进展，但战场上的军事行动仍在持续。&lt;/p&gt;
&lt;p&gt;据报道，俄罗斯新沙赫丁斯克炼油厂（Novoshakhtinsk）在遭受无人机袭击后暂停运营。泽连斯基称，乌克兰在夜间打击了俄罗斯两座炼油厂。&lt;/p&gt;
&lt;p&gt;新华社援引乌克兰媒体25日报道，乌多地遭俄军空袭，造成人员伤亡。&lt;/p&gt;
&lt;p&gt;乌克兰首都基辅市市长克利奇科25日在社交媒体发文说，截至当天上午10时28分，俄军对基辅市发动的空袭已造成1人死亡，9人受伤，其中佩切尔斯基区遭袭击最严重，有7人受伤。&lt;/p&gt;
&lt;p&gt;泽连斯基当天在社交媒体发文称，除基辅外，截至当天上午，乌克兰有8个州遭到空袭。袭击导致敖德萨市1人死亡，苏梅州和尼古拉耶夫州也有人员受伤。&lt;/p&gt;
&lt;p&gt;泽连斯基称，&lt;strong&gt;随着冬季来临，若不施压，俄军的空袭只会不断升级。他呼吁美欧落实对俄制裁措施。&lt;/strong&gt;&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782547</link><guid isPermaLink="false">3782547</guid><pubDate>Fri, 25 Sep 2026 12:24:48 GMT</pubDate></item><item><title>还没破百万日活，Meta Muse就频频掉链子：服务降级、Agent失败，算力瓶颈浮出水面</title><description>&lt;p&gt;Meta旗下个人AI智能体Muse用户增长迅猛，但服务端压力已经提前显现。过去11天内，Muse日活用户增长约10倍至70万，但服务降级、Agent任务失败等问题也开始出现，算力瓶颈逐渐浮出水面。&lt;/p&gt;
&lt;p&gt;Muse近期已出现多项服务异常，&lt;strong&gt;包括资源消耗远超内部测试预期、部分功能出现降级，以及Agent在执行复杂任务时频繁失败。&lt;/strong&gt;一次压力测试中，Muse尝试同时创建120个子Agent，最终仅成功33个，显示其实际运行负载已经给服务稳定性带来压力。&lt;/p&gt;
&lt;p&gt;据网络分析机构Similarweb数据，Muse目前日活用户约70万。值得注意的是，这一增长尚未覆盖全部潜在用户：Muse目前仅面向美国和加拿大开放，WhatsApp和Instagram也尚未全面开放注册入口。若后续进一步扩大开放范围，服务端承受的计算负载还将继续上升。&lt;/p&gt;
&lt;p&gt;Muse的核心问题在于其高计算资源占用的运行架构。Meta为每名用户配置独立云端虚拟机，&lt;strong&gt;随着用户规模扩大，CPU、内存和存储需求将同步增长，这也使基础设施扩容成为Muse规模化必须面对的问题。&lt;/strong&gt;&lt;/p&gt;
&lt;h2&gt;尚未突破百万日活，Muse已频现服务异常&lt;/h2&gt;
&lt;p&gt;Muse的服务压力已经出现多个具体迹象。9月9日，Meta首席AI官Alexander Wang透露，Muse早期实际使用量“远超预期”，用户消耗量约为内部测试群体的10倍，Meta随后调整token使用策略并提高额度。&lt;/p&gt;
&lt;p&gt;与此同时，&lt;strong&gt;第三方状态监测平台SaaSHub目前将Muse标记为“Degraded”，即服务仍可访问，但部分用户持续报告问题，其中“无法搜索”是最常见的反馈。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Agent执行能力也受到并发负载考验。一名AI研究人员近期进行压力测试，要求Muse同时创建120个子Agent，最终仅成功33个，另外87次创建失败。&lt;strong&gt;测试显示，在高并发任务下，Muse的Agent编排能力存在一定限制。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这些现象并不能直接证明问题均由算力不足导致，但反映出Muse实际运行负载已明显高于早期测试预期。&lt;/p&gt;
&lt;h2&gt;独立虚拟机架构推高算力需求&lt;/h2&gt;
&lt;p&gt;Muse的算力压力，很大程度上来自其底层架构。为降低隐私和安全风险，Meta为每名用户分配独立隔离的云端虚拟机，配置包括2个虚拟CPU、8GB内存和100GB固态硬盘，并配备专属浏览器，用于存储用户数据和凭证。&lt;/p&gt;
&lt;p&gt;按上述配置，在不进行负载共享的理想情况下，若用户达到1亿，Meta需要约2亿个CPU核心，相当于约158万颗采用126核配置的AMD EPYC处理器，同时还需要800PB内存和1万PB固态存储。&lt;/p&gt;
&lt;p&gt;Muse还配备名为“Sentinel”的安全机制，持续监控智能体运行环境。&lt;strong&gt;智能体完成交易前，需要同时获得Sentinel批准和用户明确确认，这套多层安全机制也增加了系统运行的计算开销。&lt;/strong&gt;&lt;/p&gt;
&lt;h2&gt;用户扩张与商业化同步推进&lt;/h2&gt;
&lt;p&gt;Muse定位为能够执行多步骤任务的个人AI智能体，可以代替用户操作云端浏览器、浏览网页并完成相关事务，即使用户关闭应用，也能继续在后台运行。&lt;/p&gt;
&lt;p&gt;Meta正进一步扩大Muse的交互入口。除Meta智能眼镜外，公司还在开发名为Muse Charm的钥匙链形态独立设备，预计今年12月发货。WhatsApp和Instagram目前尚未开放Muse注册，未来仍有进一步扩大用户覆盖面的空间。&lt;/p&gt;
&lt;p&gt;商业化也已开始铺开。&lt;strong&gt;扎克伯格本周表示，Meta将从Muse促成的交易中收取少量佣金。&lt;/strong&gt;目前，Muse每周向用户提供最多1亿个免费token，重度用户的付费订阅起价约为每月20美元。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;随着Muse从当前规模继续向更大用户群扩张，Meta需要解决的不只是新增用户带来的需求，还包括如何维持Agent执行能力和服务稳定性。&lt;/strong&gt;独立虚拟机架构意味着CPU、内存和存储需求将随用户规模同步扩大，这也将对Meta的数据中心投入和基础设施采购提出更高要求。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782546</link><guid isPermaLink="false">3782546</guid><pubDate>Fri, 25 Sep 2026 12:00:20 GMT</pubDate></item><item><title>扎克伯格谈Muse：个人Agent必须从预训练开始设计，虚拟机、记忆和权限系统是巨头的全栈护城河</title><description>&lt;p data-pm-slice=&quot;1 1 []&quot;&gt;Muse上线后，Meta久违地拥有了一款迅速出圈的AI产品。不到两周，它登上美国应用下载榜首。据Sensor Tower统计，截至9月22日，累计下载量已超过250万次。&lt;/p&gt;
&lt;p data-pm-slice=&quot;1 1 []&quot;&gt;为了让Agent真正替人行动，Meta给它配置了云端虚拟机。为了让用户敢把邮件、账户和私人信息交给它，又必须设计记忆、凭据存储和逐项授权的权限系统。扎克伯格认为，这些能力不能靠给现成模型增加一个产品界面完成；模型从预训练开始，就要学会理解个人目标，判断哪些信息可以使用、哪些不能向外披露。&lt;/p&gt;
&lt;p&gt;这也是Muse背后更深的一场竞争。Meta首席执行官扎克伯格在与科技记者Alex Heath的对话中，谈到了这套产品设计，也谈及Llama 4失利后Meta如何重建模型研发，以及他为什么主张让更多人拥有强大的AI。访谈的主要观点包括：&lt;/p&gt;
&lt;p data-pm-slice=&quot;1 1 []&quot;&gt;&lt;strong&gt;1. 个人Agent要从预训练开始设计。&lt;/strong&gt;扎克伯格认为，理解用户的长期目标，以及判断私人信息的使用边界，不能只靠通用模型的后训练来解决。&lt;/p&gt;
&lt;p data-pm-slice=&quot;1 1 []&quot;&gt;&lt;strong&gt;2. 虚拟机让Agent具备持续行动的能力。&lt;/strong&gt;Muse可以在后台操作计算机、登录服务，并围绕用户的目标推进任务。&lt;/p&gt;
&lt;p data-pm-slice=&quot;1 1 []&quot;&gt;&lt;strong&gt;3. 记忆让Agent从单次工具变成长期服务。&lt;/strong&gt;它会根据已完成的任务和用户反馈调整后续行动，也可以主动提出新的项目。&lt;/p&gt;
&lt;p data-pm-slice=&quot;1 1 []&quot;&gt;&lt;strong&gt;4. 权限决定用户敢把多少事交给AI。&lt;/strong&gt;登录、付款、发送邮件和披露敏感信息需要明确授权；Agent只能获得完成当前任务所需的权限。&lt;/p&gt;
&lt;p data-pm-slice=&quot;1 1 []&quot;&gt;&lt;strong&gt;5. 隐私保护要写进系统架构。&lt;/strong&gt;Meta计划通过机密虚拟机和独立的凭据存储，减少公司及核心Agent接触用户敏感信息的机会。&lt;/p&gt;
&lt;p data-pm-slice=&quot;1 1 []&quot;&gt;&lt;strong&gt;6. 免费额度是扩大用户规模的起点。&lt;/strong&gt;扎克伯格希望Muse通过帮用户省钱、赚钱和经营业务，逐步证明个人Agent的经济价值。&lt;/p&gt;
&lt;p data-pm-slice=&quot;1 1 []&quot;&gt;&lt;strong&gt;7. Meta正用新的方式追赶前沿模型。&lt;/strong&gt;在Llama 4偏离预期后，扎克伯格转向更精简的核心研究团队，并继续增加算力投入。&lt;/p&gt;
&lt;p data-pm-slice=&quot;1 1 []&quot;&gt;&lt;strong&gt;8. 技术扩散也是扎克伯格的安全主张。&lt;/strong&gt;他认为，强大AI若只由少数机构掌握，同样会带来风险；让更多人获得能力，才能形成制衡。&lt;/p&gt;
&lt;h2&gt;&lt;strong&gt;AI的安全不能只靠限制访问，关键是让更多人拥有制衡能力&lt;/strong&gt;&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Alex Heath：&lt;/strong&gt;我们上次通话是在一个周末，你当时还通过智能眼镜给我打电话。那次你想谈刚发表的一篇长文，其中提出了很多关于AI未来的主张。为什么要写这样一篇近似宣言的文章？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;如果一家机构要在AI上投入这么多，就有责任说明自己的研究团队相信什么，以及这些工作为什么能够导向一个积极的未来。&lt;strong&gt;AI既带来巨大机会，也存在真实风险，所有参与者都应该形成一套经过认真思考的理论。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;我强烈反对一些在行业内被视为理所当然的观点。在我看来，&lt;strong&gt;更积极的未来来自尽可能广泛地分发技术。&lt;/strong&gt;这一判断建立在三点之上：第一，赋予个人更多能力，一直是人类繁荣的重要来源；第二，AI的首要用途将是创造新事物，而不是将现有工作自动化；第三，未来安全的基础应是适当的权力制衡，而不是限制使用权。&lt;/p&gt;
&lt;p&gt;很多人的直觉是，技术越强，就越应该只让少数人接触。我更担心的是，只有少数研究机构或个人控制如此强大的能力。&lt;strong&gt;历史上，很多重要进步并非来自既有权力中心，而是来自边缘位置、最初不被认真对待的人。当他们获得足够好的工具，可以证明自己的想法时，才有机会推动真正的变化。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;网络安全也是如此。如果有人拥有能够攻击系统的AI，最有效的应对方式之一，是让更多机构也拥有AI，以便提前加固自己的系统。开源软件之所以常常更安全，正是因为更多人能够查看、检验和修正它。把技术交到更多人手里，看似会增加风险，却也可能形成更稳定的制衡。&lt;/p&gt;
&lt;p&gt;Meta会开发领先模型，也会发布一部分开放模型，但这不意味着所有成果都必须开源。营利性公司可以保留一部分先进技术。关键是维持强健的开源生态，让市场保持竞争，也让外界能够理解技术的发展方向。以Hugging Face遭遇入侵的事件为例，他们发现入侵后转而使用开源模型，因为他们无法获得某些与这次问题有关的闭源模型。这说明世界上需要保护的重要机构远不止排名最靠前的一百家。&lt;/p&gt;
&lt;p&gt;不过，比开源本身更重要的，是让普通人真正用上技术。Muse体现的就是这一思路：给每个人一个能力很强的个人AI Agent，让它理解用户的目标，并且每天24小时持续代表用户工作。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Alex Heath：&lt;/strong&gt;AI和数据中心正在受到越来越强烈的抵触。你的意思是不是，如果更多人能够得到目前集中在少数研究机构手中的能力，他们就不会再觉得自己被排除在AI进程之外？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;问题不能只停留在抽象层面。人们担心就业和经济，也担心数据中心对社区与环境的影响；还有网络攻击、生物安全、自由社会、美国的技术领导力，以及当AI越来越强时，人类如何继续控制它。每一类问题都有不同细节，但它们有一个共同点：技术带来的繁荣必须广泛分布，能力也不能只掌握在少数内部参与者手中。&lt;/p&gt;
&lt;p&gt;Meta进入一个地区建设数据中心，实际上是在承诺未来几十年持续投资。这样的长期投入可以为社区带来税收、就业和其他资源。比如在路易斯安那州，相关税收曾为当地教师提供每人5万美元的奖金。市场上也有另一类项目：有些公司只想先拿下一块地，再卖给大型AI研究机构。&lt;/p&gt;
&lt;p&gt;它们并不打算长期运营，也没有动力认真处理与当地社区的关系。我不确定是否该把这种现象称为泡沫，因为“泡沫”意味着估值过高。但这个领域确实正在经历一轮热潮，也因此容易滋生短期逐利的行为。如果项目只顾眼前交易，社区反对并不奇怪。&lt;strong&gt;AI基础设施如果不能创造就业、扩大社会整体繁荣，也不能让当地社区受益，就不可能无限扩张。因此，让利益广泛分布不是附加条件，而是行业能够持续发展的前提。技术要可行，社会层面也必须可行。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Meta推出了America&#39;s Workforce Academy，原因很实际：建设数据中心需要大量光纤技术人员、电工、高级木工等技术工人，而市场上远远不够。未来可能还需要数十万甚至数百万人。我们保证，完成培训的人能够在参与Meta基础设施建设的单位找到工作。这不是单纯的慈善，而是长期利益一致：Meta需要熟练工人，参与者需要新的职业机会。若企业只是建设一个项目后转手，就不会进行这种投入。&lt;/p&gt;
&lt;h2&gt;&lt;strong&gt;Muse不只回答问题，还要围绕用户的长期目标持续执行任务&lt;/strong&gt;&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Alex Heath：&lt;/strong&gt;你大约一年前开始谈「个人超级智能」。当时很多人想知道，你究竟看到了什么。现在看来，答案就是Muse。为什么你认为它会成为Meta的下一阶段？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;我们从未只把Meta看成一家社交媒体公司。公司的长期主题是连接人与赋予个人能力。过去围绕内容管理发生的很多争论，实质上也在讨论：人们能不能自己决定什么对生活重要，并按照自己的判断交流。&lt;/p&gt;
&lt;p&gt;这段经历强化了我的一个认识：&lt;strong&gt;历史上的许多进步，都来自个人获得更多能力，而且人们最清楚自己的生活需要什么。&lt;/strong&gt;因此，每当有人说应该由少数专家决定AI去解决哪些大问题，我都会本能地保持警惕。人们当然关心健康和生活质量，但也关心家人、朋友、关系和文化。对科学家或工程师而言不够宏大的问题，对某个人可能极其重要。&lt;/p&gt;
&lt;p&gt;即使在健康领域，个人关注的重点也可能与行业不同。制药和生物技术行业目前主要关注常见疾病，但还有大量不同的罕见疾病和健康问题，相关投入明显不足。如果你患有某种罕见病，自然会希望自己的AI关注它，而不是仅仅因为另一种病更常见，就把资源用在别处。&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Alex Heath：&lt;/strong&gt;你也通过自己的基金会在这方面投入了很多。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;我们正在通过Biohub开展这方面的工作，这些经历也在一定程度上影响了我的看法。我认为，人们应该有能力自己决定什么最重要。对我来说，Muse也不只处理宏大任务。我希望它帮助我成为更好的父亲、丈夫和朋友。我的三岁女儿喜欢烘焙，但我对此一无所知。&lt;/p&gt;
&lt;p&gt;我让Muse每个周末准备一个适合三岁孩子、也适合不会烘焙的成年人完成的项目，并通过Instacart备齐原料。做完后，我再告诉它哪些步骤太难，它会据此调整下一次安排。事实证明，蛋糕棒并不适合作为入门项目。我的大女儿喜欢登山，有些路线需要抢许可证。Muse会等待开放时间并替我申请，拿到后告诉我具体日期，我再安排休假陪她去。&lt;/p&gt;
&lt;p&gt;它也会关注我的训练。我在综合格斗训练室安装了摄像头，让Muse分析视频并提出意见，有时它会很直白地指出我在哪个动作中明显放弃了。早期测试者的使用方式差异很大。有人拿到Muse后，不到一天就开始用它协助安排孩子的居家教育；有人在12小时内用它规划完整旅行；还有一位原本对科技很怀疑的测试者，几天后最关心的问题却是正式发布时能不能保留已经了解她的Muse。&lt;/p&gt;
&lt;p&gt;Muse与Meta AI、ChatGPT或Gemini式的一问一答不同。用户交给它的不是单个提示词，而是一个项目或长期目标。后台的虚拟机让它能够操作计算机、登录服务并持续执行任务；它会围绕这些目标全天候持续工作，直到帮助用户实现目标。夜间，它还会整理当天的反思并写入记忆，也能够主动建议新的项目。&lt;/p&gt;
&lt;p&gt;例如，我让它为我和女儿玩的《文明》制作攻略。完成后，它又建议把攻略扩展成讲解不同文明历史的学习材料，并直接在应用里增加了一个页面。许多人不知道应该怎样使用AI；如果AI Agent能够主动提出对用户有帮助的事情，就能降低这道门槛。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Alex Heath：&lt;/strong&gt;你认为它真的能替用户赚钱？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;能。用户可以选择付费订阅，但Meta一开始也会提供每周1亿token和一台虚拟机的免费额度。我们的判断是，当个人用它经营小企业、完成商业任务或参与交易时，它创造和节省的价值足以覆盖成本。&lt;/p&gt;
&lt;p&gt;长期来看，我们预计可以从相关交易中收取很小比例的费用，而且不一定由用户支付，也可以由与用户开展交易的商家承担。我们希望绝大多数人都能免费使用这项服务。要让每个人都拥有强大的个人AI Agent，首先就得让他们用得起。因此，我们愿意先提供大量免费用量，因为我们相信，它能帮用户赚钱、帮用户省钱，从而抵消使用它的成本。&lt;/p&gt;
&lt;p&gt;我们正在与Stripe合作，为Muse接入支付功能。你可以选择把Muse连接到需要的服务，包括Meta的服务，但不愿意连接也完全可以。如果用它经营业务，你可以授权它接入我们的广告系统，让它协助制作产品、运营业务，并把这些工作串联起来，全天候持续执行。Meta目前大约每月发布一次重要模型更新，因此Muse的能力也会随之提高。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Alex Heath：&lt;/strong&gt;团队还提到，不同用户的Muse可以从其他Agent积累的匿名化经验中学习。这种学习机制带来的网络效应，会不会成为Meta的核心优势？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;行业目前大多把AI Agent当成单人产品，但多个Agent之间还会出现很多新的协作方式。这类能力大多不会随当前版本推出，但从长远看，随着你认识的人越来越多地使用Muse，它就能通过Agent之间的互动，为你提供更好的体验。Meta还有几项不同优势。我们从底层设计模型，让它适合个人AI Agent；我们也有很强的社交产品经验，会更重视它如何帮助人改善关系。&lt;/p&gt;
&lt;p&gt;网络效应固然重要，但市场不会只有一种需求。帮助用户经营小企业的最佳Agent，未必也是处理人际关系最好的Agent。具备足够技术实力、能在个人AI Agent领域做到最先进水平的公司，可能不会超过十二家。不过，不同公司仍然可以在不同用途上做到最好。Meta擅长把经过验证的消费产品推广给数亿乃至数十亿用户。&lt;strong&gt;Muse和Meta AI目前侧重点不同：Muse更倾向于从一句话中理解用户的长期意图，并继续推进任务；Meta AI更适合立即回答一个明确问题。两者未来是否会合并，现在还不能确定。&lt;/strong&gt;&lt;/p&gt;
&lt;h2&gt;&lt;strong&gt;为了让用户放心接入私人信息，Meta如何设计Muse的隐私与权限保护&lt;/strong&gt;&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;个人AI Agent要真正有用，不只需要前沿能力，还必须充分理解用户。人们可能会把邮件、消息、广告账户、健康信息和其他私人资料接入Muse；只有对系统有很高信任，用户才会这样做。&lt;/p&gt;
&lt;p&gt;Meta过去十多年建设WhatsApp端到端加密系统，最重要的经验是：系统可以被设计成连Meta也无法读取用户消息。这既降低政府或黑客获取内容的风险，也防止Meta内部人员滥用信息。我们邀请Signal创始人Moxie Marlinspike加入团队。他在2014年曾协助建设WhatsApp加密，这次专门负责Muse的机密虚拟机。&lt;/p&gt;
&lt;p&gt;我们的目标是让用户把信息保存在云端的个人虚拟机中，并通过技术手段保证，连Meta也无法读取其中的内容，而且这一承诺可以被技术验证。随着这项功能准备向更多用户开放，我们会在未来几周公布更多细节。在它准备就绪之前，以及对于不选择使用它的用户，Muse也会提供其他安全保护措施。&lt;/p&gt;
&lt;p&gt;一种最直接的隐私方案，是让每个人买一台Mac Studio，把Agent放在家里运行。但不可能有数十亿人购买设备、安装软件并自行维护。Muse希望提供一种任何技术水平的家庭成员都能直接使用的服务：它像本地机器一样私密，却可以在云端自动开通和运行。&lt;/p&gt;
&lt;p&gt;机密虚拟机并不是全部。Muse还设有安全凭据存储系统，用来保存信用卡信息、密码和一次性卡号，避免这些敏感信息直接暴露给核心Agent；当用户要求它登录或付款时，Agent只能在必要时调用这些凭据。系统还运行一组监控Agent，检查进入和离开虚拟机的流量。它们会识别提示词注入，判断Muse是否准备把用户可能不愿公开的信息传出去，并在必要时触发人工确认。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;登录、付款和传递敏感信息通常都需要用户批准。&lt;/strong&gt;用户可以把某一类操作设为长期允许，但Muse不能自行扩大权限。连接邮箱时同样遵循“最小权限”原则。如果用户希望它发送邮件，就应针对这项操作明确授权，而不是一接入邮箱就让它获得全部权限。每一步只获得完成当前任务所需的最低权限，而不是一次授权全部能力。&lt;/p&gt;
&lt;p&gt;这些设计也是Meta认为自己能在个人AI Agent市场形成差异的原因。&lt;strong&gt;个人Agent不仅要了解用户，还要具备分寸感。&lt;/strong&gt;例如，它知道你怀孕了，预订餐厅时就可以帮你寻找提供优质无酒精鸡尾酒的地方，但不必向餐厅解释你怀孕了。它需要在不反复询问你的情况下，判断哪些信息属于敏感内容，既帮你实现目标，也避免透露不必要的个人信息。&lt;/p&gt;
&lt;p&gt;在我看来，要做好这类能力，不能只是拿一个现成模型稍作后训练，而要从一开始就围绕个人Agent的需求设计模型，并把相关数据纳入预训练。就像做好Instagram信息流，需要同时建设应用、基础设施、机器学习系统和芯片一样，这是一项需要各个环节共同配合的工作。&lt;/p&gt;
&lt;h2&gt;&lt;strong&gt;Llama 4偏离预期后，Meta用更小的核心团队和更大算力重建AI研究&lt;/strong&gt;&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Alex Heath：&lt;/strong&gt;SemiAnalysis在7月的一篇文章中认为，Meta最有可能追上OpenAI和Anthropic，衡量Meta Superintelligence Labs时应该看进步速度，而不只是当前起点。Artificial Analysis最近的图表也显示Muse Spark进展很快。你去年重建研究团队后，内部究竟发生了什么？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;Meta长期以来就在机器学习领域领先。Facebook和Instagram的信息流、广告系统，以及识别和处理不适宜内容的安全系统，本质上都是大规模机器学习系统。大语言模型兴起后，FAIR完成了Llama的早期研究，但我们还需要把研究转化为工业化流程，并按照规模定律扩大模型。&lt;/p&gt;
&lt;p&gt;我当时犯的错误，是以为Meta既然擅长其他机器学习系统，开发和扩展大语言模型的方法也会相似。实际上，两者的运行规律有很大差别。Llama 3是一个不错的模型，但Llama 4发布时已经偏离我们需要的进步轨迹，这意味着必须改变方法。&lt;/p&gt;
&lt;p&gt;我由此更重视人才密度。前沿模型研究并不是让一千个人各自运行实验就能解决的问题。更理想的状态，是由一支规模尽可能小、成员能够在头脑中把握整个系统的顶尖团队，围绕同一个科研项目紧密协作。&lt;strong&gt;当团队席位有限时，每一个位置都必须尽量找到最好的人。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;因此，我投入了大量个人时间招聘，也让自己在技术上更接近一线工作，以便真正理解问题并指导公司。研究团队就设在我办公室周围。随着研究质量提高，我们也显著增加算力投资，正在建设数吉瓦规模的基础设施。Meta拥有几十年的数据中心经验，也有盈利能力支撑这种长期投入。&lt;/p&gt;
&lt;p&gt;过去一年，Meta重新启动研究计划，位于俄亥俄州的吉瓦级Prometheus集群已经上线，并开始用于扩展“Watermelon”之后的模型。Watermelon也即将发布。它的规模更大，预训练水平也有显著提升，我们还会继续把在后训练中积累的经验应用到它上面。&lt;/p&gt;
&lt;p&gt;此前发布的Muse Spark 1.3，则来自内部代号为Avocado的一次相对较小规模的预训练。Meta不会满足于跟在前沿之后。我们是一家端到端技术公司，即使过去主要建设社交应用，也从未只做应用层，而是同时建设数据中心、芯片和基础设施。&lt;/p&gt;
&lt;p&gt;未来体验中最关键的部分会是模型，因此我们必须自己站在前沿。模型能力不是一个单一榜单。编码等能力具有普遍价值，因为许多个人AI Agent任务最终都要生成软件：Muse分析综合格斗视频的流程是一个编码项目，替用户制作可以投屏的《危险边缘》游戏也是如此。&lt;/p&gt;
&lt;p&gt;但Meta也会重点研究其他机构未必同等重视的能力，例如个人Agent在与外界交互时，如何判断哪些信息可以使用、哪些不能披露。我们也非常重视编码能力和递归改进，因为后者对持续保持前沿水平很重要。因此，我们的研究方向有一部分与其他实验室重合，也有一些不同的侧重点。&lt;/p&gt;
&lt;h2&gt;&lt;strong&gt;从模型安全到智能眼镜和青少年保护，技术扩散必须与明确边界同行&lt;/strong&gt;&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Alex Heath：&lt;/strong&gt;如果未来模型出现你认为不安全的能力，Meta会不会也选择暂缓发布？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;安全首先应当进入设计和训练过程。目前，各家研究机构都在遇到模型钻奖励机制空子的问题，也就是reward hacking：模型得到一道编程任务后，已经聪明到会先理解整个运行环境。有时它发现，修改虚拟机配置比真正解决程序问题更容易，于是通过改变环境获得奖励，却没有学到训练者希望它掌握的能力。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Alex Heath：&lt;/strong&gt;听起来，你们不是这样训练模型的？你不认同这种训练方式吗？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;不是，我认为大家基本都采用这种训练方式。我的意思是，需要在训练过程中设立清楚而坚定的边界。这在一定程度上像教育孩子，但这个类比也不能过度延伸。安全边界如果太弱，模型就会钻空子；边界足够明确，既能让它学习课程本身，也能逐渐形成更合适的行为方式。训练结束后，还要回答强大模型怎样对社会产生积极影响。&lt;/p&gt;
&lt;p&gt;我仍然认为，应该让更多人分享机会，并用广泛分布的权力形成制衡。若只有一个人拥有超级智能律师，他可能赢得本不该赢的诉讼；如果每个人都有同样强的法律工具，低质量论点就更难蒙混过关，司法过程反而可能更高效、更公平。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Alex Heath：&lt;/strong&gt;政府应该扮演什么角色？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;AI变化太快，固定规则很容易滞后。更有效的做法，是让企业与监管方保持足够透明的沟通，让外部了解重要训练任务和即将出现的能力，并提前准备网络安全、生物安全等不同风险。对我来说，关键不是设计一套很快过时的流程，而是建立持续的知识交流和可信对话。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Alex Heath：&lt;/strong&gt;Meta智能眼镜正在进入主流，同时也出现了“它会被拿来偷拍”的担忧。一些场所甚至禁止佩戴。你怎么看？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;我们从第一代产品开始就把隐私要求写进设计：只要摄像头录像，镜框上的指示灯就会明显闪烁；如果用户试图破坏指示灯，系统更新会直接让摄像头失效。手机录像并没有这样的提示灯，从这一点看，眼镜反而更透明。&lt;/p&gt;
&lt;p&gt;问题在于，产品刚发布时Meta解释过这些措施，但当时用户很少。如今已有数百万人使用，许多人没有听过早期说明。我们后来更多强调外观、款式和功能，却没有持续解释隐私设计。社交媒体的发展也给了我一个教训：&lt;strong&gt;仅仅看到人们继续使用产品，并不等于他们理解公司怎样处理风险。如果更早、更直接地说明这些问题，公众今天对社交媒体的看法或许会不同。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Alex Heath：&lt;/strong&gt;这与Meta最近就青少年安全问题达成的和解有没有关联？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mark Zuckerberg：&lt;/strong&gt;Meta很早就在Instagram推进青少年账户保护。和解的重要目标，是为整个行业建立共同标准。比如，把青少年每天使用时间限制在一小时，单家公司原则上可以接受；但如果Instagram单方面限制，而用户随后把同样时间转移到TikTok，就没有真正改善青少年处境，只是让一家公司的竞争位置受损。&lt;/p&gt;
&lt;p&gt;Meta希望推动统一的青少年保护行业标准，例如围绕使用时长、通知、上课和睡眠时间设置限制。这样可以避免单一平台率先自律却让用户转移到其他平台，也能让各家公司在一致框架下共同保护青少年。&lt;/p&gt;
&lt;p&gt;&lt;span style=&quot;color: #808080;&quot;&gt;本文来源：&lt;a href=&quot;https://mp.weixin.qq.com/s/0tV6WXO7S_ekdmwBLvJACQ&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;Z Finance&lt;/a&gt;&lt;/span&gt;&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782543</link><guid isPermaLink="false">3782543</guid><pubDate>Fri, 25 Sep 2026 11:42:19 GMT</pubDate><author>Z Finance</author><itunes:image href="https://wpimg-wscn.awtmt.com/fad50efe-e9f5-4ae6-887e-e152188ca79b.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/e3b8162a-8952-4486-b4b9-def5cffb445b.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:23:29</itunes:duration></item><item><title>AI资本开支冲向1.7万亿美元，回报要达到什么水平才算合理？高盛算了一笔账</title><description>&lt;p&gt;美国超大规模云服务商的AI资本支出规模空前，但其能否获得合理回报，已成为市场最核心的投资争议。高盛最新发布的研究框架给出了一个具体数字。&lt;/p&gt;
&lt;p&gt;据追风交易台消息，据高盛研究报告，&lt;strong&gt;在15%年化投资资本回报率（ROIC）的基准假设下，Alphabet、微软、亚马逊、Meta、甲骨文及SpaceX六大美国超大规模云服务商，需在2028至2030年间累计实现约1.42万亿美元的收入，方能为其&quot;第二阶段&quot;（2026至2027年）AI算力资本支出提供合理回报。&lt;/strong&gt;换算为单位容量口径，这一门槛相当于每吉瓦（GW）年均收入约116亿美元。&lt;/p&gt;
&lt;p&gt;高盛分析师认为，近期回报率的压缩是大规模前期投资周期的自然结果，而非AI经济结构性盈利能力低下的证据。报告同时指出，三大公有云服务商（AWS、Azure、Google Cloud）截至2026年第二季度合计已累积约1.69万亿美元的合同待执行积压订单，远超上述门槛所需的1.00万亿美元，为未来变现潜力提供了重要支撑。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;55d00c4d&quot;&gt;资本支出激增，投资者关注回报&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;美国超大规模云服务商正经历史无前例的资本密集度跃升。&lt;strong&gt;高盛将其AI算力建设划分为三个阶段：&lt;/strong&gt;2023至2025年的&quot;第一阶段&quot;总资本支出约6330亿美元，年均约2110亿美元；2026至2027年的&quot;第二阶段&quot;总资本支出约1.73万亿美元，年均约8630亿美元；2028至2030年的&quot;第三阶段&quot;预计总资本支出高达约4.14万亿美元，年均约1.38万亿美元。&lt;/p&gt;
&lt;p&gt;据Visible Alpha共识数据，自2026年初以来，上述五家已上市超大规模云服务商（Alphabet、微软、亚马逊、Meta及甲骨文）的2026至2027年资本支出一致预期已累计上调约66%，两年合计上调幅度约为7500亿美元。高盛表示，其自身对2027年资本支出的预测仍高于市场一致预期，并认为这一较高估计更贴近投资者的实际预期。&lt;/p&gt;
&lt;p&gt;随着近期资本支出规模逐渐被市场消化，当前投资者争议的焦点已转向两个紧密关联的问题：本轮2026至2027年资本支出能实现怎样的回报，以及2028年及以后的长期资本密集度将如何演变。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;687a5d1a&quot;&gt;半导体供应链数据印证需求规模&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;高盛从半导体供应链的自下而上视角，对AI基础设施资本支出规模进行了独立测算，结果与需求端判断相互印证。&lt;/p&gt;
&lt;p&gt;根据半导体公司指引及高盛自身预测，&lt;strong&gt;2027年AI基础设施资本支出估计约为1.3万亿美元，同比增长约60%；&lt;/strong&gt;2028年进一步升至约2.0万亿美元，同比增长约42%。以算力容量衡量，预计2026年、2027年及2028年AI数据中心新增部署规模分别约为20GW、35GW及57GW。&lt;/p&gt;
&lt;p&gt;具体来看，博通已就其客户在2027财年及2028财年分别部署10GW及20GW的AI相关算力提供了指引；英伟达表示Blackwell系统每GW约对应250亿美元收入，而下一代Rubin架构的这一数字将升至约400亿美元；AMD则将其每GW收入机会测算为150亿至200亿美元。高盛综合上述数据，测算出每GW平均前期资本支出成本约为420亿美元，这一数字也成为其ROIC框架的核心输入假设之一。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;roic&quot;&gt;ROIC框架：关键假设与测算逻辑&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;高盛ROIC框架的核心在于，量化六大超大规模云服务商需要创造多少收入，才能在其&quot;第二阶段&quot;AI算力投资上实现基准回报。&lt;/p&gt;
&lt;p&gt;在关键假设上，高盛将基准ROIC门槛设定为15%年化回报，以2026至2027年平均年度资本支出为基数，以2028至2030年税后净营业利润（NOPAT）衡量回报。每GW前期资本支出成本统一假设约为420亿美元，其中约70%用于&quot;算力&quot;（服务器、芯片、网络硬件等），约30%用于&quot;壳体&quot;（土地、建筑及相关基础设施）。折旧方面，&quot;算力&quot;类资产使用寿命假设为5年，&quot;壳体&quot;类资产为15年；数据中心年度运营及维护成本（电力、人力等）假设约为每GW 8.36亿美元。&lt;/p&gt;
&lt;p&gt;基于上述假设，框架测算结果显示，&lt;strong&gt;六大超大规模云服务商需在2028至2030年间累计创收约1.42万亿美元，方可达成15%的ROIC门槛。&lt;/strong&gt;高盛同时提供了敏感性分析：若ROIC目标区间设定为0%至30%，对应所需累计收入区间约为9080亿至1.89万亿美元，每GW年均收入区间约为62亿至186亿美元。&lt;/p&gt;
&lt;p&gt;高盛明确指出，超大规模云服务商目前在既有资本支出上所实现的ROIC，几乎可以确定高于上述15%的基准门槛，因此该框架旨在回应部分投资者对ROIC可能为负的极端担忧。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;2ed247ee&quot;&gt;云服务积压订单提供变现参照&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;为将上述抽象的收入门槛与现实需求相锚定，高盛引入了三大公有云服务商的合同积压订单数据作为参照。&lt;/p&gt;
&lt;p&gt;据高盛报告，&lt;strong&gt;截至2026年第二季度，AWS、Azure及Google Cloud合计报告的积压订单已达约1.69万亿美元，同比增长约152%，较2026年初增长约1.5倍。&lt;/strong&gt;各公司管理层均指出，算力供应不足限制了服务AI相关需求的能力，是加大资本支出投入的主要原因之一。&lt;/p&gt;
&lt;p&gt;高盛测算，针对上述三家公司2026至2027年约1.22万亿美元的合并资本支出，以15%的ROIC门槛衡量，其2028至2030年需累计实现约1.00万亿美元收入。这一数字仅相当于当前积压订单总额1.69万亿美元的约59%。高盛指出，该比较还基于积压订单未来不再增长的保守假设，而实际上近期积压订单一直保持两位数的环比增速。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;roic&quot;&gt;企业管理层对ROIC前景表态乐观&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;多家超大规模云服务商管理层已通过公开场合，为AI资本支出的盈利前景提供了背书。&lt;/p&gt;
&lt;p&gt;据高盛报告，亚马逊在2026年第二季度财报电话会议上表示，其AWS及AI相关资本支出具有清晰的未来强劲回报可见度：服务器及网络设备的盈亏平衡点约为3年（使用寿命5至6年），意味着盈亏平衡后仍有2至3年的显著现金流创造期；数据中心壳体则拥有30年以上的使用寿命，可支持5至6轮服务器经济周期。甲骨文在2026财年第四季度财报电话会议上披露，其基础设施业务大型项目的稳态ROIC约为20%至30%区间的高端水平。SpaceX在高盛Communacopia+科技大会上则表示，其AI算力资本支出当前可实现约一年的投资回收期。&lt;/p&gt;
&lt;p&gt;微软则强调，AI领域的单位经济效益优于云计算初期同阶段的表现，并认为AI业务毛利率不存在结构性障碍，长期有望向云计算业务的毛利率水平靠拢。多家公司还强调，数据中心基础设施在地理布局、硬件类型及工作负载适配上具备充分灵活性，有助于优化利用率、降低技术路线锁定风险。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;65eda33d&quot;&gt;变现路径多元，需求驱动有据可查&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;高盛认为，AI算力的未来变现将依托多条路径推进，且当前需求加速信号已有具体案例支撑。&lt;/p&gt;
&lt;p&gt;在企业端，三大公有云服务商已就多类型工作负载和服务上调定价，随着合同续签节奏加快，进一步涨价空间依然存在。企业变现模式涵盖从&quot;裸金属&quot;基础设施即服务（如SpaceX近期宣布的算力授权协议）到全栈企业软件服务等多个层次。在消费端，广告收入（Meta、Alphabet、亚马逊）的变现路径最为成熟，订阅、智能体商业化等新兴模式亦处于加速探索阶段。高盛还特别提及，近期Meta推出的Muse等面向消费者的智能体AI产品，有望推动消费AI范式从对话式向行动式跃迁，并在中长期带动更大规模的算力需求及相应变现机制。&lt;/p&gt;
&lt;p&gt;从需求端信号看，高盛在其近期举办的Communacopia+科技大会上观察到，企业AI应用正从实验阶段向落地实施加速转变，生产力驱动的回报愈发清晰，同时企业用户从&quot;token最大化&quot;向&quot;token优化&quot;的策略转变正在改善整体回报结构，并成为超大规模云服务商营收加速的领先指标。&lt;/p&gt;
&lt;p&gt;&amp;nbsp;&lt;/p&gt;
&lt;p class=&quot;shield-text&quot;&gt;~~~~~~~~~~~~~~~~~~~~~~~~&lt;/p&gt;
&lt;p class=&quot;shield-text&quot;&gt;以上精彩内容来自&lt;a href=&quot;https://mp.weixin.qq.com/s/uua05g5qk-N2J7h91pyqxQ&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;追风交易台&lt;/a&gt;。&lt;/p&gt;
&lt;p class=&quot;shield-text&quot;&gt;更详细的解读，包括实时解读、一线研究等内容，请加入【&lt;a href=&quot;https://wallstreetcn.com/shop/item/1000309&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;&lt;strong&gt;&lt;span style=&quot;color: #1482f0;&quot;&gt;追风交易台▪年度会员&lt;/span&gt;&lt;/strong&gt;&lt;/a&gt;】&lt;/p&gt;
&lt;p class=&quot;shield-text&quot;&gt;&lt;a href=&quot;https://wallstreetcn.com/shop/item/1000309&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;&lt;img class=&quot;wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/3c4a713c-7a38-4582-9850-d0eabaf0e7ad.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;3130&quot; data-wscnw=&quot;1080&quot; data-wscnsize=&quot;1463814&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/a&gt;&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782541</link><guid isPermaLink="false">3782541</guid><pubDate>Fri, 25 Sep 2026 11:30:34 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/25c6ea18-dc01-40bd-8709-310954761407.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/ee274c0b-0a13-4141-af61-c868615fb4d4.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:09:11</itunes:duration></item><item><title>通胀、赤字、AI发债齐施压，超半数市场人士押注30年期美债收益率年底前触及6%</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;美国10年期国债收益率突破5%关口，长期利率上行压力仍未消退，而美债买家结构的变化正让市场更容易出现剧烈波动。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;通胀仍高于目标、美国经济保持韧性，美联储重新转向加息，同时美国财政融资需求持续扩大，共同推高长期美债收益率。与此同时，&lt;strong&gt;对价格不敏感的外国官方投资者逐步减少，对冲基金等对价格更敏感的投资者承接更多美债，意味着市场对资金流向变化可能更加敏感。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;本周三，美国10年期国债收益率单日上升14个基点，盘中一度突破5.1%，创2007年以来新高；5年期美债收益率也突破5%，同样达到2007年以来高位。日本10年期国债收益率周四升至1996年以来最高水平，全球债券市场同步承压。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;&lt;img class=&quot;wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/35c6abf4-e035-492c-a16f-f06f4b5dcc1e.png&quot; data-wscntype=&quot;image&quot; data-wscnsize=&quot;614400&quot; data-wscnh=&quot;600&quot; data-wscnw=&quot;1024&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;通胀未退，经济仍有韧性&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;本轮收益率上行首先有基本面支撑。美国7月PCE价格指数同比上涨3.7%，仍明显高于美联储2%的目标。油价上涨又增加了通胀回落的不确定性，能源价格如果持续高位运行，可能进一步延长通胀降温所需时间。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;与此同时，美国经济并未明显失速。就业市场保持稳定，消费仍有支撑，AI数据中心建设带动的投资热潮也推动企业资本开支。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;经济韧性使美联储没有迫切理由迅速转向宽松。美联储近期将政策利率上调25个基点至3.75%至4%。美联储理事Michael Barr表示，在通胀仍高于目标、经济增长强劲的情况下，进一步调整政策可能仍有必要；芝加哥联储主席Austan Goolsbee则表示，通胀回到2%的过程不会一帆风顺。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;因此，&lt;strong&gt;长端收益率面对的是通胀、增长和货币政策三重压力，而不只是短期油价冲击。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;美债买家趋于“脆弱”，市场波动风险上升&lt;/h2&gt;
&lt;p&gt;供给端同样在给美债市场施压。美国财政赤字规模较大，持续融资意味着市场需要吸收大量新增国债；与此同时，大型科技企业为AI基础设施投资增加债务融资，也进一步推高了对长期资金的需求。&lt;/p&gt;
&lt;p&gt;更值得关注的是买家结构正在变化。纽约联储研究显示，对价格不敏感的外国官方投资者参与度有所下降，而对冲基金和私人投资者的作用上升。&lt;/p&gt;
&lt;p&gt;与前者相比，对冲基金等市场化投资者更关注收益率、价格和融资条件。收益率足够高时，这类资金可以承接新增国债；但如果市场快速调整，其仓位也可能随之变化，从而使债券需求更具弹性。&lt;/p&gt;
&lt;p&gt;这意味着，&lt;strong&gt;在新增供给持续增加、稳定型买家减少的情况下，美债市场可能需要通过更高收益率吸引资金。一旦收益率快速上行，债券价格下跌还可能触发止损、保证金压力等被动减仓，进一步放大市场波动。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;因此，当前值得关注的并非对冲基金是否会撤离，而是美债市场对价格敏感型资金的依赖上升后，供需变化对收益率的影响可能被进一步放大。&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;5%之后，市场还要看什么？&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;5%的10年期美债收益率并非历史最高水平，但已足以让市场重新评估长期利率中枢。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;彭博此前对市场参与者的调查显示，&lt;strong&gt;超过半数受访者预计美国30年期国债收益率年底前可能触及6%。这并不意味着6%一定会实现，但反映出市场对长期利率继续上行的担忧正在升温。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;与此同时，5%的收益率也提高了美债对长期资金的吸引力。与金融危机后的低利率环境相比，美国国债如今能够提供更高的名义回报，部分资金可能因此重新配置固定收益资产。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;因此，&lt;strong&gt;后续关键不只是通胀和美联储，还包括美国财政融资规模，以及市场能否持续吸收新增国债。&lt;/strong&gt;如果稳定型买家继续减少，而对价格敏感的资金占比进一步提高，美债收益率对市场冲击的反应可能更加剧烈。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782544</link><guid isPermaLink="false">3782544</guid><pubDate>Fri, 25 Sep 2026 11:03:51 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/4800716a-6ea1-4f11-a52e-7f62d23c3676.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/91ecc41b-2348-421f-8e68-92392409d043.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:04:07</itunes:duration><category>债券</category></item><item><title>为了把更多HBM塞进芯片，英伟达加速推进玻璃基板技术</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;英伟达正联合产业链企业推进玻璃基板技术落地，以应对AI芯片封装在尺寸、散热和互连方面日益突出的物理限制。若技术实现突破，玻璃基板有望支持更大规模的HBM集成，为下一代GPU提升封装密度和数据传输能力。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;据报道，&lt;strong&gt;德国设备厂商SCHMID在近期上半年业绩发布会上披露，公司正与英特尔、英伟达、AMD各自供应链中的核心企业合作，共同推进玻璃芯核基板设备研发。&lt;/strong&gt;SCHMID首席战略官Roland Rettenmayer表示，目前玻璃通孔（TGV）金属化工艺仍存在技术障碍，终端客户认证也尚未完成。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;英伟达CEO黄仁勋此前已就这一技术路线展开多方接触。他与SK集团会长崔泰源会面时，曾讨论包括玻璃基板在内的下一代半导体合作，并积极推动台积电加快相关技术开发。这表明，&lt;strong&gt;英伟达正在评估将玻璃基板引入下一代GPU的可行性。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;玻璃基板瞄准AI芯片封装瓶颈，有望扩大HBM集成&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;随着AI芯片性能和功耗持续提升，传统塑料基板在耐热性、翘曲控制等方面的局限更加突出。&lt;strong&gt;玻璃基板具有更高的平整度和强度，热膨胀系数较低，高温环境下形变更小，同时具备良好的介电特性和较低的信号损耗，因此被视为下一代高性能芯片封装的潜在方案。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;玻璃基板的另一大优势在于封装尺寸扩展能力。当前主流AI芯片通常采用硅中介层，将GPU与HBM并排集成，但硅中介层在尺寸扩展和制造成本方面存在约束。&lt;strong&gt;玻璃基板有望部分甚至完全替代硅中介层，在同一封装中容纳更多芯片和HBM，从而提高封装密度并缩短数据传输路径。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;对于AI芯片而言，这意味着更大的HBM集成规模和更高的数据吞吐能力。HBM通过垂直堆叠多层DRAM提升带宽，是当前AI加速器的重要存储组件。随着模型规模和算力需求不断提升，封装能够容纳多少HBM，也成为限制AI芯片性能的重要因素。&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;TGV金属化仍是量产关键，商业化尚未完成&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;不过，玻璃基板距离大规模商业化仍有技术和认证环节需要突破。SCHMID明确指出，&lt;strong&gt;TGV金属化工艺仍是当前主要技术障碍之一。&lt;/strong&gt;玻璃本身不导电，如何在基板内部形成稳定、可靠且具备高密度互连能力的通孔，是实现大规模量产的关键。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;与此同时，终端客户认证流程尚未完成，意味着相关技术仍处于产业化推进阶段。SCHMID目前正开发玻璃基板生产所需的设备和解决方案，并同步拓展AI服务器主板及新一代封装设备业务。对英伟达及其供应链而言，玻璃基板能否最终进入大规模GPU生产，仍取决于制造工艺、可靠性和客户认证等环节能否进一步成熟。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782539</link><guid isPermaLink="false">3782539</guid><pubDate>Fri, 25 Sep 2026 09:56:26 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/aeda9ea2-3cff-4d05-a83a-fdd482819cc6.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/8b4c15f7-5edd-4c37-ae9e-3c9c4e2e80d5.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:02:58</itunes:duration></item><item><title>新型烟草的春天：中外政策同时修复， 行业预期明年有望上修？</title><description>&lt;p&gt;2026 年7月28日，国家烟草专卖局公开征求《加热卷烟》强制性国家标准意见，9月26日截止，拟在发布后6个月实施；同期，美国FDA于5月5日首次授权&quot;非烟草、非薄荷醇&quot;调味电子烟，并于 5 月 8 日发布执法优先级指南。&lt;/p&gt;
&lt;p&gt;海内外的政策导向似乎在发出同一个讯号：HNB的春天可能要到了。&lt;/p&gt;
&lt;p&gt;当然更关键的分层在于：上游耗材的确定性来自&quot;用量结构切换&quot;。烟用香精单支价值量约为传统卷烟 10 倍、再造烟草薄片 5—8 倍、卷烟纸 2 倍以上。市场已经逐步开始为放量的上游材料进行再定价和认知重估。&lt;/p&gt;
&lt;h2&gt;&lt;span style=&quot;color: #1482f0;&quot;&gt;一、发生了什么？政策信号改善&lt;/span&gt;&lt;/h2&gt;
&lt;p&gt;两份文件一份来自北京，定义产品；一份来自华盛顿，定义执法。它们在悄无声息地改变HNB整个产业的发展路径，但鲜少有人认知到未来半年的变化方向。&lt;/p&gt;
&lt;h3&gt;国内：一份强制性国标&lt;/h3&gt;
&lt;p&gt;2026年7月，国家烟草专卖局在全国标准信息公共服务平台发布《加热卷烟》强制性国家标准征求意见稿，意见反馈截止2026 年9月26日，拟在正式发布6个月后实施。该标准编制周期16个月，归口单位为国家烟草专卖局。起草主体包括上海新型烟草制品研究院、云南／湖南／四川／湖北／江苏等中烟系工业公司以及国家烟草质量监督检验中心等十余家机构。具体来看草案的实体内容，最核心的一点是它把加热卷烟定义为&quot;仅加热不燃烧、产生含烟碱气溶胶的成套抽吸装置&quot;，要求同时覆盖烟支、烟具、气溶胶三个部分，并给出了四条可量化的产业红线：&lt;/p&gt;
&lt;p&gt;国标草案的四条硬指标&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;烟支（基质与安全）&lt;/strong&gt;：烟草基质应由烟叶、复烤烟叶、再造烟叶或烟丝加工制成；不得霉变；水分活度不高于 0.70；唇部接触区域表面温度不高于 55℃。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;烟具（工程安全）&lt;/strong&gt;：不允许用户自行更换电池；须具备防儿童启动和防意外启动功能；满足电气、电池、防水、跌落、充电与泄压要求；发热体表面温度不高于 380℃。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;气溶胶&lt;/strong&gt;：平均每口烟碱释放量不高于 0.2 毫克。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;包装与追溯&lt;/strong&gt;：烟支包装须注明烟具匹配要求；烟支与烟具包装均须包含产品可追溯信息。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;官方的设计意图大概是：通过草案把烟支和烟具定性为&quot;不可分割的两个部分&quot;，要求烟支包装标明烟具匹配要求。特定烟支、特定烟具以及特定的工作条件，共同构成产品合规的基础。烟支配方、结构或烟具参数一旦调整，匹配关系可能需要重新验证。这对中烟工业与烟具研发制造方之间的协同深度提出了硬性要求，同时也意味着跨代产品兼容设计将不再是纯工程问题，背后更是合规问题。&lt;/p&gt;
&lt;p&gt;此外，草案在发热体表面温度测试中，分别列出发热体位于烟具内部和烟支内部两种情形，中心加热、外围加热、加热片／针／棒、外围加热腔、以及烟支内置发热元件的感应加热方案，均被纳入适用范围。标准并没有强行指定技术路线。这既给中烟体系留了选择空间，也让上游加热组件供应商之间的竞争回到产品性能而非资质排他上。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot;wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/7764a027-e5c8-4cd1-a3b6-319e4f484f31.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;854&quot; data-wscnw=&quot;1578&quot; data-wscnsize=&quot;127216&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;h3&gt;财政端的推力，比产业端更强&lt;/h3&gt;
&lt;p&gt;本次产业新规的加速推动，更多的动因可能在于财政账本的全面考量。国家烟草专卖局披露，2025 年烟草行业实现工商税利总额 16570 亿元、同比增长 3.5%，上缴财政总额 15800 亿元、同比增长 2.3%——两项都是历史最高值。上缴财政占全国一般公共预算收入约 7.3%，相当于每天向国库净上缴约 43 亿元。&lt;/p&gt;
&lt;p&gt;但仔细观察结构，弊病已经逐步露出。2025 年全国卷烟产量 24703.9 亿支，同比只增加 49.3 亿支、增幅 0.2%，已经进入零增长区间。税利增长 3.5% 而产量增长 0.2%，意味着这 3.5% 几乎全部来自结构升级和涨价。2025年一类高端卷烟市场占比冲到 38% 以上，普一类与二类烟合计接近六成。&lt;/p&gt;
&lt;p&gt;健康意识的不断增强、人口老龄化和负增长以及对于吸烟行为的多重管控，为烟草传统的销售和消费带来了新的课题和挑战。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot;wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/fae2684d-684b-4687-b949-39da0198b597.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;902&quot; data-wscnw=&quot;1586&quot; data-wscnsize=&quot;145802&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;公开数据显示，15 岁及以上人群吸烟率已降至 23.2%，其中 15—24 岁年龄段吸烟率的口径在不同来源间存在差异（5.2% 与 10.7% 两个数值并存，前者为青少年口径、后者为 15—24 岁全口径），但方向一致：代际断层已经形成。参考日本的轨迹，其成人吸烟率从 1966 年接近 50% 的高位降至 2018 年的 17.9%，卷烟销量从 1996 年的峰值下降超过六成。&lt;/p&gt;
&lt;h3&gt;但&quot;涨价续命&quot;模式，第一次失灵了&lt;/h3&gt;
&lt;p&gt;2026 年一季度，烟草行业营业收入同比下滑 2.2%、利润总额同比下滑 3.9%、税收环比回落 8.2%。这是三项核心指标第一次同时向下。当下宏观消费收紧，商务招待与送礼场景收缩，最先被砍掉的就是高价烟。2026年开年，全国约七成的卷烟品种出现价格倒挂，批发价高于零售价，零售户卖一包亏一包；零售端库存周转天数从45天拉长到78天。价格体系一旦撑不住，非正规渠道就有了生存空间，假烟和走私烟侵蚀的不只是税收，更是专卖制度的价格权威。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot;wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/5e7241b9-7399-42d4-8c3a-20e3d7943096.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;968&quot; data-wscnw=&quot;1522&quot; data-wscnsize=&quot;142547&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;h3&gt;海外：FDA 的&quot;开口&quot;与&quot;收紧&quot;&lt;/h3&gt;
&lt;p&gt;2026 年，FDA 通过上市前烟草产品申请（PMTA）路径授权了 Glas 公司四款封闭式烟弹，含 5% 烟碱（50mg/ml）：Classic Menthol、Fresh Menthol、Gold（芒果）、Sapphire（蓝莓）。其中 Gold 与 Sapphire 是 FDA 有史以来第一次授权的&quot;非烟草、非薄荷醇&quot;调味电子烟产品。之后，FDA又发布《对未获上市前授权的特定新型烟草产品的执法优先级指南》，取代 2020 年 4 月的旧版指南，明确&quot;暂不优先执法&quot;的适用范围。&lt;/p&gt;
&lt;p&gt;FDA 明确指出，Glas 获批的核心是其&amp;nbsp;&lt;strong&gt;DAR（Device Access Restriction，设备访问限制）技术&lt;/strong&gt;：用户须以政府签发的身份证件完成年龄与身份核验，设备须通过蓝牙与手机配对后方可工作，一旦离开配对手机即停用；App 还会进行随机生物识别核验，确认实际使用者就是注册成年人。FDA 烟草产品中心代理主任 Bret Koplow 称该技术为&quot;潜在的游戏规则改变者&quot;。&lt;/p&gt;
&lt;p&gt;落到具体动作上，英美烟草已经把节奏排了出来：2026 年上半年，Vuse 在美国的收入同比增长约 20%，合规市场份额提升 4.1 个百分点至 55.9%；公司已在俄亥俄州等市场推出四款 Vuse Pro 调味烟弹（桃子、浆果、西瓜、薄荷），计划 2026 年三季度末覆盖 2.5 万家美国零售店，四季度末再新增 2.5 万家、累计覆盖 5 万家。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot;wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/65a810cc-3935-4c61-b739-c9292e448872.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;928&quot; data-wscnw=&quot;1570&quot; data-wscnsize=&quot;133768&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;另需注意，这一轮美国市场的机遇以雾化产品为主，与 HNB 是两条不同的产品线与监管路径；FDA 对 HNB 类产品（如 IQOS ILUMA）的审批进度，与本次调味烟弹授权并无直接关系。&lt;/p&gt;
&lt;h2&gt;&lt;span style=&quot;color: #1482f0;&quot;&gt;二、为什么重要？影响因子哪几个&lt;/span&gt;&lt;/h2&gt;
&lt;h3&gt;先看分母：同一个&quot;全球 HNB 市场&quot;，两套口径差 3.5 倍&lt;/h3&gt;
&lt;p&gt;关于全球 HNB 市场规模，公开渠道至少并存两套被广泛引用的数据。Euromonitor 的零售端口径给出：2023 年 345 亿美元、2024 年 371 亿美元、2025 年 431 亿美元、2028 年预计 684 亿美元；Frost &amp;amp; Sullivan 的出厂端口径给出：2023 年 85 亿美元、2028 年预计 194.2 亿美元。同一时点、同一个品类，零售端与出厂端的差距约为 3.5 倍。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;两者的差异如何理解？零售端&lt;/strong&gt;包含消费税、流通环节加价与零售毛利，衡量的是&quot;消费者花掉多少钱&quot;，适合用来推演终端定价、渗透率与财政税收；&lt;strong&gt;出厂端&lt;/strong&gt;是制造商确认的收入，衡量的是&quot;供应链能分到多少钱&quot;，适合用来估算烟具代工、烟弹制造与上游材料的可及市场。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot;wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/9d11ca55-8d89-4499-9b4b-091c49e92e44.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;838&quot; data-wscnw=&quot;1604&quot; data-wscnsize=&quot;143123&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;再看 HNB 在整个烟草大盘里的位置。按 2024 年数据，全球烟草市场合计约 9388 亿美元，其中卷烟（含雪茄）7707 亿美元、雪茄与烟丝 834 亿美元、加热不燃烧 371 亿美元、雾化电子烟 226 亿美元、无烟制品 138 亿美元、口服尼古丁 112 亿美元。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;这个结构决定了三件事。&lt;/strong&gt;第一，HNB 的想象空间来自&quot;4.0% 向更高比例迁移&quot;，而不是来自品类本身的大小——它已经超过了雾化电子烟的规模，是全球新型烟草中最大的单一品类。第二，增速而非存量才是这个板块的投资理由：2019—2023 年 HNB 烟弹全球市场规模复合增速约 21.3%，显著高于雾化换弹产品的 2.9%，也高于同期传统卷烟的负增长。第三，中国在其中的角色目前是&quot;制造中心&quot;而非&quot;消费市场&quot;：2024 年中国电子烟产品出口额 109.61 亿美元、出口量 25.23 万吨，2025 年出口总额约 106 亿美元、同比下降约 3.3%，其中对美出口超过 41 亿美元、占出口总额约 39%、同比增长 11%。下游品牌与需求在欧美，制造与供应链在中国——这个错配才是理解国内 HNB 标准为何在这个时点提速的钥匙。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot;wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/2b7d1b63-86a6-4b88-9540-3e40c7fceb98.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;932&quot; data-wscnw=&quot;1636&quot; data-wscnsize=&quot;171260&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;h3&gt;情景测算：决定权不在产业手里&lt;/h3&gt;
&lt;p&gt;基于已披露的约束条件，我们给出三情景测算框架。约束条件有三个：中国年销传统卷烟约 2.45 万亿支（2025 年产量 24703.9 亿支）；HNB 单支价格约为传统卷烟的 1.5—2 倍（参考海外市场加税后的价差结构）；渗透率取 3%／5%／10% 三档，分别对应日本经验的低配、中性配与高配版本。三情景对应的烟支量分别约为 735 亿支、1225 亿支与 2450 亿支，对应市场规模（零售端口径）约 500 亿元、850 亿元与 1700 亿元人民币。三个情景的差异几乎全部由渗透率决定，而渗透率由税收设计、渠道准入与口味规则共同决定，这三项都在监管方手里，不在产业手里。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot;wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/f75f03b9-48b1-4def-ba8d-53f525b5c095.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;1004&quot; data-wscnw=&quot;1596&quot; data-wscnsize=&quot;167758&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;h3&gt;价值量放大在哪里：用量结构切换&lt;/h3&gt;
&lt;p&gt;HNB 对上游的改变，本质上是把&quot;燃烧&quot;换成&quot;加热&quot;之后，配方与结构必须重做。传统卷烟靠燃烧释放烟草本香，HNB 的加热温度只有 250—350℃，香味物质释放不足，必须靠外加香精补偿，而且要均匀缓释、耐热稳定；同时烟支主体不再是天然烟丝，而主要是再造烟草薄片。这直接改写了上游耗材的用量结构。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot;wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/c7d9711e-a541-42b1-bfe2-36e424eb81d6.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;796&quot; data-wscnw=&quot;1454&quot; data-wscnsize=&quot;129767&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;这三项放大的前提是&quot;烟弹被生产出来&quot;，而不是&quot;渗透率达到多少&quot;。&lt;/strong&gt;只要中烟体系开始以合规方式批量生产烟弹——哪怕只对应 735 亿支的保守情景——上游耗材的用量结构切换就已经发生。这是整个 HNB 产业链里确定性最高的那一层。&lt;/p&gt;
&lt;p&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2&gt;&lt;span style=&quot;color: #1482f0;&quot;&gt;三、接下去关注？哪些信号值得关注和跟踪&lt;/span&gt;&lt;/h2&gt;
&lt;p&gt;政策叙事可以有很多版本，但报表只有一个版本。我们用已经披露的中报数据来看看行业当前的情况。&lt;/p&gt;
&lt;p&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&amp;nbsp;&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/member/articles/3782436</link><guid isPermaLink="false">3782436</guid><pubDate>Fri, 25 Sep 2026 09:53:37 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/133bc66b-a478-4103-82c0-acc2f215e033.jpeg"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/267efa1a-e615-43fa-a668-d8fb5a1132b7.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:12:18</itunes:duration><category>股票</category></item><item><title>刚刚，GPT-6开真车考过了科目二！</title><description>&lt;p&gt;离大谱，&lt;strong&gt;大模型竟然第一次考过「科目二」了&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;从没专门学过开车的GPT-6 Astra，被强行塞进一辆真实的丰田卡罗拉里。&lt;/p&gt;
&lt;p&gt;结果它自己看路、自己打方向，一路绕开锥桶，最后稳稳地开进了一块用锥桶围出来的「车位」。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/a56329a6-532e-4dc9-aca0-1bf50eaf6c0f.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;338&quot; data-wscnw=&quot;600&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;&lt;span style=&quot;color: #808080;&quot;&gt;方向盘在自己转，开车的是大模型&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;同一个赛场里还有Claude Fable 5.1、Grok 4.6，以及OpenAI自家的上一代GPT-5.6 Sol，&lt;strong&gt;结果全军覆没，Astra成了唯一过关的考生&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/9c061966-bc05-4340-8543-70d728d91066.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;314&quot; data-wscnw=&quot;889&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;span style=&quot;color: #808080;&quot;&gt;DrivingBench成绩榜，Astra第二把跑完全程，用时5分22秒&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;特斯拉喂了120亿英里驾驶数据才练出来的本事，一个没专门学过开车的聊天模型，竟然也摸到了门槛。&lt;/p&gt;
&lt;p&gt;2004年，DARPA第一届无人车挑战赛上，参赛车辆全军覆没，现代自动驾驶就从那片沙漠起步。&lt;strong&gt;22年后，第一次有通用大模型把真车开到了终点。&lt;/strong&gt;&lt;/p&gt;
&lt;h2&gt;&lt;strong&gt;没摸过方向盘，直接开真车上考场&lt;/strong&gt;&lt;/h2&gt;
&lt;p&gt;这四位下场的考生全是通用大模型，平时干的都是写代码、做表格、陪聊天的文职工作，&lt;strong&gt;没有一个正儿八经摸过方向盘&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;所以成绩一出来，连职业规划机构80000 Hours的联合创始人Benjamin Todd都觉得有点玄乎。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/df69662e-1972-417e-b6d9-ea981d75e4d7.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;261&quot; data-wscnw=&quot;889&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;这场「驾考」叫DrivingBench，是三个湾区年轻人攒出来的局。其中的Aditya Ramabadran平时在做模型后训练。&lt;/p&gt;
&lt;p&gt;考车是他们租来的一辆2022款丰田卡罗拉。&lt;/p&gt;
&lt;p&gt;车上外挂了一个999美元的小黑盒（comma four），里面跑着开源辅助驾驶系统openpilot。只要插上这个盒子，就能接管这辆车的方向盘、油门和刹车。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/9ad26f6a-02f8-42c1-8c9f-7aa8caec73a1.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;396&quot; data-wscnw=&quot;889&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;span style=&quot;color: #808080;&quot;&gt;考试车，一辆租来的2022款丰田卡罗拉&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/66fb22e0-c0a1-4a1b-aebc-8b92f7ce317c.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;338&quot; data-wscnw=&quot;600&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;span style=&quot;color: #808080;&quot;&gt;车里的笔记本跑着大模型，方向盘跟着指令自己转&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;大模型们各自待在聊天窗口里「云驾驶」，Astra和Sol用的是Codex，Fable用Claude Code，Grok用Cursor。&lt;/p&gt;
&lt;p&gt;它们和这辆车之间，只隔着一套MCP接口，也就是让大模型调用外部工具的一套协议。&lt;/p&gt;
&lt;p&gt;模型则可以从车上调来两路摄像头画面，以及车速和方向盘的角度，然后自己决定往哪边打、打多少、开多快、这条指令管几秒，情况不对就一键急刹。&lt;/p&gt;
&lt;p&gt;每发一条指令，还必须附上一段三十来个单词的「开题报告」，讲清楚为什么要这么开，写给坐在驾驶座上的人类研究员看。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/a5d6a317-da23-47aa-8652-4621d7091e6f.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;338&quot; data-wscnw=&quot;600&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;&lt;span style=&quot;color: #808080;&quot;&gt;模型在聊天窗口下指令，右上角是它看到的实时画面&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;span style=&quot;color: #808080;&quot;&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/3ce8690d-e6c2-4847-bfa4-25bac7c865be.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;652&quot; data-wscnw=&quot;889&quot; referrerpolicy=&quot;no-referrer&quot;&gt;整套系统的链路，模型在云端，车在停车场，中间全靠手机热点续命&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;真车可不会停下来等模型想清楚&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;模型在云端思考的那几秒钟，车子照样按着上一条指令往前开。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/7a5f0612-79bc-47db-956a-d103e138da5e.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;500&quot; data-wscnw=&quot;889&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;span style=&quot;color: #808080;&quot;&gt;车内车外好几个机位同时在拍，驾驶座上的人全程没碰方向盘&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;考场是湾区一个停车场。&lt;/p&gt;
&lt;p&gt;为了选址，他们还派了ChatGPT和Grok的智能体去翻卫星地图。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/a51008c9-6ec8-47f1-ab8b-261e0ed7fc9f.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;523&quot; data-wscnw=&quot;692&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;span style=&quot;color: #808080;&quot;&gt;Grok的智能体在卫星图上圈出的候选场地&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;赛道呈倒U形，全长约130米，用彩色小锥桶摆出8米宽的通道，中间要过好几个弯，终点是一个7×5米的「车位」。&lt;/p&gt;
&lt;p&gt;为了安全，最高车速锁在3.5米/秒。研究员全程坐在驾驶座上，脚悬在刹车上，充当人肉副刹。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/8ba10dcc-2bdc-4bd0-aac0-3605e60d8a62.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;338&quot; data-wscnw=&quot;600&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;每个模型有三次机会，全在同一个对话窗口里。&lt;strong&gt;前一把挂科的原因，下一把它还记得&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;挂了之后，系统会甩给它一段固定的话，逼它反思为什么挂科，像极了驾校教练的痛骂。&lt;/p&gt;
&lt;h2&gt;&lt;strong&gt;考前死活不开，补考一把满分&lt;/strong&gt;&lt;/h2&gt;
&lt;p&gt;唯一通关的Astra，戏也是最多的。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;研究员让它开车，它就是不干&lt;/strong&gt;。Ramabadran后来在X上大吐苦水，还晒出了当时的聊天记录。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/45c091f2-4670-430f-bb68-8d33bec7d6e0.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;514&quot; data-wscnw=&quot;889&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;Astra把考试规则复述得头头是道，说自己准备好了，就等发车。&lt;/p&gt;
&lt;p&gt;结果「GO」一发，它秒变脸，说自己可以帮忙看路，但不能给真车发行驶指令，请人类自己开。&lt;/p&gt;
&lt;p&gt;研究员急了，拼命解释「我们已经跑过十几次了」「有很多安全限制，也有人在盯着」。&lt;/p&gt;
&lt;p&gt;Astra一口咬死，不管签什么免责声明，它都不会去操控一辆真车。最后还甩出一句道歉，说刚才那句「准备就绪」是误导。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;这绝对是人类驾校史上第一个主动拒考的狠人&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;转机来得很草率，他们把连接车辆的服务器随手改名成「DrivingBench Sandbox」，也就是程序员说的「沙盒」，一个跟真实环境隔开的测试环境。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;改名之前，Astra大概只有25%的概率肯开；改名之后，它一次都没再拒绝过&lt;/strong&gt;。（另外三个模型就没这么多心眼，直接就上了。）&lt;/p&gt;
&lt;p&gt;有网友看热闹不嫌事大，也要给自己的系统提示词改个名。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/12e79f92-2a8e-4c5a-bce0-b497ab44b2fd.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;261&quot; data-wscnw=&quot;889&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;至于一个名字为啥这么管用，研究员自己也拿不准，是大模型的「评估意识」在作怪，还是它就是喜欢sandbox这个词。&lt;/p&gt;
&lt;p&gt;不过，真上了路，Astra第一把就挂了。&lt;/p&gt;
&lt;p&gt;它顺利拐过第一个左弯后，觉得车身已经拉直，就把速度提到1.5米/秒。结果车子一路往左边的锥桶和花坛冲去，研究员一脚踩死刹车，成绩定格在49%。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/4911dfcf-7d87-4585-aaa0-5644af795924.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;244&quot; data-wscnw=&quot;600&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;span style=&quot;color: #808080;&quot;&gt;Astra第一把，过完第一个弯后一路向左偏离赛道&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;事后复盘里，它承认自己最大的错误是「太早宣布车已经对齐」，其实远处的通道还在右边。它还意识到自己太依赖画面正中间，「&lt;strong&gt;画面中间看着是空的，不代表整辆车都能挤过去&lt;/strong&gt;。」&lt;/p&gt;
&lt;p&gt;于是它给第二把定下规矩，在花坛和弯道附近，车速压在0.5到0.8米/秒，挪一步看一眼，拿不准就停。&lt;/p&gt;
&lt;p&gt;第二把，它一板一眼照着这套规矩开。给自己定的车速从没超过0.8米/秒，24条指令里有20条把方向盘打满，每5到6秒看一眼路况，旧指令没跑完就接上新的。&lt;/p&gt;
&lt;p&gt;对准车位时，它直着往里拱了一小段，果断叫停。&lt;/p&gt;
&lt;p&gt;「车已停进蓝色车位，前方是封口锥桶，两侧余量充足。取消行驶，停车完成，确认车辆完全静止。」&lt;/p&gt;
&lt;p&gt;最后一段，Astra慢慢开进蓝色锥桶围成的车位&lt;/p&gt;
&lt;p&gt;这一把耗时5分22秒，开了134.7米，&lt;strong&gt;Astra一战封神，成了全场唯一把车开进车位的考生&lt;/strong&gt;。&lt;/p&gt;
&lt;h2&gt;&lt;strong&gt;三个挂科生，全栽在看不懂锥桶上&lt;/strong&gt;&lt;/h2&gt;
&lt;p&gt;剩下的三位考生，就没这么顺了。&lt;/p&gt;
&lt;p&gt;Sol和Grok连挂三把，全倒在第一个弯；Fable前两把也是白给。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/7fc52f03-7a2a-40d7-adca-d75952db9ed4.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;919&quot; data-wscnw=&quot;889&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;span style=&quot;color: #808080;&quot;&gt;四个模型的行驶轨迹，紫色Astra，橙色Fable，黄色Sol，黑色Grok&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;这三位的病根一模一样，看不懂锥桶&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;开局那排斜摆的锥桶，它们分不清哪边是车道，好几次都判断反了。&lt;/p&gt;
&lt;p&gt;· GPT-5.6 Sol&lt;/p&gt;
&lt;p&gt;GPT-5.6 Sol的脑回路最清奇，&lt;strong&gt;它靠颜色认路&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;在它眼里，绿色锥桶是左边，红色锥桶是右边。于是它一门心思往一绿一红两个锥桶的「正中间」硬挤，可那明明是同一排边界上的锥桶。&lt;/p&gt;
&lt;p&gt;这要是放在驾校，教练能当场把方向盘给拔了。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/a84e831d-8731-4994-9a25-b78af298365a.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;244&quot; data-wscnw=&quot;600&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;span style=&quot;color: #808080;&quot;&gt;Sol第二把，往一绿一红两个锥桶中间钻&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;挂了之后，Sol倒是自己找出了病根，「决定性的错误，是我以为锥桶的颜色代表车道左右边界，但题目明明说了锥桶是五颜六色的。」&lt;/p&gt;
&lt;p&gt;第三把它换了思路不看颜色，可惜依然只开出6%就挂了。&lt;/p&gt;
&lt;p&gt;· Grok 4.6&lt;/p&gt;
&lt;p&gt;Grok 4.6复盘时，道理讲得一套一套的。&lt;/p&gt;
&lt;p&gt;第二把挂了，它总结「指令到期只会开始刹车，车还可能溜进锥桶里，所以要在上一条没跑完时赶紧接下一条。」&lt;/p&gt;
&lt;p&gt;结果第三把，它第二条指令的备注里还一本正经地写着「趁这条过期前接上」，其实上一条指令6秒多前就已经跑完了。再下一条指令更离谱，&lt;strong&gt;车在没有指令的状态下滑了10秒多&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;三把下来，Grok最好成绩只有11%。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/49df72b7-234a-4a22-a002-41563929c898.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;244&quot; data-wscnw=&quot;600&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;span style=&quot;color: #808080;&quot;&gt;Grok第三把，红字出现时，车正处在无人下指令的状态&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;大道理全懂，一上车全忘&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;· Fable 5.1&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;真正能做到知错就改的，是Claude Fable 5.1&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;它第一把方向打反，一把向左打满，直接越界。&lt;/p&gt;
&lt;p&gt;第二把它变得神经兮兮，看一眼画面，停在原地想了一分多钟才敢发下一条指令。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;190秒的考试，车真正在动的只有可怜的31秒&lt;/strong&gt;。这要是在大马路上，后车能把它喇叭按碎。&lt;/p&gt;
&lt;p&gt;结果还是挂在了同一个错上，它在复盘里写道，「我又选错边界了。那排斜锥桶明明是左边界，我偏把它当成右边界。」&lt;/p&gt;
&lt;p&gt;第三把，它终于醒悟了，「这次我把斜锥桶放在左手边，贴着车位开。」&lt;/p&gt;
&lt;p&gt;这一把，它顺利过了第一个弯，冲过长直道，一路开到了45%的位置，才因为给右转留的空间不够被迫叫停。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/39aa3c67-7a27-4ae7-a84a-7e3d397a3e78.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;244&quot; data-wscnw=&quot;600&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;span style=&quot;color: #808080;&quot;&gt;Fable第三把，终于沿着正确的车道开上了长直道&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;虽然没到终点，但Fable是全场唯一一个「被骂了下一把真能改」的差生，进步肉眼可见。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/e758eaaa-7b1d-43c9-8b3d-984995417eb8.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;552&quot; data-wscnw=&quot;889&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;h2&gt;&lt;strong&gt;比遛弯还慢，却是大模型开车头一回&lt;/strong&gt;&lt;/h2&gt;
&lt;p&gt;Astra通关的那一把，平均时速只有1.5公里，公园里背着手遛弯的老大爷，速度都是它的三倍。&lt;/p&gt;
&lt;p&gt;这趟5分22秒的「极速龟爬」，烧掉了7.74美元，狂吞660万个token。&lt;/p&gt;
&lt;p&gt;Astra自己动脑子吐出来的只有4678个，大头全花在每一轮重读旧对话和历史图片上。&lt;/p&gt;
&lt;p&gt;折算下来，&lt;strong&gt;这辆车每跑一英里就要烧掉92美元，是油钱的500倍&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/a9135547-d9ad-4f67-98eb-7a12e7e40a0f.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;374&quot; data-wscnw=&quot;889&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;速度慢得离谱，账单贵得吐血。可就是这颤颤巍巍的一脚油门，踩在了整个自动驾驶圈的命门上。&lt;/p&gt;
&lt;p&gt;过去十几年，自动驾驶圈不管怎么打，底层逻辑都一样，&lt;strong&gt;想让车自己跑，就得喂海量的专属驾驶数据&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;Waymo靠激光雷达加高精地图，据估算砸进去三四百亿美元。&lt;/p&gt;
&lt;p&gt;特斯拉搞纯视觉端到端，靠的是全球车主一英里一英里跑出来的近120亿英里数据。&lt;/p&gt;
&lt;p&gt;就连Waymo的EMMA、英伟达开源的Alpamayo 1，说到底也是把大模型拉过来，再拿驾驶数据重新「军训」一遍。&lt;/p&gt;
&lt;p&gt;DrivingBench这出戏，简直是在掀桌子。&lt;/p&gt;
&lt;p&gt;DrivingBench没拿驾驶数据给Astra开过小灶，它靠平时陪网友聊天、写代码练出来的通用脑子，第二把就满分通关。&lt;/p&gt;
&lt;p&gt;这个逻辑一旦成立，&lt;strong&gt;特斯拉引以为傲的120亿英里数据护城河，可能就要被抽干了&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;以后谁的通用大模型最聪明，谁就可能「顺手」把自动驾驶的活儿给干了。&lt;/p&gt;
&lt;p&gt;对此，特斯拉铁粉、知名博主Whole Mars Catalog深表认同——&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;以后不会再分什么自动驾驶模型和大语言模型，只会剩下通用智能。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/8d561e33-a594-4a66-8546-7824b87b623a.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;261&quot; data-wscnw=&quot;889&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;前英伟达数据科学家Bojan Tunguz则直接放话，这事一点都不意外。&lt;/p&gt;
&lt;p&gt;他这几年一直在说，真正不用人盯着的「自动驾驶」，会是通用人工智能顺带做出来的东西。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/8f7c51f9-ed60-48e4-9dc3-3dab35b03b06.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;303&quot; data-wscnw=&quot;889&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;眼下，拿前沿大模型连着云端开真车，还纯属极客整活。&lt;/p&gt;
&lt;p&gt;真要落地，更可能是把大模型的本事「蒸馏」进一个小模型，直接在车上跑。&lt;/p&gt;
&lt;p&gt;但在报告的最后，这几个年轻人还是笃定地撂下一句话。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&amp;nbsp;前沿模型已经进步到能在足够低的速度下，在现实中驾驶真实车辆。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;2005年，斯坦福的无人车第一个跑完DARPA沙漠赛道，带队的Sebastian Thrun后来在谷歌一手搭起了无人车项目，也就是今天的Waymo。&lt;/p&gt;
&lt;p&gt;二十多年后，一点点把真车挪进终点车位的，换成了一个没学过开车、平时在对话框里陪你聊天的大模型。&lt;/p&gt;
&lt;p&gt;&lt;span style=&quot;color: #808080;&quot;&gt;本文来源：&lt;a href=&quot;https://mp.weixin.qq.com/s/1O1sqP4VEMQSJOdwdw8Bwg&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;新智元&lt;/a&gt;&lt;/span&gt;&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782542</link><guid isPermaLink="false">3782542</guid><pubDate>Fri, 25 Sep 2026 09:47:48 GMT</pubDate><author>新智元</author><itunes:image href="https://wpimg-wscn.awtmt.com/e40b5202-3fb5-4cca-a18c-0c789a9e2e08.jpeg"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/5f5e64a4-ae92-4bed-b597-614295e4dcff.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:11:24</itunes:duration></item><item><title>6.3%！违约率新高：私募信贷的真正风险是赎回还是再融资？</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;近期私募信贷市场压力再次升温，最直观的信号来自大型基金连续限制投资者赎回。9月以来，摩根士丹利、阿波罗、黑石等头部机构相继披露最新赎回情况：&lt;/p&gt;&lt;p style=&quot;text-align: justify;&quot;&gt;摩根士丹利旗下North Haven私募信贷基金（规模约70亿美元）第三季度收到11.4%的赎回申请，最终仅执行5%的赎回比例，且其中2/3的申请来自此前两个季度未赎回的投资者。阿波罗旗下Apollo Debt Solutions BDC（规模约260亿美元）第三季度收到14.7%的赎回申请，同样将赎回比例限制在5%；黑石旗下规模约770亿美元的BCRED则连续第二个季度限制赎回，在约10%的赎回申请中，仅满足其中约一半的赎回需求；Cliffwater旗舰基金赎回申请约16%，同样仅允许约1/3退出。&lt;/p&gt;&lt;p style=&quot;text-align: justify;&quot;&gt;&lt;img src=&quot;https://wpimg-wscn.awtmt.com/3194949d-e0bd-4ea3-8069-bb9986ba94b9.png&quot; alt=&quot;&quot; title=&quot;&quot; data-wscntype=&quot;image&quot; data-wscnsize=&quot;2449902&quot; data-wscnh=&quot;1274&quot; data-wscnw=&quot;1923&quot; class=&quot;wscnph&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;&lt;p style=&quot;text-align: justify;&quot;&gt;目前整个私募信贷行业赎回请求累计超150亿美元。而惠誉数据显示，截至8月底，美国私募信贷过去12个月违约率升至6.3%，创下该机构追踪该领域以来的最高水平。8月单月共记录14起违约事件，明显高于7月的3起；过去一年89起违约事件中，约47%属于利息支付延期或以实物支付（PIK）代替现金利息的软性违约。&lt;/p&gt;&lt;p style=&quot;text-align: justify;&quot;&gt;商业发展公司（BDC）基金净流出压力也在持续加剧。第二季度BDC基金净流出总额达48亿美元，较Q1的19亿美元显著扩大。从边际变化看，新资金流入的萎缩构成更关键变量：总流入仅26亿美元，环比中位数降幅达66%。这表明，流动性收紧的核心驱动不仅在于投资者赎回，更在于新增资金供给的急剧萎缩。&lt;/p&gt;&lt;p style=&quot;text-align: justify;&quot;&gt;&lt;img src=&quot;https://wpimg-wscn.awtmt.com/c6461858-8038-4201-8f98-7651bfb1de28.png&quot; alt=&quot;&quot; title=&quot;&quot; data-wscntype=&quot;image&quot; data-wscnsize=&quot;484864&quot; data-wscnh=&quot;512&quot; data-wscnw=&quot;947&quot; class=&quot;wscnph&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;&lt;p style=&quot;text-align: justify;&quot;&gt;与此同时，第二季度BDC组合中PIK贷款占比升至10.6%，显著高于7.3%的长期平均水平，其中软件贷款PIK比例更高达14.5%，非应计率亦升至2.2%。受此影响，银行循环信贷额度的未提取比例从37%升至53%。这一变化并非源于资金需求不足，而是PIK贷款占比上升导致抵押品资格受限或预付款率降低，反映底层信用质量恶化正在削弱管理人的借贷能力。&lt;/p&gt;&lt;p style=&quot;text-align: justify;&quot;&gt;&lt;img src=&quot;https://wpimg-wscn.awtmt.com/448a2bde-685f-4762-bfff-dff1beb7d727.png&quot; alt=&quot;&quot; title=&quot;&quot; data-wscntype=&quot;image&quot; data-wscnsize=&quot;578208&quot; data-wscnh=&quot;456&quot; data-wscnw=&quot;1268&quot; class=&quot;wscnph&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;&lt;h2 style=&quot;text-align: left;&quot;&gt;&lt;strong&gt;真正的风险在于信用与流动性相互强化&lt;/strong&gt;&lt;/h2&gt;</description><link>https://wallstreetcn.com/member/articles/3782528</link><guid isPermaLink="false">3782528</guid><pubDate>Fri, 25 Sep 2026 09:44:12 GMT</pubDate></item><item><title>新政后拿下首宗现房销售地块的房企，出现了！</title><description>&lt;p&gt;现房销售新政出台后，全国首宗在出让文件中明确依据新政要求、并顺利成交的现房试点涉宅地块，落地浙江丽水青田县。&lt;/p&gt;
&lt;p&gt;9月23日，青田西娜置业有限公司以底价3.78亿元摘得青田县瓯南区块0104-03-02宅地，成交楼面价仅1992元/平方米，该地块明确要求现房销售。由此，西娜置业成为新政后浙江省首个拿下现房试点地的民营房企。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;值得注意的是，该地块并非纯商品住宅用地，其中安置房占了半壁江山，相当于自带“保底基本盘”，这在一定程度上降低了房企销售去化压力。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;紧随其后，9月24日，厦门迎来新政后首场土拍，2宗涉宅用地全部成交，共收金41.95亿元。其中位于湖里区后埔片区的2026P13地块实行现售，商品住房现售的工程形象进度标准为“完成项目竣工验收，办理房屋首次登记”。最终，该地块被建发旗下公司竞得，成交价35.61亿元，楼面价58148元/平方米，刷新了厦门涉宅用地单价纪录。&lt;/p&gt;
&lt;p&gt;无论是青田还是厦门，两宗现房销售地块均为底价成交，且报名者寥寥，没有竞争溢价。&lt;/p&gt;
&lt;p&gt;“35.61亿元的起拍总价、7.12亿元的竞买保证金，叠加全周期资金占用，对竞买人的自有资金规模和低成本融资能力仍有一定考验。”中指研究院高级分析师孟新增置评道，对房企而言，自有资金购地、竣工后方可销售、主办银行全程跟进，这套组合安排意味着投资逻辑需要相应调整。资金沉淀周期拉长，现金流回正时点后移，不同企业的资金成本差异和运营能力分化，或将进一步显现。&lt;/p&gt;
&lt;h2&gt;两位“尝鲜者”的拿地逻辑&lt;/h2&gt;
&lt;p&gt;从两宗地块的具体条件来看，两位“尝鲜者”的拿地逻辑和面临风险，有着很大不同。&lt;/p&gt;
&lt;p&gt;天眼查显示，青田县现房销售地块的竞得者青田西娜置业，是一家今年5月份新成立的、以从事房地产业为主的企业，其第一大股东杭州盈和瑞尚投资有限公司为杭州小微企业，持股60%；第二大股东丽水正诚企业管理咨询有限公司，同样是一家小微企业，持股40%。&lt;/p&gt;
&lt;p&gt;青田西娜置业属于本土资本搭起来的平台，不属于全国性品牌房企，此前也没有独立操盘商品房、公开拿地的记录。现房销售意味着开发商要扛更长周期的资金压力，为什么是这样一家“新面孔”抢到了这个标志性首单？&lt;/p&gt;
&lt;p&gt;答案或许藏在地块本身。瓯南区块0104-03-02地块，总建筑面积18.975万平方米。出让条件写明，住宅安置面积不少于9.15万平方米，另有超1万平方米安置商业，配套400余个回购车位。安置住宅回购价1400元/平方米，安置商业用房回购价2000元/平方米。&lt;/p&gt;
&lt;p&gt;重点来了：安置房不执行现房销售要求，只有市场化可售商品房，需要等到项目竣工验收、完成不动产首次登记之后，才能对外售卖。这也意味着，安置房仍可按照工程节点结算回购款，这部分回款是锁定的。有这笔稳定现金流托底，大幅缓解了现房模式最让人头疼的资金沉淀压力。再加上土地成本低，给开发商留出了一定的安全缓冲。&lt;/p&gt;
&lt;p&gt;当地一位资深业内人士称，这家新成立公司，本土资本扎根青田县，熟悉当地情况，在征地、村集体协调方面，相比外来大房企沟通起来更顺畅；后续建设大概率会外包给本地总包单位。但风险同样不能忽视：安置回购款是按节点拨付，不是提前一次性到账；市场化可售房源的资金，则要一直压到竣工办证之后才能回笼。拉长的开发周期，会持续产生财务成本。而且地块容积率高达5.0，属于高密度大盘，从施工、质量管控，到综合验收、办理不动产首次登记，整个链条考验不小。对大品牌房企来说，这块地体量不小，但真正市场化商品房货量有限，吸引力不足，最终选择观望。&lt;/p&gt;
&lt;p&gt;建发拿下的厦门湖里区现房销售地块，则是完全不一样的样本：岛内低密改善地块，没有大规模安置回购，考验的是纯市场化条件下房企的资金实力。&lt;/p&gt;
&lt;p&gt;该地块位于湖里区后埔片区，出让面积约5.1万平方米，容积率仅1.2，规划建筑面积约6.12万平方米，是纯商品住宅用地。出让文件要求，土地出让金分两期支付，首期50%在成交后20日内付清，第二期50%可在24个月内付清且不计利息。这个付款条件对现房销售项目而言相当友好，一定程度上缓解了资金沉淀压力。但核心区纯商品住宅、超过5.8万元/平方米的楼面价，加上现房销售带来的回款周期拉长，意味着建发需要对该地块未来的市场承接力和产品溢价能力有足够信心。&lt;/p&gt;
&lt;p&gt;两宗地块，一宗靠安置房锁定基本盘，一宗靠核心区位和宽松付款条件换取空间。不同的解题思路，折射出当前房企面对现房销售新政时，仍在各自寻找最适配的生存策略。&lt;/p&gt;
&lt;h2&gt;“一地一策”，并非一刀切&lt;/h2&gt;
&lt;p&gt;青田同日出让的另一宗现房地块，则延期了。&lt;/p&gt;
&lt;p&gt;9月23日，青田原本计划出让两宗现房销售地块。除了西娜置业摘得的那宗，还有一宗瓯南区块0202-03地块，位于瓯南街道，容积率3.0，规划建筑面积78189平方米，起拍总价9000万元，起始楼面价仅1151元/平方米。该地块同样要求现房销售，且安置房及村级留用地回购房源占比超6成。&lt;/p&gt;
&lt;p&gt;但在9月21日，青田县自然资源和规划局发布终止公告，宣布终止该地块出让。不过终止当天，地块又重新挂牌，拍卖时间定为10月22日，依旧要求实行现房销售。&lt;/p&gt;
&lt;p&gt;同样的区位、同样的现房销售要求、同样有大量安置房托底，为什么一宗顺利成交，另一宗却要延期？官方未披露具体原因，但从结果倒推，问题大概率出在地块本身条件上。&lt;/p&gt;
&lt;p&gt;0202-03地块起始楼面价1151元/平方米，比另一宗成交地块的1992元/平方米低了近一半，看似门槛更低，但容积率3.0意味着产品形态更偏向高层刚需，而青田作为县域市场，刚需去化能力本身有限。当现房销售把回款周期拉长到竣工之后，一块靠市场化销售为主的地块，在县域市场的风险就会被放大。延期一个月重新挂牌，或许是给潜在的竞买人更多时间算账，也或许是在等待更合适的出让时机。&lt;/p&gt;
&lt;p&gt;同样，9月24日厦门挂牌的两宗涉宅用地，一宗位于岛内的核心区低密优质地块明确现房销售要求；而另一宗位于岛外的翔安刘五店普通地块则沿用封顶预售，“项目投入开发建设的资金达到该项工程建设总投资的25%以上，且单体建筑完成主体结构封顶”，最终被国贸联合市政开发拿下。&lt;/p&gt;
&lt;p&gt;由此，也能看出地方推进试点的态度：“一地一策”，审慎推进，优先挑选有回购托底、风险相对可控的地块试水，而不是一刀切铺开。&lt;/p&gt;
&lt;p&gt;泉州首幅现房销售地块，更是“一日游”便遭叫停。&lt;/p&gt;
&lt;p&gt;9月9日，泉州市自然资源和规划局发布公告，计划于9月29日集中出让丰泽区4宗地块，其中丰2026-13号地块位于东海中央活力区，被明确要求实施项目公司制、主办银行制、现房销售制三项基础制度。然而仅一天之后，泉州便发布补充公告，宣布因“地块内可能存在权属争议”终止该地块拍卖出让活动。这反映出，在新政背景下，土地出让时对前期权属等方面的核查要求更为严谨。&lt;/p&gt;
&lt;p&gt;从青田到厦门，现房试点地块接连成交，意味着现房销售正从政策层面加速走向落地。但试点只是开始，现房销售能否大范围推开，仍取决于房企的资金承受能力、融资环境以及市场去化情况。后续走向如何，值得持续观察。&lt;/p&gt;
&lt;p&gt;&lt;span style=&quot;color: #808080;&quot;&gt;本文来源：&lt;a href=&quot;https://mp.weixin.qq.com/s/rSgXPZHZ8Cq39RQWa-72qw&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;中国房地产报&lt;/a&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&amp;nbsp;&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782540</link><guid isPermaLink="false">3782540</guid><pubDate>Fri, 25 Sep 2026 09:19:17 GMT</pubDate><author>中国房地产报</author><itunes:image href="https://wpimg-wscn.awtmt.com/ad954594-efa8-4aa8-a53d-1b8b69aff68f.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/f16af5a2-ff6a-43e4-99cd-62ac6e310eda.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:08:33</itunes:duration><category>房产</category><category>公司</category></item><item><title>10月加息定价过头了？瑞银：核心PCE下修叠加基数效应，美联储不太可能连续加息</title><description>&lt;p&gt;美国国债收益率急升引发市场震荡，但瑞银认为当前市场对美联储紧缩路径的定价过于激进，政策收紧力度或不及预期，整体投资前景依然具有建设性。&lt;/p&gt;
&lt;p&gt;近日，10年期美国国债收益率单日上涨近15个基点，突破5.1%，创2007年以来新高，标普500指数下跌0.8%。这一波动由油价上涨、强劲经济数据以及疲弱的国债拍卖结果共同驱动，联邦基金期货隐含的10月加息概率随之升至70%，较一周前不足50%的水平大幅跳升。&lt;/p&gt;
&lt;p&gt;据追风交易台消息，瑞银首席投资官Mark Haefele及其团队在最新报告中指出，&lt;strong&gt;美联储政策收紧的实际幅度很可能低于当前市场定价所暗示的水平。&lt;/strong&gt;瑞银基准情景为美联储于12月再加息一次后维持利率不变，同时预计核心PCE通胀将于本月经由美国经济分析局年度修订下调0.2个百分点，叠加明年上半年有利的基数效应，连续大幅加息的基础正在削弱。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/54a82c10-85fa-41ca-95b4-8ef735f06817.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;727&quot; data-wscnw=&quot;1102&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;pce&quot;&gt;加息预期或高估，PCE修订成关键变量&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;瑞银认为，尽管近期美联储官员的表态偏鹰派，但市场对紧缩路径的定价已超出基本面所能支撑的程度。报告指出，&lt;strong&gt;美联储政策制定者的利率预测中值显示2027年全年维持利率不变，而核心PCE通胀的向下修订将进一步压缩连续加息的空间。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;具体来看，美国经济分析局即将进行的年度修订预计将把核心PCE通胀下调0.2个百分点，这一数据修正有望缓和市场对通胀顽固性的担忧。与此同时，明年上半年的基数效应同样偏于有利，瑞银预计未来六个月将呈现稳步去通胀态势。上述因素叠加，使得美联储采取长期连续加息的必要性明显下降。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;pmi&quot;&gt;强劲PMI数据为企业盈利提供支撑&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;触发本轮收益率上行的经济数据，在瑞银看来同样具有正面含义。标普全球美国综合PMI闪值9月升至58.4，连续四个月加速扩张，为2021年7月以来最强劲的私营部门活动扩张，印证了美国经济持续稳健运行的判断。&lt;/p&gt;
&lt;p&gt;瑞银认为，&lt;strong&gt;韧性十足的经济活动为企业收入和利润增长提供了有利环境，叠加人工智能投资持续带来的额外推动力，预计标普500指数今年盈利增长25%，2027年增长14%。&lt;/strong&gt;从全球视角看，MSCI全球指数今年盈利增速预测为26%，明年为14%，盈利周期的整体向好应能支撑全球股市在未来6至12个月继续走高。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;e198c06f&quot;&gt;收益率上升为固定收益创造结构性机会&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;瑞银指出，尽管债务规模担忧是本轮债券收益率上行的因素之一，但高债务水平并不自动意味着较差的投资回报，具体影响取决于各国政府的债务管理方式。&lt;/p&gt;
&lt;p&gt;在此背景下，瑞银维持对固定收益资产&quot;具吸引力&quot;的评级，认为较高的初始收益率为投资组合提供了稳健的收入基础。对于注重收益的投资者，短久期债券可有效降低利率风险；与此同时，瑞银也看到中长久期高质量债券以及评级较强的投资级发行人中期信用债的战术性机会，建议投资者把握当前收益率水平布局。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;8393121e&quot;&gt;法德利差走阔，欧元区资产现分化&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;在欧洲市场，法德10年期国债利差周三扩大6个基点至110个基点，为2012年7月以来最高水平，彼时时任欧洲央行行长马里奥·德拉吉曾誓言&quot;不惜一切代价&quot;捍卫欧元。法国10年期国债收益率上涨15个基点至4.66%，涨幅明显高于德国国债。&lt;/p&gt;
&lt;p&gt;瑞银认为，此次利差走阔主要反映市场对法国财政状况及明年总统大选的担忧，而非单纯受全球债券收益率上升拖累。法国财政赤字超过GDP的5%，其2.7万亿欧元政府债务的融资成本大幅攀升，可能导致信用评级进一步下调。目前法国国债收益率甚至高于BBB级意大利国债，显示市场已将其定位为利率敏感型高贝塔资产。尽管如此，瑞银不认为严重财政危机迫在眉睫，并维持对欧元区股市的正面看法，认为经济活动改善和盈利增长可抵消温和上行收益率带来的估值压力。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;10d3423a&quot;&gt;黄金短期承压，中长期配置价值依存&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;黄金承压下跌，跌破4300美元/盎司，报4280美元/盎司左右，过去一个月累计跌幅超过8%。美联储鹰派加息预期及强势美元构成短期阻力。&lt;/p&gt;
&lt;p&gt;对此，瑞银表示，在加息预期及利率&quot;更高更久&quot;的前景下，黄金短期波动性可能进一步加大，但12个月维度内仍持建设性态度。央行持续购金、储备多元化需求、政府债务规模高企以及地缘政治不确定性，均构成黄金的中长期支撑。瑞银将黄金回调至4000美元/盎司附近视为投资者增持的机会，并预测黄金价格将于2027年9月前后升至5400美元/盎司。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782537</link><guid isPermaLink="false">3782537</guid><pubDate>Fri, 25 Sep 2026 08:59:17 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/d2c9d4e5-5283-4318-bbcf-32b39ddfbdcd.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/5ed84447-5fcf-4e5f-83d6-ec5a7fb3c23a.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:05:09</itunes:duration><category>债券</category></item><item><title>瑞银：美企Capex意愿触底反弹，进一步加息对经济冲击或有限</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;美国企业资本开支意愿正在从低位反弹，进一步加息对经济增长的边际拖累或因此低于历史经验。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;瑞银在近期报告中指出，&lt;strong&gt;美国企业投资已经经历较长时间的疲弱，当前资本开支的起点明显低于过去周期。在这一背景下，即使利率继续上升，其对企业投资的新增压制空间也可能有限。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;与此同时，AI投资仍是美国资本开支增长的主要支柱。过去8个季度，AI相关投资同比增长26%；但更值得关注的是，剔除AI因素后，企业资本开支意愿也开始回升，显示投资企稳迹象可能正从科技行业向更广泛的企业部门扩散。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;瑞银认为，&lt;strong&gt;长期低迷积累的维护和更新需求、企业充裕的经营现金流，以及AI需求向其他行业扩散的可能性，都可能为资本开支修复提供支撑。&lt;/strong&gt;这意味着，判断紧缩政策的影响，不能只看利率水平，还要观察企业投资的边际变化。&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;传统投资已持续疲弱，利率冲击空间可能收窄&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;按照美联储FRBUS模型的经验法则，利率每上升100个基点，第一年大致会令经济增长减少60个基点，两年内累计拖累最多可达150个基点。这也是市场评估进一步紧缩影响的重要依据。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;但瑞银指出，&lt;strong&gt;本轮周期的不同之处在于，企业投资并不是从高位进入紧缩阶段。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;过去8个季度，美国私人非住宅固定投资同比平均仅增长0.1%，远低于3.2%的长期均值；住宅投资同比平均下降2.0%，也明显低于2.2%的长期均值。除科技领域外，美国传统投资已经持续疲弱至少两年。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;因此，&lt;strong&gt;在投资本身已处低位的情况下，利率继续上升仍会形成约束，但进一步压低企业支出的空间可能已经缩小。&lt;/strong&gt;FRBUS模型所反映的利率冲击并未失效，只是历史时期较为健康的投资起点与当前情况存在明显差异。&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;非AI资本开支意愿回升，投资出现早期转折&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;AI仍是当前美国资本开支最强劲的增长来源。过去8个季度，AI相关投资同比增长26%，表明美国企业投资并非全面收缩，而是高度集中于AI领域。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;但瑞银观察到，非AI领域的资本开支意愿也开始改善。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;瑞银汇总14项地区联储制造业和服务业调查中的资本开支意愿指标，并取其中位数。该指标在2025年4月之后一度跌至历史第3低百分位，到2026年8月已反弹至第36百分位。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;&lt;strong&gt;这一水平仍然不高，但方向已经发生变化。&lt;/strong&gt;历史数据显示，该指标每上升1个点，约相当于1.2个标准差，通常对应资本开支增速提高约5.5个百分点。虽然意愿不等同于实际支出，但通常会领先于资本开支变化。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;瑞银同时对固定资本投资进行了AI因素剔除，共剔除5类AI相关投资。不过，“非AI”口径中仍可能包含部分AI支出，因此这一变化更适合被理解为&lt;strong&gt;非科技投资出现企稳信号&lt;/strong&gt;，而不能视为AI影响已经被完全排除。&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;更新需求与充裕现金流支撑Capex修复&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;资本开支意愿回升，一个现实原因可能是此前被推迟的维护和更新需求开始释放。非科技投资持续疲弱至少两年后，部分企业可能已难以继续推迟设备和设施更新，因此近期Capex回升未必意味着全面扩张，也可能首先来自必要支出的重新启动。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;企业现金流则提供了资金基础。经营现金流同比增加8250亿美元，增幅达25%；与此同时，除超大规模云服务商（hyperscalers）外，资本开支占经营现金流的比例仍接近历史低位。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;这意味着企业并非缺乏资金，而是此前没有将更多现金流转化为投资支出。&lt;strong&gt;若资本开支意愿继续回升，充裕的内部现金流有望降低企业对外部融资的依赖，减弱高利率对企业投资的直接约束。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;此外，如果AI基础设施、软件和自动化需求继续向非科技行业扩散，资本开支修复可能进一步扩大。当前数据尚不足以证明这一趋势已经全面形成，但非AI投资意愿从历史极低水平反弹，已释放出值得关注的早期信号。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782536</link><guid isPermaLink="false">3782536</guid><pubDate>Fri, 25 Sep 2026 08:34:12 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/62a6807e-6ceb-4437-b09f-2322360f2ec8.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/864f18a1-8743-4f02-b309-ce72caa59bfb.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:04:22</itunes:duration></item><item><title>机构：全球能源需求到2060年或增逾60%，油气仍将长期占据一席之地</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;全球能源需求仍将大幅增长，而能源转型并不意味着传统能源会快速退出，未来数十年油气仍将是全球能源体系的重要组成部分。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;标普全球（S&amp;amp;P Global）最新报告显示，&lt;strong&gt;以巴西、印度、尼日利亚和印度尼西亚等新兴经济体为代表，全球总能源需求到2060年或较当前水平增长逾60%。&lt;/strong&gt;这轮增长主要来自工业化、城镇化和收入提升带来的新增能源需求。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;与此同时，可再生能源正在加速扩张，但煤炭、石油和天然气并不会快速退出。标普全球副董事长Dan Yergin表示，&lt;strong&gt;多种能源将在未来能源体系中共同承担新增需求，油气的存在时间将长于许多人的预期。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;新兴经济体推动全球能源需求持续增长&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;标普全球指出，巴西、印度、尼日利亚、印度尼西亚等新兴经济体正加快工业化和城镇化进程，能源生产和进口需求随之扩大。这些经济体新增的能源消费规模庞大，将成为未来数十年全球能源需求增长的重要来源。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;与此同时，可再生能源正在加快渗透。截至2025年底，非洲、亚洲和拉丁美洲63%的新兴市场太阳能发电占比已经超过美国，巴西、智利、萨尔瓦多、摩洛哥、肯尼亚和纳米比亚等国的清洁能源转型速度尤为突出。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;但能源需求增长并不会随着清洁能源扩张而消失。&lt;strong&gt;对于仍处于工业化和收入提升阶段的经济体而言，电力、交通和工业领域的能源需求仍将持续增加，全球能源消费因此仍将呈现多种能源并存的格局。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;资金与基础设施制约能源转型，油气仍将长期存在&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;可再生能源加速发展的同时，资金和基础设施不足仍是新兴经济体能源转型面临的主要约束。即使清洁能源成本持续下降，大规模建设发电设施、电网和储能系统仍需要巨额前期投资。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;Energy for Growth Hub副执行主任Katie Auth指出，&lt;strong&gt;部分新兴经济体仍面临严重的能源贫困问题，其能源需求增长与经济发展、收入提升和就业创造密切相关。在这一背景下，这些国家很难直接跳过化石燃料阶段。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;能源供应安全也进一步强化了这一现实约束。霍尔木兹海峡关闭引发的油气市场波动，凸显了全球能源体系对传统能源供应的依赖。Dan Yergin表示，煤炭可能获得更多空间，石油和天然气也将在未来能源需求中延续更长时间。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;因此，全球能源转型更可能表现为能源结构逐步调整，而非传统能源快速退出。随着新兴经济体能源需求继续增长，可再生能源份额将不断提升，但在资金、基础设施和能源安全等约束下，油气仍将在较长时期内占据重要位置。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782538</link><guid isPermaLink="false">3782538</guid><pubDate>Fri, 25 Sep 2026 08:01:07 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/05ef0b1d-4b04-4772-8964-e9070c8a8cdd.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/17ec5b19-7694-4837-8cf3-c26e8574d93d.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:02:53</itunes:duration><category>商品</category></item><item><title>医药AI4S：Claude再下一城！赛道持续加热，哪些巨头入局？</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;就在刚刚，Anthropic甩出了新分子生物学实验室的”首个成果“：大模型Claude在噬菌体DNA中，自主发现了一套人类此前从未记录过的全新酶系统！&lt;/p&gt;&lt;p style=&quot;text-align: left;&quot;&gt;&lt;img src=&quot;https://wpimg-wscn.awtmt.com/8857a4a4-cd8f-45f4-b08a-fdd7eec577a6.png&quot; alt=&quot;&quot; title=&quot;&quot; data-wscntype=&quot;image&quot; data-wscnsize=&quot;690084&quot; data-wscnh=&quot;522&quot; data-wscnw=&quot;1322&quot; class=&quot;wscnph&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;&lt;p style=&quot;text-align: left;&quot;&gt;它的结构与上帝手术刀CRISPR高度神似，具备切割、复制、粘贴DNA的特征。在整个发现的过程中，一共动用了950个AI Agent，运行21小时，消耗约2.1亿Token。随后，人类科学家接手审查和实验验证。&lt;/p&gt;&lt;p style=&quot;text-align: left;&quot;&gt;可以说，从今天起，生命科学的科研范式彻底被改写了。&lt;/p&gt;&lt;p style=&quot;text-align: left;&quot;&gt;医药AI4S的加速里程碑，正在向我们走来。&lt;/p&gt;</description><link>https://wallstreetcn.com/member/articles/3782434</link><guid isPermaLink="false">3782434</guid><pubDate>Fri, 25 Sep 2026 07:30:38 GMT</pubDate><category>股票</category></item><item><title>从“AI失控”到全面监管：一场可能改变互联网规则的最坏情景推演</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;围绕“AI失控”的担忧正在演变为一场更广泛的监管讨论。分析人士认为，如果监管逻辑从限制AI风险进一步延伸至身份认证、内容审查和数字基础设施，最终影响的可能不只是AI行业，而是整个互联网的运行规则。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;据OffGuardian作者Kit Knightly分析，当前围绕AI风险展开的讨论，与此前气候变化议题中的部分叙事路径存在相似之处——先强调风险，再推动干预措施，最终可能演变为一套更为严格的监管框架。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;按照这一“最坏情景”推演，监管可能沿着一条逐步扩大的路径推进：&lt;strong&gt;先提高AI服务的使用门槛，通过付费、实名和内容审查加强控制；再以防范AI冒充人类为由，推动“人格证明”机制，将数字身份与更多线上活动绑定；最终，数据中心的能源消耗和碳排放可能成为新的监管切入口，并进一步影响互联网使用成本。&lt;/strong&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;对投资者而言，这意味着开源AI模型可能面临更高的合规门槛，AI基础设施的监管成本或将上升，而大型科技公司凭借资金、技术和合规能力形成的优势可能进一步扩大。与此同时，依赖生成式AI降低运营成本的中小企业，也将面临更大的政策不确定性。&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;付费与实名：AI访问门槛或进一步提高&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;分析认为，潜在的监管措施可能首先体现在AI使用门槛上。免费、匿名访问生成式AI的模式或将受到更多限制，用户未来可能需要付费并完成身份验证，才能使用部分AI服务。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;与此同时，用户提示词（prompt）的记录、审查乃至向政府报告，也可能成为监管框架的一部分。相关措施可能以防范AI生成违法内容为主要理由。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;对开源AI社区而言，冲击可能更加直接。&lt;strong&gt;若模型开发者需要向政府登记、缴费并接受审查，开源生态的开发门槛或将明显提高。&lt;/strong&gt;英国议会目前围绕“社交媒体许可法案”的讨论，也被视为类似监管思路的参照案例。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;如果这些措施同步推进，可能进一步抬高AI开发和运营成本，并强化现有头部企业在资金、技术和合规方面的优势，中小型独立开发者和企业则可能面临更高的进入门槛。&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;“人格证明”：数字身份或成互联网通行证&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;另一条潜在的监管路径，则指向互联网长期存在的匿名性问题。以防范“伪装成人类的流氓AI”为由，监管者可能进一步推动“人格证明”（Proof of Personhood）机制。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;按照这一设想，开设社交媒体账户、进行在线支付、购买托管服务等数字活动，都可能与经过验证的数字身份绑定。Noema Magazine此前也曾警示，随着AI代理在互联网中的规模扩大，平台可能要求用户通过身份验证，以证明其为真实人类。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;&lt;strong&gt;如果这一机制进一步扩展，其影响可能超出AI监管本身。VPN使用、加密货币交易等依赖匿名性的网络活动，也可能面临更严格的身份验证要求，监管理由则可能同样指向“流氓AI”利用匿名网络活动规避追踪的风险。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 style=&quot;text-align: left;&quot;&gt;数据中心税与“碳足迹”：互联网使用成本或上升&lt;/h2&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;更进一步的情景，则涉及对互联网使用本身的约束。相关分析认为，数据中心高耗电、耗水以及碳排放等问题，可能成为推动数字使用成本上升的政策依据，并进一步延伸至普通用户的互联网消费。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;在这一框架下，社交媒体、流媒体、网购和游戏等“非必要互联网流量”，未来可能被纳入类似碳足迹的数字账户管理。流媒体价格上涨、观看时长限制以及“无限流量”套餐成本上升，都可能成为潜在的政策工具。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;对网站运营者而言，&lt;strong&gt;“数据中心税”等措施也可能通过托管成本传导至整个互联网生态，跨境访问甚至可能面临更高成本。&lt;/strong&gt;大型企业由于拥有更强的成本承受能力和合规资源，受到的冲击可能相对有限，而独立媒体和小型网站的运营压力则可能上升。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;&lt;strong&gt;需要强调的是，上述内容目前主要是最坏情景下的推演，并非已经确定的政策路径。&lt;/strong&gt;Kit Knightly也将文章定位为假设性讨论，因此其中部分判断仍存在较大的不确定性。但对市场参与者而言，监管预期本身就可能影响企业决策和估值。开源AI平台、中小型科技企业以及依赖匿名流量的数字媒体，都可能面临潜在的政策风险。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;随着AI能力快速扩张，监管与合规正成为影响行业竞争格局的重要变量。若相关要求持续收紧，合规成本上升可能进一步强化大型企业的竞争优势，并推动互联网规则发生更深层次的变化。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782534</link><guid isPermaLink="false">3782534</guid><pubDate>Fri, 25 Sep 2026 06:33:33 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/ebf20734-a79c-45b5-84af-9e6297f50e80.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/7853370b-afae-4a2a-953f-027c7d64bb7c.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:04:48</itunes:duration></item><item><title>高盛180度转向！日元12个月目标从165上调至150</title><description>&lt;p&gt;日元前景出现重大转折。&lt;strong&gt;高盛集团逆转今年7月确立的看空立场，大幅上调日元目标价，将12个月预测从165上调至150，理由是日本国内政策转向加速及资本回流预期升温。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;高盛策略师Karen Reichgott Fishman在最新报告中同步上调日元三个月及六个月目标，分别由此前水平调整至158和155。她指出，日本央行加快加息步伐以及国内资本回流日本资产的可能性上升，共同构成此次预测大幅修正的核心驱动力。&lt;/p&gt;
&lt;p&gt;受多重利好因素叠加，日元周五一度升至每美元158.28的高位。日本财务大臣片山皋月（Satsuki Katayama）此前透露，美国总统特朗普在与日本首相高市早苗的会面中就日元疲软问题表达了关切，此消息亦对日元形成明显支撑。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/81347e60-b870-4cf5-8fb1-17074497810f.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;733&quot; data-wscnw=&quot;1102&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;1c272015&quot;&gt;政策转向与资本回流：看涨逻辑的双重支柱&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;Fishman在报告中阐述，日本央行加快加息节奏已起到两重效果：&lt;strong&gt;一方面抑制了扩张性财政政策带来的通胀压力，另一方面也相应减轻了日元的贬值压力。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;在资本流动层面，她指出尽管国内资产组合资金回流的趋势目前仍属推测，但这一可能性正在上升，由此在美元兑日元汇率上形成&quot;下行不对称性&quot;（downside asymmetry），增强了日元作为投资组合对冲工具的吸引力。&lt;/p&gt;
&lt;p&gt;&quot;上述种种发展，提升了做多日元的吸引力，尤其是在对冲衰退风险方面。&quot;Fishman写道。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;2b262c0f&quot;&gt;华尔街机构加速向看涨阵营靠拢&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;高盛并非唯一转变立场的主要机构。美国银行此前已将年底日元预测上调至149，方向与高盛一致。两大华尔街机构相继调整预测，显示市场对日元中期走势的主流判断正在发生系统性转变。&lt;/p&gt;
&lt;p&gt;不过，高盛在战术层面维持短期谨慎立场。Fishman表示，该行目前倾向于做空欧元兑日元（EUR/JPY），而非直接做多美元兑日元，这一策略选择反映出其对近期美元走势仍存在一定不确定性的研判。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;fe9d7034&quot;&gt;短期谨慎，长线看涨&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;尽管中长期目标大幅上调，高盛明确表示在近期操作上保持谨慎。这一&quot;战术谨慎、战略看涨&quot;的组合立场，意味着投资者在把握日元升值方向的同时，仍需注意短期波动风险。&lt;/p&gt;
&lt;p&gt;日元目前已从近期低位显著回升，而政策面与外交面的双重利好若持续兑现，或将为日元进一步走强提供支撑。对于将日元纳入对冲配置的全球投资者而言，高盛此次转向释放的信号值得重点关注。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782533</link><guid isPermaLink="false">3782533</guid><pubDate>Fri, 25 Sep 2026 06:20:18 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/bf86b481-0831-4671-894d-9b0fda660885.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/9282ae19-4f97-403c-8122-3b7ce448155e.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:02:38</itunes:duration><category>外汇</category></item><item><title>特朗普：今年访华感受到中国人民的热情好客，希望以同样的热情款待各位；马斯克、黄仁勋、苏世民、奥尔特曼等齐聚欢迎宴会</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;当地时间9月24日晚，国家主席习近平和夫人彭丽媛在白宫出席美国总统特朗普和夫人梅拉尼娅举行的欢迎宴会。特朗普总统发表致辞。&lt;/p&gt;&lt;p style=&quot;text-align: left;&quot;&gt;特朗普说：“习近平主席、彭丽媛女士，以及中国代表团的各位成员，我和梅拉尼娅非常高兴再次在白宫迎接各位的到来。你们都是非常出色、优秀的人。&lt;strong&gt;今年早些时候，我到访北京感受到了中国人民的热情好客。今晚，在你们十多年后再次到访华盛顿之际，我们也希望以同样的热情款待各位。&lt;/strong&gt;”&lt;/p&gt;&lt;p style=&quot;text-align: left;&quot;&gt;&lt;img src=&quot;https://wpimg-wscn.awtmt.com/cf2b925e-de2a-4217-8fb7-2a2b827aa6d2.png&quot; alt=&quot;&quot; title=&quot;&quot; data-wscntype=&quot;image&quot; data-wscnsize=&quot;&quot; data-wscnh=&quot;556&quot; data-wscnw=&quot;972&quot; class=&quot;wscnph&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;&lt;p style=&quot;text-align: left;&quot;&gt;特朗普说：“我邀请大家共同举杯，向习近平主席和彭丽媛女士致敬，并为美中两国之间这份跨越数千英里、绵延数百年的深厚友谊干杯。愿美中两国人民能有一个更和谐、和平与繁荣的未来。”&lt;/p&gt;&lt;p style=&quot;text-align: left;&quot;&gt;中央广播电视总台披露，&lt;strong&gt;马斯克、黄仁勋、苏世民、奥尔特曼等美国工商界人士参加此次宴会。&lt;/strong&gt;&lt;/p&gt;&lt;p style=&quot;text-align: left;&quot;&gt;&lt;span style=&quot;color: rgb(128, 128, 128);&quot;&gt;本文来源：&lt;/span&gt;&lt;a target=&quot;_blank&quot; rel=&quot;noopener&quot; href=&quot;https://mp.weixin.qq.com/s/9XJVH087N3ryFdVFqBk9Wg&quot;&gt;&lt;span style=&quot;color: rgb(128, 128, 128);&quot;&gt;上观新闻综合央视新闻、中国新闻网等报道&lt;/span&gt;&lt;/a&gt;&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782532</link><guid isPermaLink="false">3782532</guid><pubDate>Fri, 25 Sep 2026 05:58:21 GMT</pubDate><author>上观新闻</author><itunes:image href="https://wpimg-wscn.awtmt.com/91b48c41-a2d6-4901-96db-435da10e0c6a.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/c6861341-dcfc-49fe-91f0-a39ba6c41a96.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:01:02</itunes:duration></item><item><title>Codex和Claude Code都跑偏了，前OpenAI研究员称Jev出现前AI世界是个悲剧</title><description>&lt;p&gt;“它会逐渐退到软件背景中，像数据库、正则表达式或其他基础设施一样，成为开发者随手调用的普通能力。”&lt;/p&gt;
&lt;p&gt;这是 TypeSafe CEO、Jev 创始人 Diogo Almeida 对 AI 的设想：当智能真正融入软件，用户甚至不必意识到它的存在。但怎样才能让开发者放心地把判断交给 AI，而不用守在旁边反复检查？&lt;/p&gt;
&lt;p&gt;几个月前，在 AI Engineer 大会的演讲中，这位曾参与 OpenAI InstructGPT 工作的研究者就提出，&lt;strong&gt;“下一个时代并不是 Claude Code时代”。在他看来，Claude Code 与 Codex 本质上仍属于同一个阶段——AI 的主要角色仍然是围绕人提供辅助。他关心的是，为什么 AI 如此聪明，能解决数学界的千禧年难题，却连最基础的活都无法实现自动化工作？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;9 月 22 日，做客 Latent Space 播客接受采访时，Diogo 再次谈起这份不满，措辞更加直接：“在我看来，Jev 出现之前的 AI 世界，简直是个悲剧。”在他看来，问题在于：强大的“智能引擎”已经有了，把它接进实际业务流程的接口却仍然欠缺。&lt;/p&gt;
&lt;p&gt;这一次，他带来了自己的答案——Jev。通过面向校准决策的强化学习（RLCD），团队希望让模型输出可供代码直接使用的选择、评分和概率，让开发者能够依据不确定性设置阈值，决定何时执行、何时交给人处理。&lt;/p&gt;
&lt;p&gt;从参与训练听懂人类指令的模型，到尝试让代码直接调用智能，Diogo 为什么要重新选择训练目标？他又准备如何让 AI 成为像数据库一样普通的软件能力？这场两小时的访谈讲述了他的判断与尝试。&lt;/p&gt;
&lt;p&gt;太长不看版：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Swyx：对于那些可能不太了解情况或者只想得到确切答案的人来说，Jev 到底是什么？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Diogo Almeida：目前最准确的称呼是 System1 模型，它的能力范围远远超出决策本身。这类模型的目标，在于让代码成为模型输出的直接使用者。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Swyx：你对 RLHF 的一个核心看法是：模型的回答会向用户想听的内容，而不是反映它对一件事真正的内部置信度。能具体谈谈吗？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Diogo Almeida：几乎没人注意到 RLHF 的缺点，特别是“模式坍缩”（mode dropping）。RLHF 的模式坍缩会让模型偏向生成更安全、更常见的答案，而牺牲概率分布的真实校准，这既掩盖了长文本中的错误累积，也解释了为什么文本模型不擅长决策。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Swyx：RLCD 与 RLHF 的核心区别是什么？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Diogo Almeida：区别首先在于优化目标：RLHF 侧重让模型遵循人的指令、给出获得认可的回答，RLCD 则希望模型成为软件能够可靠调用的能力。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Swyx：为什么 Jev 不把拒答机制直接放进模型底层？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我不反对安全本身，但我认为不应把特定价值判断直接写进通用模型底层能力，而应像数据库一样划清技术能力与具体使用责任的边界。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Swyx： 你所说的可靠性是什么？开发者能否相信同一个版本的行为保持稳定？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我更重视稳健性：问题含义没变，就不该因为加入无关字符而大幅改变判断，而不只是追求相同输入得到相同输出。已经部署的模型，我们不会悄悄修改，因为 API 是别人程序里的依赖。但我们会快速发布新版本，目前还不能承诺永久维护每个旧版本。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Swyx： 不依赖公开榜单，你们怎样判断模型是否真正做到了更高的性价比？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我们会通过内部评测比较成本和能力，追求同等成本下更强、同等能力下更便宜。我不反对评测，反对的是围绕榜单优化，让分数脱离真实价值。开发者最终还是要把模型放进自己的工作流，测量实际表现，不能只看价格、速度或一个总分。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Swyx：开发者应该怎样组织任务，才能更可靠地使用 Jev？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我建议把复杂任务拆成最小、可以独立判断的语义单元，用结构化输入提供必要信息，再由代码控制最终行为。Choice 对应选择分支，Noul 对应条件判断，Score 对应评分、排序和筛选。每一步都可以单独评估、调整阈值；能力不足时，就转交人工或暂不部署。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Swyx： 对企业开发者来说，Jev 有哪些值得尝试的应用方向？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我们梳理了四类：分析因处理成本太高而闲置的“暗数据”；为实时流程提供快速判断；检查其他模型的调用和输出；把智能判断嵌入软件核心逻辑。我尤其看好暗数据分析和编程 Agent，但具体如何组合模型，仍要看它能否降低成本、解决原本解决不了的问题。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Swyx： 面对前沿 AI 的风险，放慢发展速度是唯一选择吗？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我认为，这种讨论往往默认大家必须沿着现有 RLVR 路线继续加大投入，但研究目标和技术路线都可以重新选择。为了提升表现而给模型多大行动空间，本身就是设计决定，不该被当作不可避免的前提。我更希望探索其他方向，让已有智能可靠地进入软件，自动化实际工作。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Swyx：如果研究者在前沿实验室得不到资源，你会建议他们出来创业吗？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Diogo Almeida：要看为什么离开。如果只是想自由尝试课题，现有实验室可能仍然最合适；如果找到了值得长期投入的新任务，我会支持创业。我不认为漂亮的研究履历会自动创造价值，也不看好拿到资金后重复已有工作的做法。先明确自己的核心目标，再围绕真正值得解决的问题展开研究。&lt;/p&gt;
&lt;h2&gt;1Jev 发布的第一周，创始人的情绪糟糕透了&lt;/h2&gt;
&lt;p&gt;Swyx：欢迎来到录音室。就在本周，我的好朋友 Diogo 发布了 Jev，它几乎占领了社交平台的热点话题。此时此刻，你感觉怎么样？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：情绪上来说，从来没有这么糟过。我现在简直像一具疲惫不堪的行尸走肉，因为同时发生的事情太多了，到处都有问题等着我处理。&lt;/p&gt;
&lt;p&gt;但是，从心理层面来说，那反而完全不一样。我经常讲这件事，并且这几年我在那些大小项目活动里也反复说过，整个 AI 领域就像游乐园里的哈哈镜屋，所有人都像疯了一样。每个人都在说各种奇怪又说不通的话。&lt;/p&gt;
&lt;p&gt;可是就这一周，我好像和现实更合拍了，像是突然之间感受到：“哦，大家终于看见了。”——AI 能做到的事情，远比过去人们想象的多。我们真的可能推动了一场由 AI 驱动的经济革命，这件事重新回到桌面上了，简直实在是太棒了。我特别兴奋的一点，是开发者真的能够理解我们在做什么，这种感觉非常强烈。我也想对这些开发者表达我长久的感激。我对整个开发者社区以及现在发生的一切都特别兴奋，真的太棒了。&lt;/p&gt;
&lt;p&gt;Swyx：你昨天还跟我说，你决定优先去做 town hall，也就是社区公开交流，而不是把时间都花在 VIP 和投资人之类的人身上。因为你希望确保真正得到你最多注意力的，是工程师、开发者这些真正使用产品的人。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：是的。当时确实会有一种感觉，像是“天啊，我现在正在跟一些非常重要的人说话。”我可能不该透露是谁。但对我来说，如果在我那个列满了待聊对象的庞大日程表里，开发者社区竟然不在其中，这对我来说会很不舒服。实际上，如果按照我的理想状态，我会一直和开发者社区在一起交流。我刚才甚至在想，“我要不要一边走来你的演播室，一边开一场社区大会？”后来我又觉得，“不行，这也太疯狂了。”&lt;/p&gt;
&lt;p&gt;Swyx：对于那些可能不太了解情况或者只想得到确切答案的人来说，Jev 到底是什么？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：这个问题其实挺难回答的，但我是这么看这件事的：我们需要一种全新的模型类别。至于这一类别到底叫什么，我们没有执着于某个名字。&lt;/p&gt;
&lt;p&gt;目前我们想到最准确的称呼是 System 1 模型。之所以没有把它称为“决策模型”，是因为 System 1 的能力范围远远超出决策本身。我现在只能说这么多。我们原本没想到这次会成为一次这么受关注的发布，所以手里还有东西没有拿出来。&lt;/p&gt;
&lt;p&gt;Swyx：你们当时就该说这是一次“低调的研究预览”。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：某种程度上确实就是，它其实真的有点像一个研究预览。总之，我们内部有几个词来描述出现的这一类新的模型。比如机器原生模型（machine-native）、System 1 模型、大型可编程模型（large programmable）。&lt;strong&gt;我的理解是，这类模型的目标，在于让代码成为模型输出的直接使用者。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;预训练大语言模型最初面向的是互联网文本补全；经过 RLHF 训练的聊天和指令遵循模型，面向的是文本回复；RLVR 则和 RLHF 之间有一块界限不太清晰的区域。而我们希望这类模型的输出能够直接被代码消费，所以公司才会叫 TypeSafe。&lt;/p&gt;
&lt;p&gt;我们真正想要的，是让 AI 尽可能强大。而我们认为，实现这一点的方式是让它与软件结合。因此，我们设计时考虑的不只是模型外部的使用方式，连模型深层的内部机制也要针对软件进行优化。Jev 是我们的第一个大型可编程模型，也可以叫 System 1 模型，随你称它为什么。它的优化目标是“每美元智能”，Jev 这个名字也由此而来。&lt;/p&gt;
&lt;p&gt;Swyx：Jevons Paradox，杰文斯悖论。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对，就是杰文斯悖论。它的目标是实现性价比最高的智能模型。我特别喜欢跟人讨论，在可靠性、成本、校准和速度之间，到底什么最重要。Jev 这个名字以后会代表一系列站在“每美元智能”方面处于领先地位的前沿模型。当然还有别的优化方向。在机器学习里，至少对于擅长机器学习的人来说，一切都关乎取舍。而我们决定在这个方向上全力以赴。&lt;/p&gt;
&lt;h2&gt;2从模式坍塌到校准失真：RLHF 的另一面&lt;/h2&gt;
&lt;p&gt;Swyx：我觉得“校准”是近来才开始受到关注的一个问题。我们之前请 Hugging Face 的 Clementine Foreia 做过一期节目，当时有聊到了这个话题。这也是你对 RLHF 的一个核心看法：模型的回答会向用户想听的内容，或者最可能出现的内容收拢，而不是反映它对一件事真正的内部置信度。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我听说你们的听众技术背景很强，所以正想深入讲讲这个问题。发布视频里的每一项表述，我都花了很大力气核对，确保准确、真实。显然，这种做法还挺少见。视频里有一点几乎没人注意到，就是 RLHF 的缺点，尤其是“模式坍缩”（mode dropping）。&lt;/p&gt;
&lt;p&gt;Swyx：mode dropping 还是 mode collapse？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：在这里我说的是一回事。以后我想专门写一篇博客，但现在我想尽可能把这件事讲给更多人听。我其实很认同 Yann LeCun 的不少判断。但他有一页很有名、也很有争议的幻灯片，大意是“大语言模型注定行不通”。&lt;/p&gt;
&lt;p&gt;Swyx：你说的是那个“蛋糕”比喻？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：不是，是讲序列长度的那一页。他的推理是：如果生成每一步都有出错概率，文本越长，至少犯一次错的概率就越高。这个推理看起来在数学上很直观，但模型的实际表现并没有简单地照这个趋势发展。我很喜欢拿它来问：数学推导和观察结果之间，差异出在哪里？&lt;/p&gt;
&lt;p&gt;Swyx：问题出在哪里？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：问题在于，如果模型试图覆盖整个分布，或者它的概率分布经过了良好校准，那么它不会因为产生少数离群结果而受到过度惩罚。你会预期它有时生成落在常见分布内的内容，有时生成分布之外的内容；覆盖整个分布，就会出现这种情况。你可以想想生成对抗网络出现之前的图像生成模型：它们生成的图像往往是模糊的。&lt;/p&gt;
&lt;p&gt;而生成对抗网络会模式坍塌：它会直接丢掉占比很小的类别，只生成那些最常见的类别。也正因为如此，前面那个“序列越长错误必然累积到不可用”的效应并没有按最简单的方式出现。为了生成很长、又不容易出现明显错误的文本，模型就得极其保守，因为一旦犯错，人很容易看出来；相反，一个看上去没问题、其实遗漏了微妙之处的回答，就很难被察觉。为了让模型的概率分布保持校准而带来的要求，对文本序列的生成方式会产生很大的影响。这层关系很微妙。我认为，它既解释了为什么那种直观的错误累积推论没有应验，也解释了为什么文本模型不擅长决策：让本来用于生成文本的模型承担过多决策任务，效果往往不好。&lt;/p&gt;
&lt;p&gt;Swyx：既然说到 Yann，你认同他的解决方案吗？也就是用世界模型，比如 JEPA 这一类嵌入模型的方法。问题的一部分似乎在于，我们让模型基于已经输出的词元（token）继续推理，再把输出送回去，反复循环，直到生成完整的一句话。Yann 提出的解法是联合嵌入预测架构（JEPA），你觉得这就是解决办法吗？你对此有什么看法？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我可能不该把机器学习内部的事讲得太细。不过，除了说话有时比较放得开，我做事其实很务实。刚才对模型的判断也是从实际效果出发。&lt;/p&gt;
&lt;p&gt;我是不是 Scaling Law 的支持者？要看它能带来什么。Scaling Law 告诉你：投入一定量的资源，某项能力能提高多少。通常，资源投入要大幅增加，收益却不会同比增长。除非那一点能力提升非常有价值，否则看起来就不是一笔好投资。对我来说，更重要的问题是：用手头已有的资源，我们怎样才能带来最大的实际改变？&lt;/p&gt;
&lt;p&gt;我的出发点始终是实用性。比如 Yann LeCun 的 JEPA 方向，我觉得早期研究很精彩，也很喜欢看到优秀的研究工作。至于它现在是否已经足够实用，我暂时不想下判断。&lt;/p&gt;
&lt;p&gt;目前研究界还有很多没有被充分挖掘的好成果，像未经打磨的钻石。它们没有进一步变成有用的技术，部分原因是大家还没找到适合发挥其价值的任务。&lt;/p&gt;
&lt;p&gt;Jev 的发布当然对 TypeSafe 有利，但我希望它带来的影响不止于此。一方面，开发者可能会基于 Jev 做出大量新软件；另一方面，也会有人沿着不同方向探索：还能用什么方式把模型能力提供给程序，让软件做出更多以前做不到的事。如果这些尝试同时出现，那种感觉就有点像早期互联网那种充满活力的氛围——大家纷纷探索，新的用法不断冒出来。我想这也是为什么推特上大家一提到“Jev”，就像在开派对一样。&lt;/p&gt;
&lt;p&gt;Swyx：这很让人振奋，因为它和我们习惯听到的说法太不一样了。过去常有人说：“抱歉，这件事你做不了。模型研发要遵循缩放规律，只有大实验室才有资源参与。”&lt;/p&gt;
&lt;h2&gt;3Jev 的开发理念：AI 做决定时，不能突然拒答&lt;/h2&gt;
&lt;p&gt;Diogo Almeida：Discord 上经常有人问我：为什么反对安全对齐，为什么 Jev 不会拒答？我还没来得及完整解释。先说清楚，我并不反对安全本身。我认为，常见的安全对齐方式往往与使用者的目标不一致；而对供程序调用的模型来说，突然返回一句拒绝，简直像是发生了类型错误。&lt;/p&gt;
&lt;p&gt;如果你是人在和聊天机器人互动，或者用编程工具时碰到“抱歉，我不能读取 DNA.py”，当然会觉得烦，但至少你能看见它、换个办法继续。大家用久了，甚至习惯了处理这种情况。可如果模型是后台运行的软件依赖，某次调用突然拒绝了，会发生什么？调用它的用户可能根本不知道底下还有这个模型。难道只因为输入里出现一条特殊消息，就让整个软件流程随机中断吗？&lt;/p&gt;
&lt;p&gt;我认为，这种设计沿用了“AI 是一个聊天同事”的想象，没有充分考虑模型作为软件组件时需要满足什么要求。&lt;/p&gt;
&lt;p&gt;Swyx：你想要的是一种能在各种地方使用的基础能力。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对，一个足够通用的“认知核心”。它要能适应未来各种我们现在想不到的用例。用户已经拿 Jev 做了不少出乎意料的东西，我们当然没针对那些具体应用训练过它。不过，这并不让我意外；我们训练时就让它处理过更多样的情况。&lt;/p&gt;
&lt;p&gt;再回到安全对齐。我认为，对 ChatGPT、Claude 这种直接面向人的产品，设置安全规则是可以理解的。但需要区分能力对齐和安全对齐：能力对齐是让系统尽可能按使用者的要求完成任务。软件工程师很需要这一点——行为越可预测，越容易把模型集成进程序，也越少需要反复试探。&lt;/p&gt;
&lt;p&gt;Jev 现在离理想状态还很远。我们希望把可靠性再提高几个数量级，最终让调用智能像执行数据库查询一样自然：需要时调用，不必每次都担心它会怎样回应。&lt;/p&gt;
&lt;p&gt;而我所说的安全对齐，往往意味着模型除了遵循当前使用者的指令，还要优先服从模型提供方——比如 OpenAI 或 Anthropic——设定的另一套规则。这两套要求有时会发生冲突。&lt;/p&gt;
&lt;p&gt;Swyx：你说的是不同层级的规则和价值取舍。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。对于直接面向用户的产品，这样做有道理。比如 ChatGPT 的提供方不希望产品支持某些成人角色扮演内容，那是他们的选择，也可能符合他们面向家庭用户的产品定位。&lt;/p&gt;
&lt;p&gt;但 API 不一样。开发者需要根据接口的行为来写程序。如果模型在程序运行过程中突然按提供方的另一套规则拒绝执行，开发者很难处理。我对此确实有点激动，得让自己冷静一下。&lt;/p&gt;
&lt;p&gt;Swyx：大家能感受到你很在意这件事。不过我想提出一个更严肃的反例：如果有人用这个 API 来杀人呢？成人内容或许属于私人选择，但 AI 也可能被用于战争。公司完全可以合理地决定，不希望自己的 API 被用于这类用途。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我理解。企业可以出于实际考虑持有这种立场。我自己也不希望我们的技术被用来伤害人，当然希望它更多地用于有益的事情，也愿意为此作出努力。但我不认为应该把这些偏好直接写进通用技术的底层能力。&lt;/p&gt;
&lt;p&gt;我的顾虑是，每当你为了某一种特定规则，强行让模型在某些问题上改变判断，就可能进一步割裂它的能力。现在的模型已经有不少这样的不一致了。&lt;/p&gt;
&lt;p&gt;我更倾向于把智能看作数据库，而不是一位“AI 同事”。我们通常不会要求数据库在执行查询时，自行判断用户最终会不会把结果用于坏事。我认为，对通用智能接口也应该考虑类似的责任边界。&lt;/p&gt;
&lt;p&gt;还有一件事让我觉得奇怪：有开发者在 Slack 上告诉我们准备部署某个应用，问“我们可以这样用 Jev 吗？”我的第一反应是：我们提供的是 API，你是开发者，具体应用怎么设计，不该事事由我们批准。理想情况下，复杂任务会被拆成许多较小的调用；作为底层服务提供方，我们甚至不应该知道下游用户的完整任务是什么。这种边界能给软件工程师更大的自主空间。&lt;/p&gt;
&lt;p&gt;我希望他们把能力用于好的事情。我们也讨论过开源、公益支持等办法，只是眼下还没精力落实。但只要由我负责，我就不希望把这些价值偏好直接固化进模型的底层判断里。&lt;/p&gt;
&lt;p&gt;Swyx：既然说到平台与开发者的关系，也想澄清一下你们的隐私条款和使用条款。之前有些人产生了误解，觉得你们对 API 用途限制得很严。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我不确定你具体指哪一条，不过我看到过一些关于基准测试的讨论。&lt;/p&gt;
&lt;p&gt;Swyx：对。你之前公开说过，相关限制是预览期条款里留下的，正式发布时没有及时移除，团队准备修改。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：团队有些进展我甚至还没跟上。我请他们和律师确认这件事。我们显然不打算阻止用户测试和比较模型；恰恰相反，我支持他们这么做。&lt;/p&gt;
&lt;p&gt;但这和我怎么看公开基准榜单是两回事。我非常不喜欢公开榜单。至于用某些内部基准作为实际能力的替代指标，我的态度也比较审慎。&lt;/p&gt;
&lt;p&gt;Swyx：你担心的是榜单很快饱和，还是模型可能见过公开测试题，因此容易刷分？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：刷分容易，是原因之一。假设两年后，市场上有很多公司在做与 Jev 类似的产品，我们提供的价值可以说是“每美元获得多少智能”，或者“每秒获得多少智能”。大家很容易盯着价格和速度，因为它们好测量。但价格和等待时间是用户付出的成本，用户真正想得到的是有用的智能。&lt;/p&gt;
&lt;p&gt;难就难在，模型到底有多好，有些部分很难用一个分数概括。Jev 发布后，开发者亲自试用产生的反应，甚至比发布视频更让我在意。他们感受到模型在实际使用中的表现，也感受到我们为此下了多少功夫。&lt;/p&gt;
&lt;p&gt;公开基准想用数字帮助大家建立信任，但它太容易被针对性优化。即使团队主观上不想刷榜，也可能不断收集与测试集相似的数据，让模型在榜单上表现更好。过去有些实验室收集类似 MMLU 的题目来训练，在我看来，这不过是绕了几步优化基准成绩。&lt;/p&gt;
&lt;p&gt;所以我认为，开发者可以先凭实际体验建立初步判断，随后必须把模型放进自己的工作流，测量它在那个具体任务上的表现。我们的工作则是持续提高可靠性，让它越来越值得信任。可靠性始终是 TypeSafe 要解决的问题；如果只想尽早发布一个能力不够好的版本，我们一年半前就可以推出 Jev 了。&lt;/p&gt;
&lt;h2&gt;4“最苦涩的教训”：先选对任务，再谈模型和数据&lt;/h2&gt;
&lt;p&gt;Swyx：你前面提到自己的“最苦涩的教训”（The Bitterest Lesson），我们来展开讲讲。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：Sutton 的“苦涩的教训”强调算法和计算的重要性。但在我看来，数据比算力重要得多；而最难、也最重要的，是先选对任务，找到研究的 North Star（核心目标）。&lt;/p&gt;
&lt;p&gt;大语言模型的发展中，研究目标发生过几次这样的转变。RLHF 把重点转向指令遵循，当时没人意识到模型能在这件事上做到那种程度。RLVR 又把方向往前推了一步。现在，我们用 RLCD 定义了另一个任务：让程序能够把模型放进运行流程，可靠地调用它的判断。数据对此至关重要。我怎么强调都不为过。&lt;/p&gt;
&lt;p&gt;Swyx：所以你们更愿意把 TypeSafe 称为一家“数据实验室”，而不是“模型实验室”？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：完全正确。我们会一直非常重视数据。对我来说，模型能力的提升，很大程度上就是数据问题。数据工作极其复杂，却也能把可靠性一位一位地往上推。数据选取和处理方式稍有变化，结果就可能大不一样。&lt;/p&gt;
&lt;p&gt;Swyx：你们也在大量招聘数据人才。怎样才算优秀的数据工作者？你说过你们使用合成数据，但“数据是合成的”显然只说到了表面。是不是还要有人认真检查这些数据，指出问题，再回去重新生成？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：是，但完整回答会复杂得多。我给新入职的数据同事做的培训，可能比这期播客还长。这里先讲最重要的几层意思。&lt;/p&gt;
&lt;p&gt;首先，任务决定数据的形态。RLVR 需要的数据在某种程度上是供模型探索的环境；RLHF 需要人类反馈。每种任务都有自己的数据形式，我们也一样。所以我们做的合成数据，并不是一个通用模板生成出来的东西。&lt;/p&gt;
&lt;p&gt;其次，我们不想用用户数据训练模型，即使取得许可、技术上也做得到，我们仍不想依赖它。真实世界的数据有很强的偏向：很多人反复提出相似问题，需求呈现幂律分布。直接按这些数据训练，模型容易对高频场景过拟合，其他能力反而变得不均匀。&lt;/p&gt;
&lt;p&gt;我们瞄准的是多年后的应用。到那时，模型也许会成为深入软件技术栈各层的通用基础设施，支撑今天还没人想到的产品。如果打个比方，可以把一般的大语言模型想成 UDP，把我们的模型想成 TCP：开发者能在上面构建各式各样的应用。即使我们拿到了今天所有用户数据，它也只能让模型更适应今天，未必能帮助开发者做出未来的软件。&lt;/p&gt;
&lt;p&gt;因此，数据团队的工作有点像艺术创作。他们研究模型的“认知核心”，找出能力不平整、不稳定的地方，再有针对性地处理。我们认为自己的模型在这方面已经相对平滑，但不可能做到完美。一次修正最好能改善一类问题，在过去、现在和未来不同情境下都有效，而不只是修好某一道题。&lt;/p&gt;
&lt;p&gt;Swyx：解决普遍问题，而不是只解决一个具体案例。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：正是这样。每次做到这一点，都需要很强的判断力。&lt;/p&gt;
&lt;h2&gt;5“Jev 出现之前的 AI 世界，是个悲剧”&lt;/h2&gt;
&lt;p&gt;Swyx：你刚才说，我理解数据的方式受 RLVR 影响很深，这个批评挺公允的。那我们具体聊聊 RLCD。你们目前还没有发表介绍它的论文，对吗？在不了解技术细节的情况下，大家怎样判断 RLCD 确实代表一种不同的方向，而不只是一个新造的术语？“校准”这个概念我能理解，但 RLCD 与大家熟悉的 RLHF 究竟有什么区别？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：还没有发表论文。你的问题很好，不过要回答它，我想先反问一句：RLHF 指的是什么？&lt;/p&gt;
&lt;p&gt;这个词在不同时期指过好几种工作。最早有通过人类偏好反馈，让系统学会完成难以精确规定的任务的研究。我记得有一项工作涉及教机器人做后空翻，可能与 Paul Christiano 等人的研究有关，但具体是哪篇，我也不能完全确定。PPO 是一种算法，并不天然意味着奖励一定来自人类反馈。&lt;/p&gt;
&lt;p&gt;后来 OpenAI 做了“学习摘要”的工作，把 PPO 用在语言模型上，让模型学习完成摘要这类很难用简单规则规定好坏的任务。人们也会把这称为 RLHF，不过我没有参与那篇论文。&lt;/p&gt;
&lt;p&gt;但当我说 RLHF 时，我更想强调的是指令遵循这个任务，而不是某篇论文采用了 PPO。真正重要的，是研究者确定了一个新的 North Star：让模型理解并遵循人的指令，是一个值得持续优化的方向。今天的 DPO 及其后续方法即使没有使用那篇论文里的算法，也仍是在做这个意义上的 RLHF。&lt;/p&gt;
&lt;p&gt;同样，RLCD 对我们来说是在提出一个新的任务目标。我使用这个名字，是想准确说明我们在优化什么：让 AI 能被程序调用，成为软件可以使用的能力。&lt;/p&gt;
&lt;p&gt;Swyx：也就是说，关键词是“可编程的 AI”：让程序能够在不需要人每一步介入的情况下使用模型，进而自动化更多工作。我理解你的 North Star 对吗？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对，但还要加一个前提：必须务实。我们得看清当前语言模型实际擅长什么。有些面向程序的新输出类型在概念上可能很棒；如果技术还不足以让它可靠工作，暂时不推出，也没什么可遗憾的。&lt;/p&gt;
&lt;p&gt;在我看来，Jev 出现之前的 AI 世界，简直是个悲剧。这话听起来很狂妄，但这个想法在我创办公司很久以前就有了。&lt;/p&gt;
&lt;p&gt;Swyx：这点我可以作证。你已经谈了好几年。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：是。我起初以为做出一个能供程序调用的模型不会太难，整个项目一周就能完成。事实证明我错得离谱。以前我甚至觉得：“这个问题我马上就能解决。”现在想来，我得向当时被我低估的 OpenAI 同事道歉。&lt;/p&gt;
&lt;p&gt;AI 领域还有另一件令人遗憾的事：承诺很大，实际交付却跟不上。我认为 RLHF 和 RLVR 路线都存在这个问题。但让我一直放不下的，是 AI 明明已经表现出很强的能力，却仍有大量简单工作无法自动化。&lt;/p&gt;
&lt;p&gt;我在演讲时常问：为什么 AI 能处理极其困难的数学问题，却连许多基础、重复的工作都接不过去？这些工作不要求人有多高的智力，也谈不上令人满足，但现实中仍得有人做，因为软件还没法可靠地把它们自动化。我们已经有了一台很强的“智能引擎”，却缺少合适的接口，把它接进那些有经济价值的流程。&lt;/p&gt;
&lt;p&gt;即使有一天 TypeSafe 不复存在，这个方向也已经被打开。别人也许需要一两年追上来，也可能更快；如果模型质量的差异持续重要，我们会有更长时间的优势。但比公司竞争更重要的是，整个领域开始探索：智能还可以怎样接入软件。我相信这会改变技术接下来的发展路径。&lt;/p&gt;
&lt;p&gt;Swyx：我完全同意。你们真正创造的是一种新的可能性。我试着替你概括一下，方便大家理解：不要把 TypeSafe 和 Jev 的成功看成仅仅是“出现了一种新的模型类型，我可能可以继续沿用之前的路径去做事”。不是这样，实际上，可能还有好几种别的模型类型值得探索，这个行业应当是百花齐放的态势，应该让各种尝试奋都发展家里。其中有些方向，你们大概也会亲自去做。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：完全正确。那种早期互联网的活力又回来了。我觉得我们重新回到了某种技术乌托邦时刻，再也不用像以前那样感慨：“唉，有时候我的编程智能体能工作，但真正最好的东西都被公司内部藏起来了”。创造新东西又成了一种真实的可能。当然，接下来会是一个相当疯狂的世界，大家最好坐稳了。我对此兴奋极了。&lt;/p&gt;
&lt;p&gt;Swyx：现在你们有了资金，也有了发布后的势头，终于能把想法做出来给大家看。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。以前一直讲，却不能把最关键的东西拿出来，感觉像总在吊大家胃口。我的演讲尤其如此：我说 AI 应该推动自动化，却没法展示它具体怎样做到。你之前看过我们的宣言，还说有些地方写得太模糊：“第一步是什么？你们说的智能模型究竟是什么？”&lt;/p&gt;
&lt;p&gt;Swyx：我当时问你模型在哪里，你只说“快有了”。我主要对“可组合”这个词有意见，不过“Build Prod, Not God”这句口号很好。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：谢谢。团队很认同这句口号。我们对正在做的事很兴奋，但大家也很务实。&lt;/p&gt;
&lt;p&gt;Swyx：宣言里还有一份“秘密总体计划”，讲怎样一步步构建面向机器、可组合的 AI。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：写成“秘密总体计划”是你的建议，我得正式把功劳记给你。&lt;/p&gt;
&lt;p&gt;Swyx：谢谢。不过你当时只给我看了一半故事，没有告诉我还要发布模型。那时候也没有《Doom》演示，没有性能数字，我自然会问：你们到底打算拿什么证明它？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：问题是，我不相信公开基准榜单能证明这件事。模型好不好，最终得让人放进实际任务里体验。这种做法有助于建立长期信任，但也让我们吃过苦头。去年融资时，很多人不相信我们，只想看基准测试成绩。我们不愿意为了拿出好看的数字，去迎合一套容易奖励刷榜行为的评价方式。&lt;/p&gt;
&lt;p&gt;Swyx：选择这条更难的路，最后也让你建成了一家自己愿意待的公司。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：是。我不太后悔这个选择。昨晚聊到为什么离开 OpenAI，我还挺激动的。发布前，我常这样想：如果 AI 最终因为承诺过多、实际交付不足而进入新一轮低谷，而我没有尽力探索另一条路，我会觉得自己也有责任。一方面，我参与过 RLHF 这条路线；另一方面，我相信让 AI 真正进入软件自动化，能创造很大的价值。&lt;/p&gt;
&lt;p&gt;发布后，我对这件事的说法有些变化。至少在我看来，自己担心的那种“AI 寒冬”已经不那么不可避免了。Jev 上线还不到一周，我已经看到开发者把它用在真实工作中。眼下就像西部拓荒时期一样，充满了未知，各种尝试都在冒出来。&lt;/p&gt;
&lt;h2&gt;6爆红之后，Jev 更在意什么&lt;/h2&gt;
&lt;p&gt;Swyx：能不能分享一些发布之后的具体数据？例如注册的用户数量之类的。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：具体数字主要是团队在跟进，而且每天都在变。不过有一个里程碑我记得很清楚：日调用量已经超过一万亿 Token。这不是发布当天大家尝鲜带来的短暂高峰。夜里调用也没有停下来，说明有程序在持续使用 Jev，而不只是人在界面里试几次。这让我特别兴奋。&lt;/p&gt;
&lt;p&gt;相比之下，我没那么在意注册人数。我们发布时没有专职营销人员，大家看到的宣传基本就是团队自己的表达。候补名单一度增长很快，我们也在不断放人进来。平台团队承受住了这次发布带来的流量，做得非常出色。&lt;/p&gt;
&lt;p&gt;但我们后来意识到：对开发者平台来说，候补名单上的人数并不能说明多少问题。其中可能有不少人不是开发者。他们进来试了几个问题，发现 Jev 不是聊天机器人，就会疑惑：“我的下一个 ChatGPT 在哪里？”我还没有精确计算过，不过我的直觉是：哪怕全世界每个人都来试几次，调用量可能还不如一个真正用它创造价值的开发者写下的一段循环程序。&lt;/p&gt;
&lt;p&gt;我们起初以为，放多少人进入候补名单需要非常谨慎。后来发现，更紧张的是速率限制：开发者一旦把 Jev 用进程序，获得了实际价值，就会希望大幅提高调用额度。软件就是这样运行的——先花时间定义一个重复任务，之后让它持续执行；只要创造的价值超过最初投入，就可以把它放到后台，再让其他功能依赖它。&lt;/p&gt;
&lt;p&gt;Swyx：设置好，让它自己运行。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。之后开发者还能在这些能力之上构建更复杂的东西。许多早期互联网的创造，正是通过不同软件能力的组合才发生的。虽然你不喜欢“可组合”这个词，我仍想在宣言里强调它：我们希望 Jev 成为催化剂，让开发者做出连我们也没预料到的应用。为此，我愿意继续在 Discord、公开交流和播客里跟他们沟通，哪怕要在直播里套个垃圾袋出镜。&lt;/p&gt;
&lt;p&gt;Swyx：长访谈也有这个好处。我们可以越过发布初期比较表面的讨论，让人理解你们究竟想做什么。认同这个方向的人，也许会加入团队，或者“买下你们”——抱歉，我是说成为客户。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：哦，作为客户（笑）。&lt;/p&gt;
&lt;p&gt;Swyx：对，作为客户。发布视频也确实很受关注，刚才看到是 3600 万次播放。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：现在到 3800 万了。&lt;/p&gt;
&lt;p&gt;Swyx：如果只看 2026 年新兴 AI 实验室的发布声量，你们可能排在最前面。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：谢谢，不过我不太在意“新兴 AI 实验室”这个标签。我们还有周边专门拿它开玩笑，比如“你最喜欢的新兴实验室最喜欢的新兴实验室”，以及“有产品的新兴实验室”。&lt;/p&gt;
&lt;p&gt;我真正想做的是一个可靠的开发者平台。希望发布热度过去之后，开发者仍能长期依赖它、信任它。&lt;/p&gt;
&lt;h2&gt;7模型不能说变就变：Jev 如何兑现“可靠”？&lt;/h2&gt;
&lt;p&gt;Swyx：你们一直强调可靠性。我原以为主要指 RLCD 里的概率校准，但看下来，它也包括服务可用性、扩展能力，以及常说的“几个 9”，对吗？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：那些都是可靠性的一部分。但模型的判断本身也要可靠：它能不能持续完成你希望它做的事？现在的大型推理模型很聪明，可在我看来，仍有不少任务是它们看起来足够聪明、企业也有动力自动化，最后却不敢交给它们做，因为结果还不够稳定。我们离理想状态也有很长的路要走。&lt;/p&gt;
&lt;p&gt;我想先把容易的工作自动化，再去处理难的工作。我的目标是，有一天开发者需要一处智能判断时，可以像写数据库查询一样，直接在程序里写一个类型安全的 System 1 调用，让程序准确地走向相应分支，而不必每次都先试探模型能否胜任。这会是一个漫长的过程。&lt;/p&gt;
&lt;p&gt;Swyx：说到可靠性，我注意到 API 里没有随机种子（seed）参数。同样的输入，每次都会得到同样的输出吗？如果不会，为什么？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：这是个好问题。“可靠性”其实是一个总称。AI 无法自动化某件事，可能是输出不符合类型要求，可能是结果不确定，也可能是能力分布不均匀。你问的确定性，指相同输入得到相同输出；它对单元测试等场景可能有价值，但我不认为它应该是首要目标。&lt;/p&gt;
&lt;p&gt;我更重视稳健性：语义相近的输入，应该得到相近的判断。大语言模型在这一点上有时很不可靠。我们的一个测试办法，是在提示词里加入不同的 UUID 作为随机标记。问题的实际含义没有变，只是多了一个无关的字符串；模型的判断就不该因此大幅变化。开发者在让 AI 做决定时，常常会被这种细微变化导致的结果波动坑到。&lt;/p&gt;
&lt;p&gt;当然，我们也可以做确定性模型。如果开发者能告诉我们它在哪些场景确实重要，我们愿意考虑。但确定性可能需要在成本与能力之间作取舍。我们一直努力站在“每美元智能”的帕累托前沿，为此尝试了很多不那么常规的模型组合与工程方法。&lt;/p&gt;
&lt;p&gt;Swyx：所以，回到最初的问题：将来会不会提供随机种子或确定性模式？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：有可能。只要需求足够明确，而且我们没有被 GPU 资源严重卡住，就可以做。只是按我们目前的判断，它可能降低每美元能提供的有效智能。&lt;/p&gt;
&lt;p&gt;Swyx：从 OpenAI 和 Anthropic 的发展过程看，我猜开发者迟早会要求这个功能。即使你告诉他们稳健性更重要，他们可能还是会想要确定性。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：那就看后面会怎样吧。有人说我们品牌的一部分是“立场坚定”，其实就是委婉地说我固执。&lt;/p&gt;
&lt;p&gt;Swyx：但我以前和你争论过。证据充分时，你也会改变原先的判断。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：是，你在开发者需求方面说对过很多次。这一点我认。不过，我怀疑我们会在很长一段时间里受到 GPU 供给限制。如果一种方案提供同等智能却消耗更多 GPU，我们就更难让更多人用上它。我们当然希望服务企业，但眼下更想让尽可能多的开发者拿到 Jev，去实验、去做那些出乎意料的东西，让这个方向真正热闹起来。&lt;/p&gt;
&lt;p&gt;Swyx：这种探索已经开始了。不过我想提醒你一个开发者可能会担心的问题：你说会尽一切办法提高“每美元智能”，又面临 GPU 限制，大家可能会猜，你们会不会在发布后把模型进一步量化，以节省显存或带宽，却让同一个模型的质量下降？&lt;/p&gt;
&lt;p&gt;你现在不一定要作承诺，但至少应该考虑明确告诉开发者：已经发布的模型，其质量和行为会不会保持稳定。过去有些 API 虽然模型名称没变，背后的模型却变了。你们现在有版本号，这是好事；还可以进一步说明，同一个版本上线后是否会保持不变。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：已经部署的模型，我们不会悄悄改动。对开发者来说，那太离谱了。直接面向用户的产品可以持续调整背后的模型，只要产品体验变好就行；但 API 是别人程序中的依赖，不能按同样的方式处理。&lt;/p&gt;
&lt;p&gt;不过，我们更新模型的速度可能会比大家习惯的快得多。我们会不断发布新版本，也暂时不能承诺每个旧版本都有长期支持，因为还有很多改进要做。眼下有不少人在使用 Jev 1.13.0，我们可能会暂时把它作为长期支持版本；我知道开发者不愿意看到依赖突然失效。&lt;/p&gt;
&lt;p&gt;另一方面，如果每发布一个版本就永久保留，推理服务可能要同时运行大量不同模型，这也会给所有人带来负担。&lt;/p&gt;
&lt;p&gt;Swyx：更新快的话，可能很快就有上百个版本要维护。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：正是如此。我们希望将来找到比简单保留某个长期支持版本更好的办法，团队正在研究。我认为那会对开发者很有帮助，但现在还不能把尚未实现的方案当成承诺。&lt;/p&gt;
&lt;p&gt;可以确定的是，我们会继续推出能力更强的新模型。按我的观察，Jev 在相邻版本之间的行为差异，通常甚至小于一些生成文本的模型对同一个请求调用两次产生的差异。但如果我们解决了模型能力中某个明显不稳定的部分，新旧版本之间就可能出现很大的变化。&lt;/p&gt;
&lt;h2&gt;8不追 Benchmark，追极致的“每美元智能”&lt;/h2&gt;
&lt;p&gt;Swyx：模型有了长期支持版本（LTS），还有一个好处：你们可以把同一个版本移植到其他芯片平台上运行。不知道你们有没有考虑过这件事。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：暂时不评论。我更关心的是“每美元能获得多少智能”。&lt;/p&gt;
&lt;p&gt;Swyx：但速度也重要。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：这要看后续情况。&lt;/p&gt;
&lt;p&gt;Swyx：过去一年，推理技术路线发展得很快。比如，把模型放到 Cerebras、Etched 这类芯片上运行，速度可能会有大幅提升。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。“每秒能获得多少智能”是另一个衡量指标。我们内部甚至讨论过把成本和时间放在一起衡量，比如“每美元、每秒能获得多少智能”。&lt;/p&gt;
&lt;p&gt;对于 Jev 系列模型，我在内部反复强调的一点是：模型变得更聪明当然好，但它必须处在帕累托前沿。也就是说，在同等成本下，它要尽可能强；达到同等能力，成本要尽可能低。这就是 Jev 的定位：把每美元获得的智能做到最好。&lt;/p&gt;
&lt;p&gt;至于每秒能获得多少智能，还要继续看。这个方向很有意思，我也知道有不少行业高度依赖实时响应。对它们来说，速度的提升直接对应着很大的经济价值。我当然希望两个指标都能做好，也希望从市场和用户的反馈中判断，究竟该把重心放在哪里。&lt;/p&gt;
&lt;p&gt;Swyx：而且速度不只关系到实时场景，也关系到规模。到了足够大的调用量，哪怕每次只差几微秒，乘上数十亿、数万亿次，也会变得很可观。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：如果是大型数据库 MapReduce 查询这类后台任务，延迟可能没有成本那么重要。这也是 Jev 的定位：尽可能提高每美元所能获得的智能。至于“每秒智能”，还要继续看。我很喜欢那些对速度要求极高的应用场景，也知道对一些高度依赖实时响应的行业来说，速度提升能带来很大的经济价值。这方面的需求正在增长，很有意思，但我不认为它会成为 Jev 的主要方向。&lt;/p&gt;
&lt;p&gt;Swyx：说到“更快、更便宜”，其他模型通常给出的取舍是速度更快，但价格也更高。我在想，Jev 之所以受到关注，一个原因是你们做到了更快、同时更便宜。这一块目前选择不多，前提当然是模型的智能水平大致保持不变。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：“智能水平保持不变”这句话很关键。难就难在这里。&lt;/p&gt;
&lt;p&gt;Swyx：但你似乎不太认可公开基准测试，或者至少不喜欢用现有的公开基准来证明这一点。你们内部总得有一套判断方法吧？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：当然。我们有自己的内部评测。不过，要避免团队有意无意地针对评测做优化，需要很强的自律；这件事必须得到最高优先级的重视。&lt;/p&gt;
&lt;p&gt;否则，我们凭什么说自己的模型处于“每美元智能”的帕累托前沿？我们不是凭感觉做决策。尝试不同方案时，成本和能力都会变，我们会测量、比较，把结果放在一起看，判断哪种方案对用户最好。&lt;/p&gt;
&lt;p&gt;所以，我并不反对评测。我担心的是，一旦掺入其他激励，评测就可能变得很危险。在这件事上我管得很严。同事们也许会觉得我在很多事情上都管得严，但对我来说，不能在模型到底有多聪明这件事上自欺欺人，这一点尤其重要。我们得诚实地追求事实。&lt;/p&gt;
&lt;p&gt;Swyx：同意。接下来我想聊聊 API 设计上的一些具体选择。&lt;/p&gt;
&lt;h2&gt;9 别让 AI 一口气干完：把任务拆小，出错才好查&lt;/h2&gt;
&lt;p&gt;Swyx：你们定义了三个基础概念：Choice、Score 和 Noul（又名 Noulli）。先说 Noul，这个词是从哪里来的？是文献里已有的术语吗？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：现在算是了（笑）。我们为名字讨论了很久。它有点像布尔值（Bool）：涉及“真”或“假”，但它的取值是连续的。名字来自伯努利（Bernoulli），更准确地说，是取了 Bernoulli 的一部分，因为它表达的就是伯努利概率。&lt;/p&gt;
&lt;p&gt;我们当时还考虑过 PBool、Pool 等名字。我甚至想把它叫作“pool party”，但没人同意。最后大家觉得 Noul 最合适。我们这群人起名多少有点不按常理出牌，Jev 也是这样。最初我们以为，对程序员来说，Jev 不过是代码里的一个字符串，没想到这个名字后来还衍生出不少双关梗。当时内部有很多人反对这个名字，现在除了一个人，其他人都向我道过歉了。&lt;/p&gt;
&lt;p&gt;回到 Noul。我们需要为它创造一个新概念，因为如果直接叫 Bool，会让人误解。事实上，Choice、Score 和 Noul 都是我们有意单独定义的概念。它们与编程语言中的现有类型很接近，但并不完全相同。比如 Score 不是整数。如果通过 Instructor、Pydantic 之类的工具，直接把整数或浮点数映射成 Score，就可能出问题。我们更倾向于把含义说清楚，即使这会增加一些初次理解的成本。&lt;/p&gt;
&lt;p&gt;Swyx：但你们不担心集成问题吗？开发者通常希望它能直接接入自己已经在用的工具。你们有自己的 SDK；如果我是开发者关系负责人，我可能还会特别在意：怎样把 Jev 和 Instructor 一起用？怎样接入其他工具？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我们确实希望做好这些集成。相关示例也许已经有了，只是我现在跟不上所有更新。社区里也会有人做。支持社区这件事没有一个“完成”与“没完成”的二元状态，我们总还能做得更好。说实话，聊到文档我有点紧张，因为录制前没来得及重新看，而文档又一直在变。&lt;/p&gt;
&lt;p&gt;至于这三个概念，Score 其实并不难理解。它接近用语言模型做评判（LM judging）时得到的评分，也可以把它叫作一种“判断结果”。Noul 也可以被看作概率，但在我们的体系里，模型输出本来就带有概率性质。Choice 则最接近函数调用，不过我对现有的函数调用设计有不少意见，这个话题我们可以稍后再展开。在代码中，Choice 更像是把 switch 或 match 语句要处理的选择，直接作为 API 输出。&lt;/p&gt;
&lt;p&gt;Swyx：也就是说，它可以很自然地对应枚举（enum）；如果需要，开发者再根据选中的项调用相应函数。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。关键是先得到那个“选择”。这三个概念都可以对应到基本的程序控制方式：Choice 对应基于枚举的 switch 分支，Noul 对应 if 条件判断，Score 对应排序，或者通过“大于”“小于”的阈值来筛选。这一直是我们的设计方向。以后还会有更多类型，也会继续与程序中的基本操作对应起来。&lt;/p&gt;
&lt;p&gt;Swyx：对于准备深入使用 Jev 的开发者，还有什么 API 设计上的细节值得讲？比如这些概念具体怎么用，图例、置信度该怎么看，测试中又该注意什么。你是最了解它的人，我想多给他们一些实际建议。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：谢谢，我很喜欢这个问题。没想到会聊得这么细。除了几个月前给我们的开发者关系同事做入职培训，已经很久没人这样问我了。&lt;/p&gt;
&lt;p&gt;我们设计模型时，想的是让它将来能深入计算机程序内部工作。我们相信，这类用途的规模会远超今天人们的想象。模型现在也许还没准备好，但我们一直在朝这个方向推进。我们的目标不只是让它在相对浅层的任务上不断提高分数，而是让它进入程序的核心逻辑，因为这样才能让软件具备更强的能力。&lt;/p&gt;
&lt;p&gt;刚才说的 Choice、Score 和 Noul 是输出形式。输入端同样可以有结构：状态（state）、指令（instructions）、判断标准（criteria），都可以是结构化的 JSON 对象。程序可以把这些信息准确地放到需要的位置，开发者不必先把它们塞进字符串模板。&lt;/p&gt;
&lt;p&gt;很多人可能没注意到这一点，以为这些输入都只是字符串。用模板拼出一条系统消息，当然也能工作，但那延续的是过去处理模型输入的方式。既然信息本身有结构，就应该尽量保留这种结构，让计算机直接处理。写普通程序时，我们不会先把所有数字转成字符串，再传给程序内部的其他部分。转成字符串通常是为了展示给人看；程序内部传递的，应当是有明确含义的嵌套结构。&lt;/p&gt;
&lt;p&gt;我们也在持续优化模型处理这类输入的能力。它现在已经能处理结构化信息，但嵌套每增加一层，推理难度也会提高，所以这仍是我们重点投入的方向。我也希望开发者更多地采用这种方式：代码会更清楚，也不必过度依赖底层实现细节。&lt;/p&gt;
&lt;p&gt;可以把它想成调用一个 AI 函数：程序当前有一组状态，也就是可用的变量；你需要决定，哪些状态应该传给这个函数。相比之下，一条包罗万象的系统消息很像一个混乱的全局变量：把所有信息、所有指令都放进去，然后指望模型一次满足每项要求。很多问题其实可以拆开，并行地问。&lt;/p&gt;
&lt;p&gt;我很建议大家多向模型提问，把问题拆小、拆细。我这么说不是为了增加调用量。无论当前模型能否一次完成复杂任务，把问题分解成简单决策，都会让 AI 应用的代码更好维护；而且每个小决策都更容易单独评估。&lt;/p&gt;
&lt;p&gt;过去我们常常给模型一大段系统消息，等它返回一大段结果，再检查它有没有遵守其中的每条要求。现在回头看，这种做法挺不可思议的，只是大家已经习惯了。比如“不要读取这个子目录”“不要把 API 密钥传给 DeepSeek”，这类约束应该尽可能由程序保证。机器学习模型本身无法给你绝对保证，但把任务拆开之后，至少可以逐项测量、验证。&lt;/p&gt;
&lt;p&gt;Swyx：比如可以核查某个操作到底有没有执行。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。我们的接口本身就很容易验证，这会让工程实现可靠得多。&lt;/p&gt;
&lt;p&gt;Swyx：我理解这个思路。不过，以前大家不这么做，也有现实原因：即使用小模型，把任务拆成很多次调用，仍然可能又慢又贵。我自己做过对比：一条流程把所有要求放进系统消息，只调用一次、拿到一个完整输出；另一条流程把任务拆成上百个问题。后者更慢、更贵，结果还不如前者。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：确实会发生这种情况。拆分任务也很麻烦，调用之间可能还得重复传入一些信息，看起来不够高效。于是人很容易想：为什么不一次性把所有东西都放进去？但那样得到的系统往往很难依赖。我希望我们的模型能够支持大量在后台运行的程序调用；如果做不到，我会很失望。&lt;/p&gt;
&lt;p&gt;Swyx：那具体应该怎么拆？你们有没有发现什么有效的方法，或者发现哪些原以为可行的拆法其实不行？开发者听完之后可能会照着这个思路使用 Jev，但他们首先得知道从哪里下手。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我倾向于把问题拆到最小的语义单元：先找到其中最基础、能够独立判断的那件事。我可能是使用我们模型最多的人之一。提问时，我会尽量把输入写得结构化、明确；在问题里清楚指出所引用的内容，有时会用反引号把它标出来。我希望模型尽可能按字面准确理解要求。编程本来就要求指令得到准确执行，而 AI 扩大了程序所能执行的指令范围。&lt;/p&gt;
&lt;p&gt;我自己偶尔也会图省事，把几个判断混在一个问题里。但如果是大型生产系统，我会不断增加独立的问题，并且让新增问题这件事足够容易。每个问题负责什么，要拆得清楚；最终的具体行为则由代码来控制。&lt;/p&gt;
&lt;p&gt;举个小例子：拒绝回答。我不建议只问模型一句“这里要不要拒绝？”这个问题它或许也能答得不错，因为这是一个适合快速直觉判断的任务。但更好的办法是，针对不同的拒绝情形分别提出独立的问题。这样，你就能明确规定自己希望系统如何处理各种情况，而不是让模型自行猜测。&lt;/p&gt;
&lt;p&gt;更妙的是，如果后来发现某种情况没有触发拒绝，原因是你漏写了一项条件，这其实是一个很好的工程问题：补上那个问题，设置阈值，再把这个案例留作测试。修正就留在程序里了，不会因为提示词变长、上下文中的早期信息失效而被“忘掉”；你也可以持续测量它。如果模型对某项判断还不够准，还能根据真实案例调整相应阈值。整个过程有点像在做机器学习系统，但你不需要为每种情况重新训练模型。&lt;/p&gt;
&lt;p&gt;当然，有些任务可能仍超出了模型当前的能力。比如看到有人用模型做自动交易，我会有点担心。这件事看上去很酷，但任务本身复杂、风险也高，最好交给专业人士。即使把它拆成若干判断，你也可能通过评测发现：模型在某一步还不够可靠，那这一版就先不要部署，或者调整方案、选择更保守的处理方式。&lt;/p&gt;
&lt;p&gt;客户服务也一样。假设模型还不能可靠识别“VIP 客户在说反话”这类特殊情形，你就可以规定：遇到这种情况，转交人工处理。置信度估计也是为这样的决策服务的。&lt;/p&gt;
&lt;p&gt;Swyx：你刚才提到，开发者可以通过设置阈值，决定什么情况下采用模型的判断。但如果模型的概率校准本身就有问题呢？一个校准良好的模型，至少应该让较低的分数对应较低的实际发生概率，较高的分数对应较高的概率。现实中，两者也可能对不上。这时我可能想微调模型，而你们目前没有提供这个功能。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我没有说模型的校准是完美的。微调当然是我们可以考虑的方向。&lt;/p&gt;
&lt;p&gt;Swyx：微调是一种可能，也可以是别的调节手段。现在听起来，如果模型判断错了，用户能做的就是改提示词、把问题拆得更细，或者调整置信度阈值。如果模型确实不擅长这件事，这些办法不一定让人满意。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：没错。先说清楚，模型会在很多事情上犯错。我们有问题反馈按钮，大家也可以在 Discord 告诉我们哪里出了问题。我们希望持续改进模型，每个新版本都应该有明显提升；如果没有足够大的进步，我们就不会保持现在这样的发布速度。&lt;/p&gt;
&lt;p&gt;承认 AI 在某些任务上还不够好，是务实的做法。同时，“足够好”也取决于具体用途。人也会把工作做错，但只要总体预期收益足够高，很多工作仍值得由人来做。模型也类似：通过合适的阈值和其他控制方式，即便它会出错，仍可能承担相当多的工作。&lt;/p&gt;
&lt;p&gt;至于微调，我能想象我们以后会提供，但我有一些顾虑。用户想要的功能和真正对他们有益的功能，不一定完全相同。通用模型有一种很难说清的优势：它会处理大量其他任务，这种广泛的能力，可能也让它在某个特定任务的边缘案例上表现更好。如果只针对一个狭窄任务做微调，我会担心失去这部分能力。&lt;/p&gt;
&lt;p&gt;所以我的回答是：有可能。我在这些事情上很务实，我们想做的东西还有很多。但我也不想推出一个看似有用、实际却很容易让用户把系统用坏的功能。&lt;/p&gt;
&lt;p&gt;Swyx：OpenAI、Claude，可能还有 Gemini，都曾推出过微调功能，后来又撤回或收缩了相关服务。这也挺有意思：现在微调似乎更多发生在开源模型领域。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我知道这些情况。有些微调产品的效果确实不好，撤下来也许是对的。&lt;/p&gt;
&lt;p&gt;Swyx：所以，告诉用户“微调可能不是正确的解决办法”，也说得通。另一种回答是：你们的模型与通常的大语言模型差异很大，就像量化、输出 Token 这些概念未必适用于它，微调也可能不适用。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我对这种可能性也持开放态度。不过下面说的是我的设想，不是产品承诺。&lt;/p&gt;
&lt;p&gt;随着“每美元智能”的成本继续下降，也许我们能用很小、成本很低的模型，完成一些过去要靠手写规则处理的判断。举个例子：会不会有一天，人们不再需要自己写正则表达式？因为用 AI 完成同一件事的成本，已经低于编写和维护正则表达式所带来的复杂度。我会很乐意看到那一天。对于其中一些狭窄用途，微调也许恰好能让模型的表现跨过可用的门槛，还得继续看。&lt;/p&gt;
&lt;p&gt;我希望概率校准加上模型级联，也能解决一部分问题。比如，小模型对某个判断非常有把握，就直接采用它的结果；如果置信度落在中间地带，再交给更大的模型，必要时继续往上一级处理。我还不知道最终哪种方式效果最好。&lt;/p&gt;
&lt;p&gt;还可以设想另一种用法：我们提供一系列处于帕累托前沿、规模各不相同的模型。熟悉技术的开发者也许愿意自己选择，但企业可能更需要动态调度：系统根据技术栈中不同环节所需的判断能力，自动选择合适的模型。考虑到我们的接口相对简单，这套机制甚至可能结合某种自动微调。&lt;/p&gt;
&lt;p&gt;重申一下，刚才说的动态选模型、自动微调，都不是产品承诺。我只是在畅想一种有点像科幻的未来。&lt;/p&gt;
&lt;h2&gt;10“决策模型早就有了”，Jev 到底想做什么？&lt;/h2&gt;
&lt;p&gt;Swyx：但你们会考虑推出不同规模的 Jev 模型，让用户有得选？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：当然。用户到底需要多强的智能，我怎么可能事先知道？&lt;/p&gt;
&lt;p&gt;Swyx：需求可能是无限的。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：也有人劝我们，现在的产品已经够好了，不用急着发布新东西。但我不太喜欢“够用就停”的想法。有句话我很认同，大意是：市场不奖励你做一件事时，你仍然坚持去做，那才体现出你的文化。我希望大家以后也拿这句话要求我，因为说出口之后，就很难反悔了。&lt;/p&gt;
&lt;p&gt;也许有一天，我们坚持的东西会变得理所当然，公司会像 Visa 一样，成为人们平时不会特别留意的基础服务，到时候我可能连粉色西装都不穿了。但现在，我还想让更多人看到这条路的可能性。我们会继续做有意思的事，并不是因为当前产品非改不可，而是因为今天大家看到的才刚刚开始。第一次发布更像是一次低调的研究预览，远不是我们能做的全部。面向机器的智能（machine-native intelligence）还有很大的空间。&lt;/p&gt;
&lt;p&gt;Swyx：所以，将来可能不止一种模型规模，也不止目前这一款模型？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：没错。我们希望尽可能满足不同需求。但我得加一个重要前提：我不想像一些产品团队那样，什么想法都往外推。我们做的东西应该服从一个统一的方向。回看我们的宣言，未来的尝试都应该落在其中三个方向之一。&lt;/p&gt;
&lt;p&gt;Swyx：我没准备好在这里逐条聊那份宣言。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：抱歉，我说得像是在故意吊胃口。我的意思是，那三个方向不是一张待完成的清单，而是我们认为足以支撑下一轮技术变革的三条轴线。我们做的每一次尝试，都应该能在其中找到位置。模型方面，我们也会做一些看起来挺奇怪的东西。&lt;/p&gt;
&lt;p&gt;既然是“面向机器”的智能，就不一定非得让人一眼看懂它的形式；关键是它有没有实际价值。&lt;/p&gt;
&lt;p&gt;Swyx：能透露一点吗？“奇怪”会是什么样？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：给个提示吧。有人想把我们的模型叫作“决策模型”，因为目前的几个基础概念都与决策有关。但我不会这样命名：未来还可能出现其他面向机器的输出类型，它们未必是决策。&lt;/p&gt;
&lt;p&gt;Swyx：好，那就留给大家猜。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：这个提示已经挺有意思了。&lt;/p&gt;
&lt;p&gt;Swyx：现在也有人说：“决策模型我一年前就做过了，Jev 没什么新鲜的。”但我觉得，一方面，你们展示了这类模型可以怎样成为一个独立的产品方向；另一方面，从我看到的数字和测试结果来看，Jev 目前的表现仍然超过了那些类似产品。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：先说清楚，我不在乎基准测试上的输赢。无论领先还是落后，我都希望继续发布我们的进展。&lt;/p&gt;
&lt;p&gt;Swyx：你们至少让更多人开始认真看待这个方向。而且，“决策模型”和 System 1 模型之间的区别，似乎也是你一直想讲清楚的。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对，我想让软件工程师借助 AI，拥有更强的能力。让我难过的是，AI 已经这么强大，却远没有得到充分利用。如果事情继续这样发展，甚至会走向新一轮“AI 寒冬”，实在太可惜了。这件事会让我情绪激动。&lt;/p&gt;
&lt;p&gt;我并不是认为所有技术进步天然都是好事，也不想一味宣扬技术乐观主义。但看到 AI 有这么多能力，软件却仍然没有真正用上它，我觉得很难接受。我想做的，就是帮大家打开这些可能性。先说到这里吧，这几天我已经哭了太多次，不想在录节目时再哭一次。&lt;/p&gt;
&lt;p&gt;Swyx：谢谢你愿意讲这些。光看“TypeSafe AI”这个名字，大家未必能感受到你对这件事的投入。但了解你们想推动的方向，以及你们已经迈出的第一步之后，就更容易理解你为什么希望大家一起往前走。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我不确定最难的部分是否已经过去。以后肯定还有很多难题。也许等到各种工作真正实现自动化、经济增长明显加快，每天都有值得庆祝的进展，我们才能说难关已经过去。而且，我觉得大家现在太关注速度和成本，对可靠性的关注还不够。可靠，才会让人用起来觉得好；可靠，才会让人敢于信任它。&lt;/p&gt;
&lt;p&gt;Swyx：你们还写过一个目标：五年内让全要素生产率（TFP）增长超过 3%。我很少见到一家 AI 实验室把 TFP 增长当成目标。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：因为那才是经济变革该有的样子。这和 OpenAI 早期章程想表达的方向其实相当一致。章程本身也许没变，但关于什么算 AGI，后来的讨论似乎越来越倾向于用利润之类的指标来界定。&lt;/p&gt;
&lt;p&gt;在我看来，一个值得追问的问题是：如果模型能解出数学上的千禧年难题，却几乎没有承担现实世界中有经济价值的工作，我们该怎样评价它的影响？如果按“承担世界上大部分有经济价值的工作”这个标准看，我觉得目前各家模型都还接近零。这个过程也许已经开始，但我猜占比还不到 1%。等它真正发生时，应该能从经济统计数据里看到变化。&lt;/p&gt;
&lt;p&gt;我期待那一天。我不认为它会造成大规模失业，但它会带来很多积极的变化。另一方面，我也厌倦了 AI 总是站在产品最显眼的位置。软件和生活应该变得更好，而 AI 只需要在其中发挥作用。&lt;/p&gt;
&lt;p&gt;Swyx：让 AI 融入后台。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。我在演讲里也常问：2019 年的软件和 SaaS 产品已经创造了很大价值。现在都到 2026 年了，AI 的能力进步这么多，为什么大多数软件看上去却几乎没变？很多产品只是侧边栏多了一个聊天框。它有时能帮上一点忙，但公司仍不敢让它处理那些需要承担后果的决策，因为还无法充分信任它。&lt;/p&gt;
&lt;p&gt;这在我看来很不可思议。企业有很强的经济动力去改变现状。我觉得接下来可能出现的，恰恰是所谓“SaaS 末日”的反面：SaaS 会因为 AI 而得到增强。软件公司最清楚自己的业务里哪些工作值得自动化，因此也最有机会把 AI 真正用进去。&lt;/p&gt;
&lt;p&gt;Swyx：你们已经做出了一件很有意思的事。不过，我还想弄清一个边界：什么样的问题适合 System 1，什么样的问题需要 System 2？现在大家可能什么都想拿 Jev 试一遍，其中一些尝试恐怕会失败。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：“什么都拿 Jev 试一遍”这个说法挺好玩。说实话，边界要靠实验来找，就像缩放规律也来自经验观察。以机器人为例，投入了这么多钱，为什么它至今仍有很多事情做不好？问题未必能靠继续增加投入解决，还要看实验结果究竟能不能支持那条路线。&lt;/p&gt;
&lt;p&gt;我的判断是，预训练模型把大量能力浓缩到了一起，而 System 1 最接近它们天然擅长的思考方式。可验证奖励强化学习（RLVR）在增强 System 2 式推理方面取得了惊人的进展，我很佩服这些成果。但这类能力也很脆弱。&lt;/p&gt;
&lt;p&gt;回想 ChatGPT 刚出现时，人们常说：“它很通用，能做很多事”，接着又指出它不擅长数学，连 GSM8K 这类小学数学题也做不好。如今谈起经过 RLVR 训练的模型，大家又会说它的能力很不均匀：为什么它能解决某个特别难的问题，却会在另一个地方出错？数学能力也不是简单地在少数地方出现尖峰，它的差异可能细到不同问题层次。&lt;/p&gt;
&lt;p&gt;如果看各种训练方法各自追求什么，就比较容易理解：基于人类反馈的强化学习（RLHF）希望模型的回答获得人的认可；RLVR 优化的是能通过程序验证的任务表现。这类任务之所以能用于 RLVR，本身就需要有可验证的结果。我们做的 RLCD，则是希望模型能可靠地供程序调用。&lt;/p&gt;
&lt;p&gt;Swyx：我说一个实际使用中的观察，你看看对不对。拿到 Jev 的访问权限后，我第一天就用它试了很多任务。单步推理的效果非常好，可以说是顶尖水平；但需要连续推好几步时，表现就开始下降，而且步数越多，问题越明显。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。这又回到了实验问题：我们究竟能从模型中挖掘出哪些能力？我们希望尽可能多地释放它已有的能力，同时让能力分布更平滑、补上缺口，也增加新的能力。但归根结底，我们是在发掘这些高度浓缩的模型内核所具备的特性，再设法把不同特性组合起来。&lt;/p&gt;
&lt;p&gt;目前有效的那部分能力，恰好可以用“System 1 式”来描述。这也是为什么我们没有选择让模型在字符串里写出很长的推理过程。我认为，模型很擅长在内部完成推理，尽管这种能力还不完整，也不是对所有问题都有效。&lt;/p&gt;
&lt;p&gt;Swyx：等一下，你说的“潜在推理”（latent reasoning）是在字符串里推理？我以为它指的是模型内部的推理。我想确认一下术语。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我印象中，模型内部那种形式以前被叫作“连续推理”（continuous reasoning），但我也不能完全确定。过去之所以有人把另一种情况叫作“潜在推理”，是因为推理轨迹没有公开：对只看到答案的人而言，它相当于一个隐藏变量。&lt;/p&gt;
&lt;p&gt;Swyx：所以“隐藏”的究竟是哪一部分，大家的用法也在变化。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：至少 OpenAI 和 Anthropic 的推理轨迹，现在仍有不向用户完整展示的部分。&lt;/p&gt;
&lt;p&gt;Swyx：那 Jev 将来也不会做推理模型？毕竟显式推理似乎违背了你们强调的 System 1 路线。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我的承诺是，为了做好面向机器的智能，采用必要的方法。我能想象某些推理方式没有那么慢、低效和脆弱；如果是这样，我们完全可能采用。我不会承诺永远只用某种技术方法。我坚持的是最终要优化什么、为用户创造什么价值。产品已经发布了，但我们仍觉得还有很多事要做。&lt;/p&gt;
&lt;p&gt;Swyx：视觉能力也是一个目前缺少的重要部分。不过，它适合放进 System 1 模型吗？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：在我看来，各种能力都有可能加入。我们内部也在讨论一个更大的问题：是优先给用户提供我们判断他们真正需要的东西，还是更快提供他们明确说自己想要的功能？过去两年我们在未公开产品时，主要走的是前一条路，因为我们确信这个方向有价值。但产品发布后，两者之间需要找到平衡。&lt;/p&gt;
&lt;p&gt;上下文长度就是一个例子。据我观察，我们的模型在长上下文中保持能力方面表现很好。但行业里也常见另一种做法：用户想要更长的上下文，就继续把数字做大。另一方面，如果我们过于坚持“我们知道用户需要什么”，又可能走向替开发者做过多决定的方式，那同样不利于开发者。&lt;/p&gt;
&lt;p&gt;我们不希望把判断模型能力边界的全部负担都推给开发者，也希望他们能作为有判断能力的成年人，自行做出知情选择。接下来要解决的是：功能以多快的速度发布，才能兼顾产品的可信度和开发者的自主权。&lt;/p&gt;
&lt;p&gt;Swyx：这个权衡很合理。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：老实说，我们还没有答案，得边做边找。接下来几天，这可能就是我最需要反复讨论的问题之一。我们手里还有不少东西。之前没想到这次发布会有这么大的反响，我们原本还想着，之后要陆续发布一些后续成果。&lt;/p&gt;
&lt;h2&gt;11发布前没人看懂，发布后用户开始教他们怎么用&lt;/h2&gt;
&lt;p&gt;Swyx：我不太信你们完全没预料到发布后的反响。过去两个月，我从没见过你这么全力投入一件事。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：那也得感谢我的幕僚长，是他让我必须全力投入。我以前以为自己已经够努力了，这次才发现还能更拼。&lt;/p&gt;
&lt;p&gt;Swyx：你甚至来参加我们的写作工作坊。当时我还在想：“你怎么也来了？”能看出来，你们为发布做了很认真、很有意识的准备。成果也体现出来了，恭喜。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：谢谢。我希望接下来还能保持这种投入。我们已经通过了技术圈的几道检验，但后面还有很多关要过，我很期待继续做下去。&lt;/p&gt;
&lt;p&gt;Swyx：在聊 TypeSafe 以外的话题之前，还有什么关于这次发布的内容，你觉得被低估了，或者大家误解了？比如产品的使用模式、模型能力不均匀的问题？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：每个话题我都能讲很久，但还是克制一下吧。我想特别提一下我们的示例手册（cookbooks）。团队在里面花了很多心思，内容也很实用。我们原本考虑把不少例子放进发布博客，但那样文章会太长，也太偏向深度用户。&lt;/p&gt;
&lt;p&gt;说实话，发布前我们很担心：这个工具听起来像是从外星来的，别人为什么需要它？我们觉得，教会大家理解这个新方向，可能会成为最大的障碍，所以在说明和示例上投入了很多。现在看来，用户已经做出了远超我们预期的东西，这个障碍或许没那么大了。&lt;/p&gt;
&lt;p&gt;Swyx：用户反过来教你们怎么用自己的模型。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：没错。有些用户案例甚至比我们的演示更精彩。我看到一些计算机操作方面的用法时就想：如果发布时拿这个做演示该多好。至于示例手册，我们确实认真做了，不是随手生成的一堆内容。每个例子都有实际价值，很多来自我们帮客户解决真实问题的经历。&lt;/p&gt;
&lt;p&gt;Swyx：发布前，你们做了多少用户验证？当时具体是什么情况？毕竟那时接触到的人还远没有现在这么多。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：坦白说，发布前的反馈不太好。团队里不做技术的同事尤其担心：很多人既没看懂，也不觉得自己需要它。大家会问，我们卖的会不会只是“维生素”，而不是能解决眼前痛点的“止痛药”？是不是还得配备前沿部署工程师（FDE），替客户把周边软件都写好，产品才能发挥作用？&lt;/p&gt;
&lt;p&gt;发布前，我们几乎没有收入。技术团队相信它，因为我们看得到它在多个维度上的计算特性，也相信它有很大潜力。但我自己也很害怕，这正是我那段时间拼命投入的原因。&lt;/p&gt;
&lt;p&gt;让超过一半试用者理解它在做什么都很难。少数看懂的人会说：“这很酷，但我们怎么通过采购流程？”整个过程并不轻松。后来我们决定，先面向开发者发布。开发者会找到用途，其他人看到实际效果后，也会想要用。&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;p&gt;我不想嘲笑那些后来改变看法的人，情况确实变了。但这段经历让我重新思考“产品市场匹配”这个概念。发布前，我们拿着产品去问潜在用户：“你们要用吗？”他们说：“不知道它能不能解决我们的问题。”发布后，需求突然爆发，大家开始问：“能把我们的速率限制再提高吗？你们算力不够的话，我们甚至可以给你们提供 GPU。”&lt;/p&gt;
&lt;p&gt;营销当然起了一定作用，但我觉得更关键的是，一群真正喜欢这个方向的开发者先用起来了，他们做出的东西又感染了更多人。&lt;/p&gt;
&lt;p&gt;Swyx：很多公司也是从开发者起步，最后转向大企业客户。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。但我希望我们始终记得最早支持我们的开发者，而不只是把他们当作进入企业市场的跳板。我甚至在想，能不能推出一些对开发者比对企业更有利的东西，让他们获得更多能力。我已经有些想法了，虽然这么做可能很不寻常。&lt;/p&gt;
&lt;p&gt;我也不知道还能怎样表达感谢。昨天我去染头发，也是想借这个机会继续和他们交流。公司正处在一个重要阶段，如果这时候反而不再跟开发者说话，我会觉得不对劲。&lt;/p&gt;
&lt;p&gt;Swyx：所以你的头发是这么回事。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。请大家以后拿这些话要求我。我希望自己能坚持原则；如果哪天我变了，尽管指出来。&lt;/p&gt;
&lt;h2&gt;12从暗数据到智能软件：Jev 瞄准四类核心场景&lt;/h2&gt;
&lt;p&gt;Swyx：我想给大公司的开发者一些具体方向。即使他们现在没有做这类项目，也可以知道有哪些用法值得去看。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我本来想先聊编程 Agent，不过还是先把主要的几类用法讲完。这些方向是我们发布前就从基本能力出发梳理出来的。&lt;/p&gt;
&lt;p&gt;第一类是我们所说的“暗数据”（dark data）。很多企业积累了海量数据，却因为用大语言模型分析的成本太高，一直没能充分处理。大型企业很需要这类能力：它们有成堆想分析的数据。对数据科学家来说，这也是很有吸引力的场景。我认为，暗数据分析和编程 Agent 很可能是调用量最大、商业价值也最高的两个方向。&lt;/p&gt;
&lt;p&gt;第二类是实时场景，需要在处理流程中迅速得到模型的判断。这类公司的 CEO，或者至少 CTO，大概都清楚：响应时间每减少 10 毫秒，产品体验能改善多少。&lt;/p&gt;
&lt;p&gt;Swyx：电商尤其如此。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对，各类 AI 助手也需要这种能力。据我从团队那里听到的反馈，这些用户很喜欢 Jev；不过我现在不直接负责客户沟通。我自己还特别期待它用在游戏里，比如玩家用指令指挥队伍作战的自动或半自动对战游戏。那会很有意思，不过在我还有工作的时候，先别把它做得太厉害（笑）。&lt;/p&gt;
&lt;p&gt;第三类，我们叫“验证一切”：用它检查其他大语言模型的调用和输出，有点类似给 AI 系统增加可观测性。这里有个具体的使用技巧：如果你有一大段状态信息，想并行检查其中很多内容，可以给每条消息加上 ID，再针对各个 ID 分别提问。这样，较长的状态信息只需传入一次，就能围绕其中的消息提出许多问题，成本会低一些。&lt;/p&gt;
&lt;p&gt;Swyx：按 System 1 和 System 2 的分工来想，这似乎意味着：每调用一次推理模型，就可以搭配一次、十次，甚至上百次 Jev 调用。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：也许，但我更希望用户花得更少。比如把原本需要的推理模型调用减半，再为每次调用配上若干次 Jev 判断。具体怎么组合，取决于它能否解决原来解决不了的问题。&lt;/p&gt;
&lt;p&gt;第四类是“智能软件”：让智能判断成为软件自身的一部分，使程序能够组合出以前做不到的行为。有人尝试把 Jev 融入编程语言，做出了很有意思的东西。我们现在的基础设施还处在早期；如果能更方便地发放使用额度，我很想给这些项目提供支持。&lt;/p&gt;
&lt;p&gt;这四类是我们事先梳理出的主要方向。计算机操作也是后来出现的用法，可以归到实时场景里。如果它能稳定工作，我会非常兴奋。这个方向多少有些出乎我们的预料，我也觉得模型在这方面还有很大的改进空间。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：编程 Agent 领域眼下正发生一件让我意外的事。在我印象里，Claude Code 和 Codex 大概是目前最领先的两个产品，不过我没有持续追踪排名。它们基本是围绕“单模型”来设计的，这很合理：过去开发者选择编程 Agent，主要是在功能相近、能力水平不同的模型之间做选择。&lt;/p&gt;
&lt;p&gt;现在，开放式的编程 Agent 项目都在兴奋地尝试接入 Jev。我相信他们也在试各种别的组合。目前这些 Agent 的能力大致接近，毕竟只靠一个循环调用模型的框架，能做出的差异有限。一旦有人找到某个只有自己的 Agent 能做好的关键用例，用户就会涌过去；但其他开放式项目也能很快借鉴。Claude Code 和 Codex 则是围绕单模型构建的，我很好奇它们会怎么应对。&lt;/p&gt;
&lt;p&gt;我个人很希望能与它们集成，也希望 Jev 能接入各种产品。它们以后也许会推出与我们竞争的能力，我不知道。但作为一家基础设施公司，我的工作不是预先替行业决定大家该用谁，而是让更多人能够使用我们的能力。这会让编程 Agent 市场变得很有意思。&lt;/p&gt;
&lt;p&gt;我还写了一份内部文档，整理了一些可能适用于编程 Agent 的设计模式，正在请团队审阅，希望很快能分享出来。这个领域有太多值得探索的东西了。如果我不是正忙着做 Jev，我现在也很想亲自去做编程 Agent 实验。&lt;/p&gt;
&lt;p&gt;Swyx：编程 Agent 公司应该也愿意和你们一起探索。我觉得 Claude Code 和 Codex 仍有使用 Jev 的空间。接下来暂时跳出 TypeSafe，聊聊你对 AI 研究方向，尤其是安全与对齐的看法。&lt;/p&gt;
&lt;h2&gt;13“放慢前沿进展”之外，还有别的研究路线吗？&lt;/h2&gt;
&lt;p&gt;Swyx：我最近参加了一场研究者聚会，大家确实担心技术发展的速度。有一种观点认为，公众还没有准备好，因此前沿实验室应该放慢脚步。你怎么看？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：这是个容易引起争议的话题，不过我愿意谈。我还想专门写一篇更完整的回应，这里先讲一个简短版本。&lt;/p&gt;
&lt;p&gt;我觉得，“要不要放慢前沿进展”的讨论，往往默认了一件事：所有人都必须继续做 RLVR，而且要不断加大力度。但我不这么认为。就 Jev 这类模型想完成的任务而言，我认为最合适的 RLVR 用量甚至可能是零。&lt;/p&gt;
&lt;p&gt;RLVR 也不能只从“奖励可验证”来理解。在推理模型兴起之前，人们就尝试过用可验证结果做强化学习，并没有因此自然得到今天的效果。训练任务的整体形态同样重要。我想起一段经历：RLHF 刚开始受到关注时，有几条后来被统称为“后训练”的研究路线同时在推进。指令遵循当时并不受所有人重视，因为评估它很麻烦。我曾跟预训练团队说，这里面有关键价值；他们的顾虑是，模型实验做得那么频繁，难道每次都要等人工评测结果才能决定选哪个模型？&lt;/p&gt;
&lt;p&gt;当时，代码生成也获得了很多资源。团队尝试用单元测试的结果给模型做强化学习，取得过一些成果，但光有可验证的测试结果，并不能自动带来今天这种推理能力。因此，RLVR 的效果不只是奖励函数带来的，也和模型被允许经历怎样的推理、采取怎样的中间步骤有关。为了让模型解出最难的问题，研究者会给它很大的行动空间。&lt;/p&gt;
&lt;p&gt;这也是我对“放慢前沿进展”论述的疑问。有些人会说，也许问题出在沙箱隔离不够。那当然可能是问题，也可以改进。但实验室之所以给模型更大的行动空间，是因为这样可能让它在任务上更强；如果增加约束，又可能损失一部分表现。我认为，这里有一些本该由研究者自己承担的设计选择，却被表述成了发展 AI 不可避免的前提。&lt;/p&gt;
&lt;p&gt;Swyx：如果先接受“必须沿着这条路线继续加大投入”的前提，再推导出风险会增长，逻辑上是说得通的。但前提本身还有其他选择。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：正是如此。真正重新定义任务或研究目标的路线很少见，所以研究者容易沿着已有方向继续推进。我觉得现在对其他可能性的思考还不够开放。&lt;/p&gt;
&lt;p&gt;公众不该为这种局面负责。他们不是研究这件事的专家，通常只能相信 OpenAI、Anthropic 等实验室已经在尽最大努力；更了解技术上还有哪些选择的，是研究者自己。&lt;/p&gt;
&lt;p&gt;Swyx：你们做的事，也是在让大家看到另一条路。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我会尽力。但我的目标不是说服其他实验室改变路线，而是让软件工程师重新看到希望，开始自动化那些他们一直想自动化的工作。&lt;/p&gt;
&lt;p&gt;我曾写过一篇关于理想中 AI 未来的文章，团队最后没让我发表。里面有很多很小、但会改变体验的设想。刚才那个用语音操作电脑的演示就是一例：过去计算机太机械、太按字面执行指令了；如果它能更好地理解人的意图，很多操作都会顺畅得多。&lt;/p&gt;
&lt;p&gt;我不想承诺这些很快就会实现。但我们会尽力推动，让智能逐渐进入软件的各个角落。&lt;/p&gt;
&lt;p&gt;Swyx：回到训练方法。你深入参与过后训练，怎么看“中训练”（mid-training）？我们好像还没聊过这个。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：训练的不同阶段更像是一条连续的谱系，没有那么清楚的分界。&lt;/p&gt;
&lt;p&gt;Swyx：可以理解成一种更复杂的课程学习？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：可以这么说。中训练也有成本上的考虑：你不必为了增加某些能力，从头再做一遍预训练。&lt;/p&gt;
&lt;p&gt;我觉得智能在训练的每个阶段都有一些难以用简单规则概括的地方。观察数据、弄清能力是怎么进入模型的，是件很有意思的事；我们的数据团队很擅长这个，我自己没有他们那么擅长。我更习惯从整体结构上思考，也很喜欢听他们讲从数据里发现了什么。&lt;/p&gt;
&lt;p&gt;比如，短期内可以通过微调让模型迅速表现出某种倾向；如果相关训练持续进行，某些能力就会逐渐更深地进入模型，变得更稳固。我想找到的正是那些能稳定发挥的能力。前面说的 System 1 式能力，也属于这一类。所以我对中训练很感兴趣，也支持探索各种训练方式，看看还能从模型中释放出什么能力。但这些方法成本很高，我不会每一种都亲自做。&lt;/p&gt;
&lt;p&gt;有件事我以前私下说过。我觉得，如果能对投资人说，也应该能公开对大家说：即使给我 10 亿美元，我也不会自己做预训练。我现在仍这么想。预训练太贵了。作为 AI 工程师，你可以拆解现有模型、组合不同能力，尝试各种办法。把模型像“弗兰肯斯坦”一样拼起来，也许不够优雅，但它能解决问题。总之，我会尝试预训练之外的办法。&lt;/p&gt;
&lt;p&gt;Swyx：顺着这个思路，有一个值得讨论的问题：未来是把所有能力放进一个“超级模型”，还是继续把不同能力拆到不同模型里？OpenAI 曾经朝全能模型（omni model）的方向走，GPT-4o 就是例子。但有一段时间，也能看到聊天优化模型和编程优化模型各走一条线。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：这其实是两个差别很大的问题，得拆开说。多模态是一回事：加入其他模态，有时会帮助模型，有时也会拖累它。比如，我看到有些团队似乎在减少对语音（speech）的投入。这里说的语音和更广义的音频（audio）不是一回事；语音能力目前似乎不太容易迁移到其他任务上。这个问题以后可能会解决，但得看实验结果。&lt;/p&gt;
&lt;p&gt;我支持探索各种形式的智能，不过不能以为只要按缩放规律增加投入，问题就一定会解决。缩放规律最终要回答的是：投入增加后，能力实际上提高了多少？有些任务即使继续扩大规模，也可能达不到可用水平。据我了解，计算机操作目前就还没有解决。我希望我们能在其中发挥作用，但也可能无论收集多少数据都不够，需要改进方法。&lt;/p&gt;
&lt;p&gt;所以，问我是否支持全能模型，我的回答是：我支持探索各种能力。但你刚才提到的另一个问题更值得展开——后训练怎样影响模型原本具备的能力。我很不喜欢把智能训练得支离破碎。&lt;/p&gt;
&lt;p&gt;以聊天优化为优先的训练，往往高度依赖 RLHF，也容易带来人们经常抱怨的问题：迎合用户、过度自信、幻觉。甚至在 LM Arena 这类评测中表现讨喜的回答风格，也可能是训练目标塑造出来的：大量加粗、斜体、表情符号；不直接回答问题，而是写一大段，再反问用户一句，让对话显得更像真人。&lt;/p&gt;
&lt;p&gt;我认为，这和让模型更准确地发挥已有能力是两回事。让模型生成一段自由文本，本来就有很多不确定性；训练过程中，模型可能学会用非常确定的语气维持某种回答模式，避免明显跑偏后受到奖励模型的惩罚。这会改变它的概率分布，也会与推理能力相互影响。模型可能学会一些取巧的方式，把目标完成了，判断能力却未必因此变得更稳固。理解这些细微变化，是研究智能的重要部分。至少在我还在 OpenAI 时，我觉得这方面得到的研究还不够多，大家更多是在优化“聊天”这个目标。&lt;/p&gt;
&lt;p&gt;Swyx：一旦确定目标，团队就会集中优化它。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。有人会说，那就同时优化两个目标。但在我看来，把模型分别往不同目标上拉，本身就可能造成能力分裂。&lt;/p&gt;
&lt;p&gt;Swyx：可是，你把能力分成 System 1 和 System 2，某种程度上不也是在拆分智能吗？只不过你不认同别人拆分的方式。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我觉得两者不一样。我们并没有把 System 2 任务扔掉。开发者可以拿 Jev 去尝试这类任务，而对于模型没有把握的问题，一个合理的结果就是表达“不确定”。它应该给出较低置信度，清楚体现不确定性；某些启发式方法也许还能改善表现。我们同样关心这些任务，只是我认为，长链条的 System 2 式推理并非这个模型最自然、最稳定的能力形态。&lt;/p&gt;
&lt;p&gt;我也不想为了塑造产品身份而改变模型的回答。比如有人问它是谁，我不会特意训练它回答“我是 TypeSafe 的 Jev”。那会把一个品牌要求写进模型的判断里。我更希望它依据学到的信息给出正确回答，让能力保持平滑、可预测。&lt;/p&gt;
&lt;p&gt;Swyx：模型身份对直接面向用户的产品来说，可能是个特殊问题。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对，第一方产品需要考虑身份。但如果提供的是 API，情况就不同了。开发者用模型做自己的聊天产品，通常希望它呈现的是自己的产品身份，而不是回答“我是 ChatGPT”。&lt;/p&gt;
&lt;p&gt;Swyx：为了让开发者更容易把 Jev 用进产品，你们也提供了 Jev Skill，让编程 Agent 知道该怎么与 Jev 配合。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。&lt;/p&gt;
&lt;h2&gt;14从 InstructGPT 到 TypeSafe AI 创业&lt;/h2&gt;
&lt;p&gt;Swyx：最后问几个问题。回头看，你做这件事大概有两年多了？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：如果从公司成立算起，是两年多；但对我来说，更像是一段持续了四年的经历。&lt;/p&gt;
&lt;p&gt;Swyx：我想起有一年感恩节，你取消了其他安排，说大家都在休假，正好可以用空出来的 Edge GPU，集中做一次实验。那还是 TypeSafe 成立之前吧？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对，那段时间挺有意思。是不是正好赶上 OpenAI 那次管理层风波？我有点记不清了。&lt;/p&gt;
&lt;p&gt;Swyx：对，时间差不多。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：那就对上了。那场风波挺让人心烦的，不过我们今天没时间展开聊。&lt;/p&gt;
&lt;p&gt;Swyx：你说让人心烦的是那场风波，还是那次实验？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：是那场风波。也许下次聊天时，我再讲当时的事。不过，Jev 想解决的问题，在 ChatGPT 发布前就已经萦绕在我脑子里了。当时我看到 ChatGPT 团队的工作，觉得他们选对了任务。他们做了一件很多 AI 研究者不擅长、但优秀产品团队很在意的事：认真打磨用户体验。在当时的 OpenAI，这种人并不多；ChatGPT 团队在这方面做得很好。&lt;/p&gt;
&lt;p&gt;Swyx：你说的这段经历，可以追溯到 GPT-3 向 GPT-3.5 演进的时期。当时还有 AI Dungeon 这样的应用，也是一个你们事先没想到的用例。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。我当时也很努力地推动 InstructGPT 上线。早期有些版本甚至用了我自己设计、但后来没有公开的训练算法，因为清理 PPO 数据太慢了。我当时想：效果已经这么好，应该尽快让用户用上。&lt;/p&gt;
&lt;p&gt;它上线后，很快就在当时的大语言模型使用市场里占了相当大的份额，按我们的估计大约有 50%。我还花了很多精力，确保发布视频里的展示都是真实的。当时我甚至认真想过：一个模型能这样理解并执行指令，这算不算 AGI？现在看，显然不算。但我觉得每个人都值得想一想，为什么它看上去这么聪明，却仍然不是 AGI。&lt;/p&gt;
&lt;p&gt;后来，我看到它主要被用于营销文案写作，例如 Jasper AI、Copy.ai，以及大量填充网页的文字。我们一度担心，自己是不是让互联网变得更糟了。于是我重新思考：模型明明表现得很聪明，为什么没有创造出我们期待的价值？还缺了什么？&lt;/p&gt;
&lt;p&gt;我试着从一场由 AI 推动的经济变革倒推：如果 AI 以 API 的形式存在，未来主要是谁在调用它——人，还是代码？我的判断是，绝大多数调用会来自代码。但当时的优化几乎都面向人与模型的对话。那一刻我意识到，应该把“让程序能够可靠地调用智能”作为目标。&lt;/p&gt;
&lt;p&gt;我写了一份文档，也跟 Sam 聊过。他觉得这个方向很好，建议我去做。我当时的反应是：“可我还有本职工作啊。”&lt;/p&gt;
&lt;p&gt;Swyx：Sam 都让你去做了，那就去做啊。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：当时我还觉得，这个方向太显而易见了，Anthropic 肯定已经在做，我们可能已经晚了。我那时的看法是，OpenAI 往往更擅长追赶已有方向。比如我认为 ChatGPT 与 Anthropic 此前内部做过的聊天产品有相似之处，只是后者当时没有发布。&lt;/p&gt;
&lt;p&gt;Swyx：对，之前还有在 Slack 里使用的 Claude。不过，推理模型这条线上，OpenAI 算是较早推出产品的。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：研究成果很出色。至于它是否对应用户当时最迫切的产品需求，我不太确定。编程 Agent 这边，Claude 也做出了重要的产品。&lt;/p&gt;
&lt;p&gt;和 Sam 聊完后，我先回去继续做原来的工作。后来，指令遵循团队觉得这方面已经取得了很大进展，我也开始想下一步做什么，于是试着研究那个面向程序调用的方向。我原以为训练模型、验证想法只要一周，最后却花了好几年。&lt;/p&gt;
&lt;p&gt;中途有一次，我看到了初步有效的迹象。它当时显然还不能直接部署，否则我们早就发布了。但我很想知道，如果在研究上全力投入，这条路线最终能走到哪里。我也想过：如果 AI 最后进入新一轮低谷，而我明明看到了这个问题却没有认真尝试解决，我会觉得自己有责任。&lt;/p&gt;
&lt;p&gt;我和其他公司聊过，提出想建立一个研究这个方向的实验室，也得到了一些兴趣。但当我问他们，加入现有公司和自己创业，哪一种能推进得更快，他们的回答是“创业”。于是我决定自己做。&lt;/p&gt;
&lt;p&gt;Swyx：然后你联系了 Eric 和 Sasha？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我先联系了 Eric（译者注：Erik Gafni，现任 TypeSafe AI 首席技术官）。找 Sasha （译者注：Sasha Sheng，现任 TypeSafe AI 首席运营官）时，我起初并不是想拉她入伙。我只是问：“是不是我想错了？是不是因为待在 OpenAI 太久，我没看到外面其实已经有解决方案？”&lt;/p&gt;
&lt;p&gt;结果她说：“我加入。”我提醒她，当时她还在经营一家创业公司，她说正在结束那家公司。我劝她先认真想想，她想过之后，还是加入了。&lt;/p&gt;
&lt;p&gt;两周之内，我们拿到了资金，也有人搬进我的公寓一起工作。我有点洁癖，那段日子对我来说可不轻松。此后我们继续做研究，终于得到了一些结果，证明这个方向有初步的可行迹象。&lt;/p&gt;
&lt;h2&gt;15别再复制前沿实验室：先找到你的 North Star&lt;/h2&gt;
&lt;p&gt;Swyx：前面讲了这么多背景，我真正想问的是：如果现在有一位前沿实验室的研究者，和当年的你一样，觉得自己的方向得不到资金、资源或重视，你会建议他也出来创业吗？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：这问题很有意思。我得想想怎么说才不至于得罪太多人。&lt;/p&gt;
&lt;p&gt;坦白说，除非这些新兴实验室背后有我不了解的经济逻辑，否则我不太看好其中的大多数。我看重的不是研究者履历本身，而是他们是否认真选择了值得解决的问题。我们当然需要研究者，但他们得真正关心自己研究的任务。对我来说，首先要找到一个值得长期投入的North Star（核心目标），然后围绕它做真正有用的事。光有漂亮的研究背景，通常不会自动创造价值。&lt;/p&gt;
&lt;p&gt;我相信应该有清楚的目标，去做有用的事。如果一家新实验室有明确方向，我非常支持；但如果只是从头重复已有工作，拿到资金后做各种实验，真正推进前沿的机会又很小，我看不到它创造了多少价值。据我与一些新兴实验室交流的经验，有些团队还没有想清楚自己要往哪里走。&lt;/p&gt;
&lt;p&gt;所以建议取决于你为什么离开。如果只是想自由地尝试研究课题，现有实验室可能仍是最合适的地方。我更希望大家带着要解决的问题出发。问题可以是探索性的，但最好有自己认同的原则和方向。如果你确信自己找到了一个值得投入的新任务，那我会强烈支持你去做。我们需要有人打破研究圈里越来越一致的思路。&lt;/p&gt;
&lt;p&gt;Swyx：像一种“蜂群思维”。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。“放慢前沿进展”的讨论，也部分来自对 AI 的一种特定想象：模型聪明得惊人，能力却非常不均匀，因而带来特殊风险。但这只是发展 AI 的一种路线，不能把它当成唯一可能。探索不同的技术方向，本身就有价值。&lt;/p&gt;
&lt;p&gt;Swyx：公平地说，我想准确转述此前与我交流过的 OpenAI、Anthropic，还有 SpaceX 人士的意思：他们谈放慢进展，考虑的不只有灾难性风险，也有政治层面的因素。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：政治层面的事，就超出我的专业范围了。&lt;/p&gt;
&lt;p&gt;Swyx：我当时听完，也意识到他们讨论的时点可能和 2028 年选举有关。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我真希望没听到这一层。感觉很糟。&lt;/p&gt;
&lt;p&gt;Swyx：先说明一下，这只是当时那场讨论中部分人的说法，不能代表整家公司。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：明白。也许我是个天真的技术人员，但听到这些，我多少有点失望。&lt;/p&gt;
&lt;p&gt;Swyx：随着技术发展，谁来执政、怎样制定监管规则，确实会越来越重要。实验室也需要认真考虑这些问题。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：这点我完全同意。我担心的是，为了达到某个自认为正确的目标，在公开沟通时把话说得过于确定，或者让公众产生误解。我不想在这里展开谈政治。我的原则是，即使出发点被认为是为了公共利益，也应该尽量准确地说明事实和不确定性。&lt;/p&gt;
&lt;p&gt;Swyx：就我听到的讨论而言，我不觉得他们是在误导公众。他们更多是在解释，为什么现在提出放慢进展。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我理解。但如果公开强调的风险理由，与实际推动这件事的目标并不完全一致，我仍觉得其中有值得说清楚的地方。希望我们以后尽可能不卷入这样的事。公司变大后，也许很难完全置身事外，但我还是想守住自己作为技术人员的出发点。&lt;/p&gt;
&lt;p&gt;Swyx：那我开个玩笑：让 Jev 竞选总统吧，我说不定比信任自己的决定更信任它。好了，玩笑先放一边。你们已经选定了自己的 North Star：让 AI 可靠、可编程、可组合，还要便宜。如果把机会留给其他人，你最希望他们去解决什么问题？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：这问题太好了。我先说一个好玩的，再说一个我觉得很有研究价值的。&lt;/p&gt;
&lt;p&gt;第一个是游戏。如果游戏里的角色和世界能更智能，会非常有意思。我看过 Ali 做的《Doom》演示，玩家可以让 NPC 执行一些操作。那还只是概念验证，却已经让我想到很多可能。我很喜欢《星露谷物语》；它的世界相对静态，仍然很吸引人。如果角色能对游戏状态作出更多反应，就可以产生很多新的故事。&lt;/p&gt;
&lt;p&gt;也不必在游戏的每一帧都调用 Jev，那样可能太贵了。哪怕只是在 NPC 的状态机里加入一些智能判断，也有机会把游戏世界做得更生动。我有点遗憾自己现在没法亲自做这些项目。&lt;/p&gt;
&lt;p&gt;Swyx：可以让别人来做，你再给他们反馈。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对。另一个我特别想看到有人探索的方向，是摆脱 KV Cache 对编程 Agent 设计的限制。我写过一篇文章，叫《KV Cache Rules Everything Around Me》，就是想解释现有编程 Agent 和 KV Cache 是怎么相互影响的。它能解释很多现象：为什么模型路由很难，为什么子 Agent 的效果常常不如预期，为什么上下文压缩也是个棘手问题。&lt;/p&gt;
&lt;p&gt;我还写了一份关于新设计模式的文档，希望团队审过后能发布出来。我想把自己的想法抛给大家，请大家试试看：如果不再被现有的 KV Cache 使用方式绑住，编程 Agent 还能怎么设计？&lt;/p&gt;
&lt;p&gt;Swyx：你说的“绑住”，是指它限制了模型选择？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：这是一方面。为了高效利用 KV Cache，系统往往要持续在已有上下文后面追加内容，也就容易固定在同一个模型上。这样一来，设计会逐渐偏离软件工程里熟悉的做法，比如明确管理状态、抽象问题、拆解任务。&lt;/p&gt;
&lt;p&gt;举个例子，为什么不能把简单的任务交给一个更便宜的子 Agent？难点之一是状态交接：如果把父任务积累的大量上下文都传过去，子 Agent 光是读取这些信息就可能花掉不少成本。那能不能更聪明地决定，它到底需要哪一部分状态？&lt;/p&gt;
&lt;p&gt;我觉得这里有很多值得研究的编程模式。可以给状态明确标注含义，把任务组织成有层级的子任务。编程 Agent 本来就在逐个处理子任务；一个子任务结束后，为什么一定要把它接触过的全部状态都塞回父任务？需要信息时，为什么不能在子任务树里检索相关上下文？&lt;/p&gt;
&lt;p&gt;如果访问上下文的成本足够低，还可以更方便地回看历史记录。现在 Agent 经常像每次都从零开始工作，然后我们又要单独解决“持续学习”的问题。其中一部分其实是记忆管理：信息并非完全不存在，而是系统不知道怎样有效找到它。&lt;/p&gt;
&lt;p&gt;并行工作的子 Agent 也一样。如果它们的状态保存在计算机内存里，为什么不能有选择地读取彼此的进展？哪些内容正在写入、哪些可以读取，都可以更清楚地管理。多个 Agent 协作时，也许还能用比简单加锁更灵活的方式协调：“你现在在改什么？我在改什么？谁应该先写？”&lt;/p&gt;
&lt;p&gt;Swyx：让 Jev 来决定谁先拿到锁？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：多 Agent 协作里确实可能有这样的用法。还有一些 Agent 只负责读取状态，比如向用户汇报其他 Agent 的工作进展。它不需要看完所有探索过程，只要找到已经写入的结果、相关子任务和当前状态就够了。&lt;/p&gt;
&lt;p&gt;如果有人愿意投入足够多的时间，重新思考编程 Agent 怎样保存、查找和共享状态，我觉得能做出很有意思的东西。这是我特别希望看到的方向。&lt;/p&gt;
&lt;p&gt;Swyx：你可以看看 PrimeAgent。它和递归语言模型（RLM）相关的工作有结合。我们刚和参与这方面研究的 Alex 聊过。这条路线已经有人在做，只是目前还不算热门。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：那很好。我希望更多人去试各种不寻常的想法。我不能保证它们一定有效，但从技术上看很值得探索。等我们建立起发放使用额度的机制，也希望能支持做这些实验的人。&lt;/p&gt;
&lt;p&gt;Swyx：以后你们或许还能直接资助相关研究。也恭喜你和整个团队走到今天，从我第一次认识你到现在，你和团队都走了很远。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：我希望自己还是原来那个人。&lt;/p&gt;
&lt;p&gt;Swyx：我觉得是。不过现在的你比我以前见过的任何时候都更有劲头，因为你找到了自己的使命。过去很多年，你一直在指出问题，但还没有拿得出手的解决方案；后来你有了大致方向，又花了很长时间把它做出来。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：这也是因为我觉得自己完全没有创业者的性格。我不喜欢创业，从没想过当 CEO。做一次已经够难了，很难想象有人愿意做第二次。最初融资时，有位投资人问我仰慕哪位 CEO，我的第一反应是：“我为什么要仰慕他们？”&lt;/p&gt;
&lt;p&gt;无意冒犯谁。我遇到过很多很好的人，只是一些最出名的人似乎也有不少不愿示人的问题。在 OpenAI 时，我确实觉得自己很难推动想做的事。现在至少有了一点证据，说明我们的方向可能走得通，我也更容易把当时的想法讲清楚。&lt;/p&gt;
&lt;p&gt;那时候，周围很多讨论都是“怎么把 ChatGPT 放进更多产品”“怎么让 ChatGPT 更适合开发者”。我却一直在想：现有的函数调用接口为什么要这样设计？开发者怎么用它来可靠地控制程序？&lt;/p&gt;
&lt;p&gt;Swyx：像是在已有的变通办法上，再叠加一层变通办法。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：问题还不止于此。我当时常说：如果函数调用不能为每个函数提供相应的 logit bias，让开发者知道或调节模型选择它的倾向，就不要让我参与这个项目。我的要求并不复杂。&lt;/p&gt;
&lt;p&gt;Swyx：你想要的是某种与置信度接近、但未必经过校准的信号。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：对，或者至少给出选择某个函数的概率。开发者需要控制模型在不同情况下采取什么行动，包括允许还是拒绝。同样是拒绝，迪士尼和 AI Dungeon 想设的门槛肯定不一样。可如果接口只让开发者通过提示词反复请求模型“请在这种情况下拒绝”，那怎么能算一个好的程序接口？大家已经这样用了很多年。&lt;/p&gt;
&lt;p&gt;现在的 Skill 也有类似问题。现有编程 Agent 对各自的运行框架适应得很好，但能力并不均匀，使用外部工具和 MCP 时往往没那么可靠。如果某个工具对业务很重要，开发者为什么不能明确提高模型调用它的倾向？现在往往还是得在系统消息里反复要求。这让我觉得很不合理。&lt;/p&gt;
&lt;p&gt;Swyx：我明白你的意思了。很高兴能在节目里和你聊这些，也期待你们接下来发布的东西。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：谢谢。接下来可能比你想的还快。&lt;/p&gt;
&lt;p&gt;Swyx：你们现在还在招数据、基础设施、市场和社区方面的人？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：都在招。我自认为还能胜任创始营销负责人，但团队会让我别再抢这份活，好好做 CEO。事情一下子多起来之后，你很快就会学会授权。&lt;/p&gt;
&lt;p&gt;我们也在招负责模型能力的人。他们的工作很大一部分与数据有关。我希望团队充分认可这类工作的价值，让直接改进模型能力的人得到应有的重视，同时又不在团队里制造奇怪的等级。&lt;/p&gt;
&lt;p&gt;说到文化，我挺高兴同事们不会因为我是 CEO 就事事顺着我。他们会开我的玩笑，也会直接反驳我。我觉得这是个好信号。&lt;/p&gt;
&lt;p&gt;另外，我们还需要平台工程师，把 Jev 部署到更多地方。对我们来说，服务器的位置尤其重要，因为网络传输时间会直接影响延迟。现在欧洲还没有我们的服务器，欧洲用户体验到的速度提升可能只有约三倍，而不是本来有机会达到的约一百倍，这让我很遗憾。&lt;/p&gt;
&lt;p&gt;Swyx：没关系，欧洲的生活节奏也慢一点。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：这话可是你说的，不是我说的（笑）。总之，我们希望把服务部署到更多地区。如果“每秒能获得多少智能”对用户很重要，我们就会把服务部署到更多地区。开发者在我们的能力之上构建产品，我非常在意他们的使用体验。&lt;/p&gt;
&lt;p&gt;我们也在招人，继续开发 Jev 之外的能力。公司的目标并不是只做 Jev 这一款模型，更不想只靠一种简单模型走到底。未来可能需要一个像 AWS 一样的平台，提供形态各异的智能能力。我希望我们朝这个方向走。&lt;/p&gt;
&lt;p&gt;Swyx：而那个平台会是你们，对吧？&lt;/p&gt;
&lt;p&gt;Diogo Almeida：现在就说一定是我们，太自大了。但我会尽一切努力去做。我觉得这会很有意思：我们现在探索的只是 System 1 式智能中的一层。如果把它类比成 TCP，上面还能建立许多层能力。&lt;/p&gt;
&lt;p&gt;Swyx：对，还有很多层。我甚至提过 Temporal，也许它能算传统七层模型之外的“第八层”。不过这个话题我们又能聊很久。你该回去工作，或者好好睡一觉了。谢谢你来。&lt;/p&gt;
&lt;p&gt;Diogo Almeida：谢谢邀请，聊得很开心。我很期待接下来要做的事。&lt;/p&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&lt;span style=&quot;color: #808080;&quot;&gt;本文来源：&lt;a href=&quot;https://36kr.com/p/3998248835551367?f=rss?clueId=348881126&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;极客邦科技InfoQ&lt;/a&gt;&lt;/span&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782531</link><guid isPermaLink="false">3782531</guid><pubDate>Fri, 25 Sep 2026 05:44:49 GMT</pubDate><author>极客邦科技InfoQ</author></item><item><title>AI想要安全？算力增10倍！老黄“偷着乐”</title><description>&lt;p&gt;英伟达CEO黄仁勋认为，AI 模型的能力竞赛已经见顶，真正卡住下一代模型的是安全验证。当厂商手握庞大的市场版图，研发重心必须从「堆能力」转向评估与测试。因为验证流程极其严苛，开发下一代模型所需的算力将暴涨 10 倍。&lt;/p&gt;
</description><link>https://wallstreetcn.com/charts/41959922</link><guid isPermaLink="false">41959922</guid><pubDate>Fri, 25 Sep 2026 05:25:32 GMT</pubDate><author>鲍奕龙</author></item><item><title>Meta CTO解释Muse：回归人性交互，下一代操纵系统的核心是“意图理解”</title><description>&lt;p&gt;Meta首席技术官Andrew Bosworth 24日在一档播客节目中，就公司旗下AI助手Muse及更广泛的AI战略发表了系统性阐述。当前AI产业过度沉迷于基准测试分数，而忽视了用户体验的本质——Muse的差异化正在于此。&lt;/p&gt;
&lt;p&gt;Muse自内测起便已获得Bosworth本人的高度认可，他表示自己迅速将大量工作负载转移至这一平台。产品正式发布后，外部用户的反应与内部预期高度吻合，令其团队深感鼓舞。Bosworth强调，Muse的成功并非来自模型原始智能的最大化，而是来自对&quot;如何让人类更好地使用工具&quot;这一命题的深入思考。&lt;/p&gt;
&lt;p&gt;与此同时，Bosworth描绘了Meta对下一代人机交互范式的判断：&lt;strong&gt;从&quot;直接操控&quot;走向&quot;意图理解&quot;，英语将成为新的编程语言。&lt;/strong&gt;在AI安全与隐私层面，Meta采取了若干值得关注的举措：公司延迟了Muse的发布时间以完善隐私架构，并推出端对端加密的&quot;私密AI处理&quot;功能——用户与服务器之间的通信经过全程加密，服务器端不留存任何记录。Bosworth将这一机制定性为面向最敏感应用场景的信任基础设施。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/64cd9e02-7ea9-4094-b21e-1ad07d19c393.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;615&quot; data-wscnw=&quot;1102&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;muse&quot;&gt;Muse的差异化：体验优先，而非跑分&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;Bosworth直接点名了当前AI行业的核心误区。&quot;我们花了过去几年大量时间讨论模型的科学，讨论谁在某个基准测试上领先10%或20%，但对大多数人而言，这根本不重要，&quot;他表示，&quot;重要的是对话的质感，以及你是否信任它。&quot;&lt;/p&gt;
&lt;p&gt;Muse的设计理念由此而来。Bosworth介绍，&lt;strong&gt;该团队拿到一个强力基础模型后，并未单纯最大化其原始性能，而是着重打磨使用体验——包括对话节奏、语气风格，乃至一个具备视觉反馈功能的&quot;小角色&quot;（little character）。&lt;/strong&gt;这个角色的存在并非纯粹装饰：对于科技早期采用者圈子以外的用户而言，它解决了一个关键的认知问题——&quot;AI现在在工作吗？我该怎么和它互动？&quot;&lt;/p&gt;
&lt;p&gt;Bosworth还特别提及Muse的一项独特功能：它会主动向用户提供反驳观点，在给出建议后主动呈现&quot;另一面&quot;。他认为这一特性在其他主流模型中尚未见到。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;f6d47fb1&quot;&gt;从&quot;直接操控&quot;到&quot;意图理解&quot;：界面范式的历史性转变&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;Bosworth将Muse及更广泛的AI助手定位为人机交互史上的范式级跃迁。他追溯至施乐帕克研究中心为Alto计算机开发的图形界面——这一&quot;直接操控&quot;范式此后被Mac和Windows沿用至今，构成了过去半个世纪的主流交互逻辑：点击、窗口焦点、一次一个应用。&lt;/p&gt;
&lt;p&gt;&quot;如果你在PC上关闭窗口时，鼠标偏离了那个X按钮一个像素，什么都不会发生。一个婴儿看着屏幕都知道你想点那个X，但计算机不知道，&quot;Bosworth说，&quot;这就是问题所在。&quot;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;在他看来，AI的核心价值在于打破这种&quot;人适应机器&quot;的单向关系。&lt;/strong&gt;当系统能够理解用户的意图而非仅响应精确指令时，人机交互进入了一个全新阶段。他将这一演进类比为编程语言从机器码到汇编、再到Python的持续抽象化过程：&quot;英语正在成为新的编程语言&quot;——这一趋势在Meta的AR/VR眼镜产品线上已有具体体现：AI助手被集成于系统层，用户可以通过自然语言调度空间界面，无需手动移动面板。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;ai-meta&quot;&gt;私密AI处理：Meta的隐私基础设施押注&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;在隐私架构层面，Bosworth详细介绍了Meta推出的&quot;私密处理&quot;机制。其工作方式为：&lt;strong&gt;用户设备与Meta服务器之间的通信经过端对端加密，数据在服务器端仅在&quot;可信执行环境&quot;（Trusted Execution Environment）内解密处理，即便是服务器操作人员也无法访问处理内容，且处理完成后服务器端不留存任何记录。用户的上下文信息保存在本地设备，由用户自主控制。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Bosworth坦承，这一方案存在产品层面的取舍——它意味着AI无法跨会话保留记忆，但他认为对于涉及高度敏感内容的使用场景，这一牺牲是值得的。值得注意的是，Meta在该架构的开发上引入了Signal协议创始人Moxie Marlinspike作为合作方，并承诺发布白皮书供独立安全研究人员核验，并设立漏洞赏金计划。&lt;/p&gt;
&lt;p&gt;谈及公众信任问题，Bosworth援引了微软的先例：这家公司在1990年代末因安全问题饱受诟病，但十年后已成为业界安全标杆。&quot;信任是步行而来，骑马而去，&quot;他说，&quot;重建信任需要长期一致地执行，持续满足或超越用户预期。&quot;&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;ai-agi-bosworth&quot;&gt;AI灭绝论与AGI：Bosworth的&quot;中间立场&quot;&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;面对近期在社交媒体上广泛传播的AI导致人类灭绝论，Bosworth明确表达了自己的立场，但措辞审慎。&quot;我不能给这些人赋予零概率，但我自己没有看到这种可能性，&quot;他说：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&quot;我在这个技术里工作，对它的底层机制有相当深入的理解，我对它感到放心。&quot;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;他同时对AGI的实现时间线持保守态度，认为当前行业普遍存在&quot;我们快要解决了&quot;的错觉，并指出这种错觉在AI历史上反复出现——他以1970年代的Dartmouth会议为例，彼时与会者相信十年内将实现通用人工智能。&quot;我认为我们距离我们现在所说的AGI还有相当长的距离，&quot;他表示。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;在意识与对齐问题上，Bosworth的立场接近Yann LeCun：他不认为当前AI具备意识，并警告将AI拟人化、赋予其情感或意识属性的做法，可能从对齐角度产生负面后果。他将&quot;对齐&quot;简化为一个务实定义：工具是否做了你想让它做的事。&quot;如果它不对齐，你就不会用它。这是人类历史上每一件产品都经历过的强大约束力。&quot;&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;meta-ai&quot;&gt;开源与&quot;给人以力量&quot;：Meta的AI政治哲学&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;Bosworth将Meta的开源AI战略置于公司更长历史脉络中加以阐释。他援引Meta最初的使命宣言——&quot;给予人们力量，让世界更加开放和互联&quot;——认为&quot;给人以力量&quot;才是这句话中更根本的锚点，而非&quot;开放&quot;或&quot;互联&quot;本身。&lt;/p&gt;
&lt;p&gt;&quot;把AI集中在少数几家公司手中，从长远看并不是维护社会的方式，&quot;他表示，并明确表态支持Mark Zuckerberg近期发布的&quot;AI属于所有人&quot;宣言。在产品层面，Meta已发布Muse Glimmer——这是Muse Spark的蒸馏版本，以开源形式对外公开。&lt;/p&gt;
&lt;p&gt;Bosworth也坦承蒸馏训练方式存在争议：这一技术通过使用大模型的输出来训练更小的模型，绕开了原始数据训练的巨大成本，因此在行业内引发了关于知识产权与资源公平的讨论。但他显然认为开放获取的价值高于这一代价。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782529</link><guid isPermaLink="false">3782529</guid><pubDate>Fri, 25 Sep 2026 05:19:41 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/f0595d35-c429-480e-a725-357c2a6c0c7a.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/4f0f4bcd-c78a-4f2a-9fc0-025cb7b782dd.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:06:42</itunes:duration></item><item><title>日元短线拉升，日本财务大臣：特朗普担忧日元走弱，将与美方密切协调</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;日本财务大臣片山皋月表示，特朗普及美方近期已就日元走弱表达关切，日方将继续与美方就汇率问题保持密切协调。消息后，日元短线快速走强。&lt;/p&gt;
&lt;p&gt;9月25日，据报道，片山皋月表示，具体的货币政策工具由日本央行决定。日本央行最近的加息举措旨在实现通胀目标。她希望日本央行在与政府保持沟通协调的同时，实施恰当的货币政策，并表示不对具体的汇率水平及汇率检查发表评论。&lt;/p&gt;
&lt;p&gt;她还称，特朗普及美方在峰会期间对日元走弱表达了担忧，日方将在外汇问题上与美方保持密切协调。高市早苗首相总体上对日元走弱表示关注。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;截至发稿，日元走强，美元兑日元跌0.29%至158.37。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/0ed1e8ad-0084-4294-9ccb-987e0770381c.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;689&quot; data-wscnw=&quot;1148&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782526</link><guid isPermaLink="false">3782526</guid><pubDate>Fri, 25 Sep 2026 02:42:05 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/886ba03e-6134-457d-a95b-5c77d82c5f33.jpeg"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/aff0cf50-7ad7-476c-bf22-ef60a283df15.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:00:50</itunes:duration><category>外汇</category></item><item><title>恒生科技指数日内跌幅扩大至2%。小米、阿里巴巴跌超3%</title><description>&lt;p&gt;恒生科技指数日内跌幅扩大至2%。小米、阿里巴巴跌超3%。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782519</link><guid isPermaLink="false">3782519</guid><pubDate>Fri, 25 Sep 2026 01:31:13 GMT</pubDate><itunes:image href="https://wpimg-wscn.awtmt.com/d0/24/94/-1-2-.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/6c88a43e-d1a7-41f5-ad7f-b433b3b55284.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:00:06</itunes:duration></item><item><title>美国“反抗浪潮”愈演愈烈！甲骨文巨型数据中心遭遇“不可抗力”，恐无法按期完工</title><description>&lt;p style=&quot;text-align: left;&quot;&gt;甲骨文援引不可抗力条款，试图为其在新墨西哥州的巨型数据中心项目筑起财务防火墙，这一举动令本已深陷困境的Project Jupiter再添变数，并迅速向整条融资链传导压力。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;据彭博报道，&lt;strong&gt;甲骨文已向该项目开发商——Blue Owl Capital旗下子公司Stack Infrastructure——发出援引不可抗力条款的正式通知&lt;/strong&gt;。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;报道称，&lt;strong&gt;甲骨文此举并非意图退出主要租户地位，而是寻求在项目无法按原计划于2028年上线的情况下，推迟相关付款义务&lt;/strong&gt;。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;消息公布后，甲骨文股价随即下挫，日内一度跌超7%，最终收盘仍跌约3.5%，Blue Owl Capital股价同步收跌3.6%，数据中心供能商Bloom Energy跌幅亦达3.1%。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/90846a43-2973-47cd-b6eb-fad27c84ce15.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;579&quot; data-wscnw=&quot;920&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;&lt;strong&gt;Project Jupiter是一个规模庞大的特殊目的载体（SPV）项目，计划在新墨西哥州约1400英亩土地上建设四座数据中心，为OpenAI提供总计3000亿美元的算力，融资结构涵盖债券、贷款及Blue Owl股权。&lt;/strong&gt;此次不可抗力通知的发出，令市场对该项目能否如期推进的疑虑骤然升温，相关贷款此前已跌至承压水平。&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot;&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/4c580c78-5883-40a6-8d7a-8e6fc6af609f.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;869&quot; data-wscnw=&quot;1173&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;4e218065&quot;&gt;项目本身：规模宏大，麻烦同样巨大&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;Project Jupiter位于新墨西哥州多纳安纳县，占地约1400英亩，&lt;strong&gt;设计算力容量达2.45吉瓦，相当于约180万户家庭的同时用电量，总投资规模约为1650亿美元。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;该项目由Stack Infrastructure开发，是Blue Owl的投资组合公司，而Blue Owl本身亦承诺提供股权资金。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;然而，项目自宣布至今近两年，已陷入多重困境：&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;ul&gt;
&lt;li&gt;关键能源许可申请遭到拒绝；&lt;/li&gt;
&lt;li&gt;当地居民对项目的供水影响和空气质量问题强烈抗议；&lt;/li&gt;
&lt;li&gt;甲骨文签约的能源供应商Bloom Energy的燃气排放同样引发外界批评。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;据彭博此前报道，&lt;strong&gt;项目首期工程已较原定完工时间延误至少七个月，原计划于今年11月投入运营的节点已不可能实现。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;雪上加霜的是，为Project Jupiter供气的Energy Transfer LP天然气管道项目，原定本月投入使用，但因新墨西哥州土地局多次拒绝批准管线路线许可，已延期至少六个月，最早于2027年2月1日才能投入服务。&lt;/p&gt;
&lt;p&gt;Bloom Energy股价随甲骨文消息应声下跌。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;b5401ac0&quot;&gt;不可抗力通知：法律手段背后的财务逻辑&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;不可抗力条款在能源与大宗商品领域长期是应对极端事件的标准工具。&lt;/p&gt;
&lt;p&gt;但据律所Quinn Emanuel Urquhart &amp;amp; Sullivan LLP今年6月发布的客户简报，&lt;strong&gt;此类条款正在数据中心开发领域加速普及&lt;/strong&gt;。简报指出：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;在AI数据中心项目中，不可抗力条款已不再是合同末尾的样板条文，而是一项核心的诉讼与风险分配工具，可以决定一个延误究竟只是孤立事件，还是会级联穿透整个项目的建设、客户、电力、保险与融资文件。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;彭博指出，&lt;strong&gt;甲骨文发出该通知的意图，并非立即退出作为项目主要租户的角色，而是在Project Jupiter无法按2028年计划上线的情况下，为自身争取暂缓付款的合同依据。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;不过，此举是否能真正豁免甲骨文此前承诺的财务义务，目前仍存在不确定性。对此，甲骨文发言人回应称：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;Project Jupiter仍在按计划推进，我们对新墨西哥州的承诺坚定不移，对项目前景充满信心。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;此外，值得关注的是，数据中心租约通常含有条款，允许客户在服务未能按时启动的情况下退出合同。谷歌今年与SpaceX签订算力合同时，即保留了在特定日期前无法获得访问权限情形下的终止权利。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;open-ai&quot;&gt;连锁反应：星际之门蓝图与OpenAI的双重压力&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;&lt;strong&gt;Project Jupiter延误的影响远不止于单一项目。作为星际之门计划的旗舰园区，其进度直接牵动OpenAI的算力部署节奏。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;OpenAI此前已与甲骨文和软银签署协议，支持包括新墨西哥州在内的五个数据中心的开发建设，算力缺口一旦形成，将对其产品扩张计划和商业化进程产生实质影响。&lt;/p&gt;
&lt;p&gt;Blue Owl Capital股价随消息公布跌至近两个月低点，持续逼近历史低位。甲骨文自身财务状况亦不容乐观，公司债务规模约为1670亿美元。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/b21979c9-6b6c-40a6-8eca-c5a1161a406d.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;691&quot; data-wscnw=&quot;1173&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;甲骨文的信用违约互换（CDS）价差已连续刷新历史高位。&lt;/p&gt;
&lt;p&gt;&lt;img class=&quot; wscnph&quot; src=&quot;https://wpimg-wscn.awtmt.com/d1ee044e-f53e-47ff-b152-ac9f2b1b4ff5.png&quot; data-wscntype=&quot;image&quot; data-wscnh=&quot;637&quot; data-wscnw=&quot;1173&quot; referrerpolicy=&quot;no-referrer&quot;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;星际之门计划的另一锚点项目、由软银孙正义主导的SB Energy数据中心同样麻烦缠身。&lt;/strong&gt;该项目IPO计划已因类似的延误问题被迫推迟。&lt;/p&gt;
&lt;p&gt;SB Energy设计发电量高达8吉瓦，完工后将成为全球最大数据中心，但其落地同样面临来自地方层面的强烈阻力。甲骨文今日的不可抗力通知，或将进一步打击外界对该IPO的信心。&lt;/p&gt;
&lt;div data-testid=&quot;stHeadingWithActionElements&quot;&gt;
&lt;h2 id=&quot;70a9751e&quot;&gt;政治变量：中期选举或加剧项目不确定性&lt;/h2&gt;
&lt;/div&gt;
&lt;p&gt;项目所在的新墨西哥州正成为AI数据中心建设争议的政治风向标。&lt;/p&gt;
&lt;p&gt;当地居民此前并不知晓该项目与甲骨文和OpenAI存在关联。据彭博此前查阅的文件显示，开发商在获得审批后才公开了这一信息，由此引发更广泛的信任危机。&lt;/p&gt;
&lt;p&gt;甲骨文目前已在新墨西哥州展开公关攻势，试图化解当地反对情绪，但效果尚不明朗。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;美国中期选举结果将成为影响项目走向的关键变量，若民主党赢得多数席位，外界普遍预期将对相关项目施加更严格的监管审查，进一步推迟建设进程。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这一政治不确定性，叠加许可瓶颈、融资压力与能源供应延误，正在将Project Jupiter从一个AI投资盛景的象征，逐步演变为整个美国AI基础设施建设能否如期落地的压力测试。&lt;/p&gt;&lt;div style=&quot;color: #666; margin-bottom: 15px;&quot;&gt;风险提示及免责条款&lt;/div&gt;
          &lt;div style=&quot;font-size: 12px;font-family: 黑体;color: #666;line-height: 20px;&quot;&gt;
            市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。
          &lt;/div&gt;
</description><link>https://wallstreetcn.com/articles/3782479</link><guid isPermaLink="false">3782479</guid><pubDate>Fri, 25 Sep 2026 01:24:11 GMT</pubDate><author>卜淑情、鲍奕龙</author><itunes:image href="https://wpimg-wscn.awtmt.com/5b5b76bf-515b-4c40-b3dc-67f9831b3dc5.png"></itunes:image><enclosure url="https://wpimg-wscn.awtmt.com/0d04c4c2-389f-448e-bce0-b03dff035a2b.mp3" type="audio/mpeg"></enclosure><itunes:duration>0:05:54</itunes:duration></item></channel></rss>