JEPA 世界模型泛化理論:為什麼長步規劃別再預測像素
JEPA 世界模型泛化理論:為什麼長步規劃別再預測像素
這支影片解讀北京大學王亦森團隊 2026 年論文《基於 JEPA 的世界模型的泛化理論》。核心結論是:JEPA 不在像素層級預測未來,而是在潛空間預測語義狀態;其訓練本質可被理解為對「動作條件共現矩陣」做非對稱低秩矩陣分解。這套理論把工程上常見的「潛空間比較省算力、比較抗噪」直覺,轉成可討論的泛化誤差邊界,並說明長步規劃時誤差近似線性累積,因此單步誤差底子越乾淨,越能撐住 25 步以上的規劃。
像素級世界模型的問題:算了太多無關細節
01:31影片把傳統輸入級預測比喻成「想看一本書的劇情,卻被要求背下整個書架的封面顏色、紙張厚度與條碼」。在世界模型裡,這對應到不只預測車的位置,還要預測反光、路面紋理、邊緣噪點等像素細節。
這些細節在短期畫面重建上看似精準,但對動作規劃未必是關鍵訊號;在高噪音與長時域任務中,反而會拖垮樣本效率與泛化能力。
問題定義JEPA 的核心:在潛空間預測語義狀態
02:37JEPA 不要求模型生成未來每個像素,而是先把觀測壓縮成語義向量,再預測下一個潛在狀態。影片用「只預測車的位置變了」來說明這個取捨。
這個做法的價值不是單純「比較省算力」,而是把不穩定或無關的高頻噪音排除在規劃主幹之外,讓模型把容量集中在對未來動作有用的因果結構上。
架構核心論文的數學轉譯:JEPA loss 等價於低秩矩陣分解問題
03:15影片指出,論文把動作條件下的狀態轉移建成「動作條件共現矩陣」。和傳統對稱的圖不同,世界模型有時間箭頭:同一個狀態在踩油門、煞車、打方向盤時,會通往不同的未來分佈。
Theorem 3.1 的重點,是把 JEPA 預訓練風險函數和這個矩陣的低秩分解誤差連起來。換句話說,模型訓練不再只是憑直覺最小化 loss,而是在近似一個由動作條件定義的因果轉移結構。
理論主軸K 是資訊瓶頸旋鈕:壓縮太多或太少都會出事
05:00潛空間維度 K 是影片反覆強調的工程旋鈕。K 太小時,模型會有效濾掉光影與噪點,樣本誤差較小,但也可能把紅綠燈這類關鍵訊號一起丟掉,造成逼近誤差變大。
K 太大時,模型保留太多細節,逼近誤差下降,但會更容易擬合噪音,樣本誤差上升。影片用 JPEG 壓縮率作比喻:壓太狠會糊,壓太少檔案太大又難以傳輸。
工程取捨短規劃不用迷信 JEPA;長規劃與高噪音纔是主戰場
06:36在短期一到五步任務裡,影片指出 JEPA 與像素級預測幾乎咬合在一起,成功率都接近滿分。對低複雜度、短視距任務,複雜潛空間架構未必帶來 ROI。
差異出現在 25 步長規劃且噪音標準差很高時:像素級預測成功率斷崖式下降,而 JEPA 潛空間模型雖然也下降,但更能維持基礎表現。影片把這解釋為潛空間壓縮降低了樣本誤差爆炸的傷害。
實驗結論多步誤差是線性累積:單步底子決定長程生死線
09:16影片將單步泛化誤差拆成兩部分:逼近誤差來自被截斷的奇異值,也就是被丟掉的資訊;樣本誤差則和模型假設空間、拉德馬赫複雜性、前空間維度等因素相關。
多步規劃的定理被解釋成「總誤差約等於單步誤差上界乘以 T」。這不是指數爆炸,但當 T 到 25 或更長時,單步誤差仍會被放大到足以讓系統崩潰。
泛化誤差理論仍有邊界:不能直接當成工廠施工圖
10:49影片列出四個限制:第一,多步規劃定理假設動態系統是確定性的;第二,泛化上界依賴函數範數與拉德馬赫複雜性等紙面條件,對大型 Vision Transformer 很難直接計算;第三,實驗只在合成 2D 系統;第四,論文只比較純潛空間與純輸入空間,沒有涵蓋工業界常見的混合多尺度模型。
因此這篇論文比較像是「理論邊界與設計指南」,不是可以直接搬進真實車間或機器人產線的完整工程方案。
限制工程建議:依時域與噪音選架構,不要盲目煉丹
17:58影片最後把工程建議收斂成三點:第一,不要盲目追求全知全能的生成模型,K 是資訊瓶頸的實體旋鈕;第二,要先明確業務時域,短距離低噪音任務用簡單方法可能 ROI 最高,長距離高噪音任務才需要潛空間底座升級;第三,泛化理論的價值是讓架構設計從碰運氣變成有邊界感的精準施藥。
落地建議「前空間維度 K,就是資訊瓶頸的實體化旋鈕。」
重點時間戳索引
- 00:00影片開場提出問題:實驗室有效的機器人,到了真實工廠有灰塵與噪音就翻車;長線規劃超過二十多步時,世界模型會出現智力降級。
- 01:31世界模型若在輸入空間預測像素,會把車漆反光、路面紋理、鏡頭噪點等細節一起建模,造成嚴重算力浪費。
- 02:37JEPA 的做法是把畫面壓縮成高維語義向量,在潛空間只預測「位置變了」這類核心語義,而不是重建所有像素。
- 03:15論文引入動作條件共現矩陣;世界模型的狀態轉移有時間箭頭與因果方向,因此矩陣不是對稱的,而且強依賴輸入動作。
- 04:18Theorem 3.1 將 JEPA 預訓練風險函數與矩陣低秩分解誤差對應起來,讓原本偏玄學的訓練 loss 有了數學解釋。
- 05:00潛空間維度 K 是核心 trade-off:K 太小會濾掉噪音但可能丟掉關鍵訊號;K 太大則接近像素預測,樣本誤差會膨脹。
- 06:36合成 2D 控制實驗中,短期一到五步規劃時,JEPA 與輸入級像素預測表現接近,前者沒有明顯優勢。
- 08:24當任務拉到 25 步且環境噪音很高時,像素級預測成功率出現斷崖式下跌,JEPA 潛空間模型則相對更能維持表現。
- 09:16單步泛化誤差界可拆成逼近誤差與樣本誤差:截斷奇異值造成資訊損失;模型複雜度與前空間維度會放大樣本誤差。
- 10:00多步規劃的總體誤差約為單步誤差上界乘以 T,是線性累積而非指數爆炸;因此長規劃更依賴乾淨的單步基礎。
- 10:49影片列出四個限制:確定性動態假設、泛化上界難以量化套到大型 ViT、只在合成 2D 系統驗證、沒有涵蓋混合多尺度架構。
- 12:44影片把這篇論文放進 JEPA / 自監督學習 / 圖理論脈絡:LeCun 2022 藍皮書、增強圖與拉普拉斯矩陣、後續 JEPA 理論與應用工作。
- 17:58給工程端的三點建議:別盲目追求全像素生成;依業務時域選架構;用泛化理論把煉丹式調參改成有邊界感的架構設計。
⚠️ 未確認 / 無法核對項目
- YouTube 官方逐字稿與自動字幕皆不可用;主內容依 Whisper STT 產出,部分專有名詞可能有 ASR 漂字。
- 影片最後約 19:38 後 Whisper 產生疑似無意義尾段,本報告未採用該尾段作為內容依據。
🎙️ ASR 漂字對照表
| 事件模型 | → | 世界模型 |
| 前空間 / Laternate State | → | 潛空間 / Latent Space |
| Jabber / Jabber 架構 | → | JEPA |
| 贡献矩阵 | → | 共現矩陣(依影片描述語境) |
| 拉德马和复杂性 | → | 拉德馬赫複雜性 |
| Zerom / Zerom 4.6 | → | Theorem 4.6 |
| Neural IPS | → | NeurIPS |
| Gain-ed agent | → | 具身 agent(依語境) |
📎 原始內容(查證 / AI 追查用,非閱讀主文,點擊展開)
为什么你的机器人在实验室里百步穿杨,一放到真实工厂里沾点灰尘就彻底“翻车”?为什么几十步的长线动作规划,会让千亿参数的世界模型智力瞬间降级?告别“盲人摸象”式的调参玄学!本期视频,我将为你深度拆解北京大学 Yisen Wang(王亦森教授)团队2026年的重磅论文《基于 JEPA 的世界模型的泛化理论》。我们将彻底掀开潜空间预测的“算力底牌”,用极其通透的工程白话,把你脑子里关于世界模型、动作规划与泛化误差的模糊直觉,全部钉死在清晰的数学边界上! Why do robots that work perfectly in the lab fail the moment they face real-world dust? Why does long-horizon planning cause even massive world models to suffer catastrophic intelligence degradation? Say goodbye to blind hyperparameter tuning! In this video, I dive deep into the groundbreaking 2026 paper, "A Generalization Theory for JEPA-Based World Models," by Prof. Yisen Wang's team at Peking University. We'll uncover the secrets of latent space planning and translate complex generalization error bounds into practical engineering takeaways, ending the era of AI "alchemy." ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ 📄 核心内容 & 关键词 | Key Content & Keywords: 潜空间预测与 JEPA (Latent Space & JEPA): 彻底搞懂联合嵌入预测架构(JEPA)的核心,为什么放弃输入级(Input-level)的像素预测,转而在潜空间进行特征压缩与规划是算力的最优解。 Understand the core of Joint-Embedding Predictive Architecture (JEPA) and why abandoning input-level pixel prediction for latent space planning is the ultimate compute optimization. 条件共现矩阵 (Conditional Co-occurrence Matrix): 揭秘 JEPA 预训练 Loss 的数学本质——如何将因果时序的流转图,暴烈地拆解成一道非对称的低秩矩阵分解题。 Revealing the mathematical essence of JEPA's pre-training loss: transforming causal temporal graphs into an asymmetric low-rank matrix factorization problem. 泛化误差界限 (Generalization Error Bounds): 解析全篇最硬核的数学发现,揭示逼近误差(Approximation Error)与样本误差(Sample Error)之间的致命博弈,以及多步规划中误差为何是线性累积而非指数爆炸。 Unpacking the hardcore math behind approximation vs. sample errors, and proving that multi-step planning errors accumulate linearly, not exponentially. 工程落地指南 (Engineering Takeaways): 给具身智能和 AI 算法架构师的三大指导:如何根据业务时域(短期 vs 长期)和环境噪音,精准设置信息瓶颈临界点,摆脱“炼丹”玄学。 Three crucial guidelines for Embodied AI architects on how to choose model architectures based on horizon length and environmental noise, moving from alchemy to exact science. ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ 🔔 订阅并加入我的会员 | Subscribe & Join my membership! 你认为未来具身智能的主流架构,是纯潜空间(Pure Latent Space)、还是局部引入像素微调的混合多尺度模型(Hybrid Architecture)?在评论区分享你的看法! Do you think the future of Embodied AI will rely on pure latent space models or hybrid multi-scale architectures? Share your thoughts in the comments below! 如果你喜欢本期内容,请不要忘记点赞、分享,并【订阅】我的频道,开启小铃铛,第一时间获取关于前沿科技的深度解析。 If you enjoyed this video, please like, share, and SUBSCRIBE for more deep dives into our technological future. 👉 支持我持续创作 | Support My Work: 加入我的会员频道,提前观看视频并获得专属福利! Join my channel membership to get early access to videos and exclusive perks! https://www.youtube.com/channel/UCUruNDxpAAIsagdOH9cBuXA/join ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ 论文链接,请点击:https://www.youtube.com/post/UgkxJOdO_aSuNRlgCff8dLyzJ0QmYA0i57WF ▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬ #JEPA #WorldModels #EmbodiedAI #YannLeCun #MachineLearning #Robotics #DeepLearning #MatrixFactorization #AI #人工智能 #世界模型 #具身智能 #潜空间 #泛化理论 #算法架构 #科技解析 #深度学习
1 00:00:00,000 --> 00:00:13,240 为什么你的机器人在实验室里百步穿扬 2 00:00:13,240 --> 00:00:15,140 一放到真实工厂里 3 00:00:15,140 --> 00:00:17,820 摄像头只要粘上一点微尘 4 00:00:17,820 --> 00:00:20,500 它就会像个无头苍蝇一样撞墙呢 5 00:00:20,500 --> 00:00:23,380 为什么我们给Agent规划的部数 6 00:00:23,380 --> 00:00:25,020 只要超过20部 7 00:00:25,020 --> 00:00:27,980 哪怕是几千亿参数的事件模型 8 00:00:27,980 --> 00:00:30,960 也会出现不可逆的智力降级呢 9 00:00:30,960 --> 00:00:32,460 过去两年 10 00:00:32,460 --> 00:00:35,180 所有的自动驾驶和聚升智能公司 11 00:00:35,180 --> 00:00:38,000 都在疯狂追捧杨立坤提出的JEPA 12 00:00:38,000 --> 00:00:40,700 也就是联合嵌入预测架构 13 00:00:40,700 --> 00:00:42,900 大家凭工程直觉都知道 14 00:00:42,900 --> 00:00:44,900 在前空间里做预测 15 00:00:44,900 --> 00:00:48,740 比傻乎乎的生成未来视频的每个像素要好 16 00:00:48,740 --> 00:00:50,660 但是为什么好 17 00:00:50,660 --> 00:00:51,480 好多少 18 00:00:51,480 --> 00:00:54,220 在什么边界条件下它会翻车 19 00:00:54,220 --> 00:00:56,400 根本没有人算过这笔账 20 00:00:56,400 --> 00:00:59,500 大家全靠盲人摸像时的调餐 21 00:00:59,500 --> 00:01:02,540 我们今天要聊的这篇重磅论文 22 00:01:02,540 --> 00:01:04,600 彻底打破了这个玄学黑河 23 00:01:04,600 --> 00:01:06,240 这篇论文的题目叫 24 00:01:06,240 --> 00:01:09,380 基于JEPA的世界模型的泛化理论 25 00:01:09,380 --> 00:01:11,380 它在全世界范围内 26 00:01:11,380 --> 00:01:14,040 第一次用严密的数学公式 27 00:01:14,040 --> 00:01:17,140 把JEPA的放化能力趴了个底朝天 28 00:01:17,140 --> 00:01:18,740 在接下来的时间里 29 00:01:18,740 --> 00:01:21,340 我将用极其通透的工程大白化 30 00:01:21,340 --> 00:01:23,740 把你脑子里关于世界模型 31 00:01:23,740 --> 00:01:26,980 动作规划和特征降维的模糊直觉 32 00:01:26,980 --> 00:01:29,660 全部钉死在清晰的数学边界上 33 00:01:29,660 --> 00:01:31,840 在拆解复杂的数学之前 34 00:01:31,840 --> 00:01:34,020 我们先统一一下认知 35 00:01:34,020 --> 00:01:36,160 到底什么是世界模型呢 36 00:01:36,160 --> 00:01:38,240 传统的生成式模型 37 00:01:38,240 --> 00:01:40,000 比如大家以前玩过的 38 00:01:40,000 --> 00:01:41,340 视频生成大模型 39 00:01:41,340 --> 00:01:43,720 它的预测未来是怎么做的呢 40 00:01:43,720 --> 00:01:45,000 是挖图 41 00:01:45,000 --> 00:01:46,780 你给它一个动作指令 42 00:01:46,780 --> 00:01:48,400 它要把下一秒的画面 43 00:01:48,400 --> 00:01:50,260 每一帧每一个像素 44 00:01:50,260 --> 00:01:52,440 都严丝合缝地渲染出来 45 00:01:52,440 --> 00:01:53,640 在工程上 46 00:01:53,640 --> 00:01:55,580 这就叫在输入空间 47 00:01:55,580 --> 00:01:57,740 也就是input level做预测 48 00:01:57,740 --> 00:02:00,080 这带来的通面是什么呢 49 00:02:00,080 --> 00:02:02,200 是极其荒谬的算力浪费 50 00:02:02,200 --> 00:02:03,480 你看屏幕 51 00:02:03,480 --> 00:02:06,040 看原论文里的这张对比图 52 00:02:06,040 --> 00:02:07,740 左边是辆橘色的小汽车 53 00:02:07,740 --> 00:02:10,800 如果你用像素去预测它向前开 54 00:02:10,800 --> 00:02:13,680 你的模型不仅要算这辆车的位移 55 00:02:13,680 --> 00:02:15,720 还要算车漆的反光 56 00:02:15,720 --> 00:02:17,200 地面博右路的文理 57 00:02:17,200 --> 00:02:19,860 甚至镜头边缘的一点噪点 58 00:02:19,860 --> 00:02:21,480 这就像什么呢 59 00:02:21,480 --> 00:02:23,200 这就像你去图书馆 60 00:02:23,200 --> 00:02:25,480 只想借一本三体看个剧情 61 00:02:25,480 --> 00:02:27,080 但图书馆里面 62 00:02:27,080 --> 00:02:29,540 非要让你把整整一个书架的 63 00:02:29,540 --> 00:02:30,800 书的封面颜色 64 00:02:30,800 --> 00:02:31,900 纸张厚度 65 00:02:31,900 --> 00:02:33,220 甚至条形码的数字 66 00:02:33,220 --> 00:02:34,620 全都背下来 67 00:02:34,620 --> 00:02:35,780 这不是有病吗 68 00:02:35,780 --> 00:02:37,900 所以JEPA架构喊了停 69 00:02:37,900 --> 00:02:39,640 我们不预测像素了 70 00:02:39,640 --> 00:02:43,140 我们把画面压缩成一串高尾的语义相量 71 00:02:43,140 --> 00:02:45,260 也就是Laternate State前空间 72 00:02:45,260 --> 00:02:47,000 我只预测这辆车 73 00:02:47,000 --> 00:02:49,120 位置变了这个核心语义 74 00:02:49,120 --> 00:02:50,780 这就是JEPA的核心 75 00:02:50,780 --> 00:02:53,120 在前空间里预测未来 76 00:02:53,120 --> 00:02:55,380 直觉上是当然省算力 77 00:02:55,380 --> 00:02:58,180 但研究团队问了一个极其银合的问题 78 00:02:58,180 --> 00:02:59,920 你把信息压缩了 79 00:02:59,920 --> 00:03:02,140 你怎么保证压缩后的东西 80 00:03:02,140 --> 00:03:06,660 在下游做几步甚至几十步的复杂动作规划时 81 00:03:06,660 --> 00:03:08,220 还能保持精准呢 82 00:03:08,220 --> 00:03:09,980 为了回答这个问题 83 00:03:09,980 --> 00:03:13,600 作者掏出了全篇最漂亮的一个数学工具 84 00:03:13,600 --> 00:03:15,860 叫做条件普图建模 85 00:03:15,860 --> 00:03:18,120 我们先来看论文里的核心创新 86 00:03:18,120 --> 00:03:21,960 一个叫做动作条件贡献矩阵的数学结构 87 00:03:21,960 --> 00:03:23,760 符号是MOA 88 00:03:23,760 --> 00:03:25,180 这什么意思呢 89 00:03:25,180 --> 00:03:26,180 很简单 90 00:03:26,180 --> 00:03:28,720 在传统的字监督对比学习里 91 00:03:28,720 --> 00:03:30,700 图的连接是对称的 92 00:03:30,700 --> 00:03:32,920 狗的图片A增强成图片B 93 00:03:32,920 --> 00:03:35,340 图片B也能退回图片A 94 00:03:35,340 --> 00:03:36,940 它们是个无向图 95 00:03:36,940 --> 00:03:38,560 但世界模型不一样 96 00:03:38,560 --> 00:03:40,880 世界是有时间箭头的 97 00:03:40,880 --> 00:03:41,820 是有因果的 98 00:03:41,820 --> 00:03:42,960 你踩下油门 99 00:03:42,960 --> 00:03:44,460 也就是输入动作A 100 00:03:44,460 --> 00:03:47,820 车子从状态X变到了状态X+, 101 00:03:47,820 --> 00:03:51,060 这个转移概率W是单向的 102 00:03:51,060 --> 00:03:52,300 你不能凭空倒车 103 00:03:52,300 --> 00:03:55,760 所以这个矩阵MOA极其特殊 104 00:03:55,760 --> 00:03:57,240 它不是对称的 105 00:03:57,240 --> 00:04:00,160 并且它强依赖于你输入的动作A 106 00:04:00,160 --> 00:04:02,460 你打方向盘和踩刹车 107 00:04:02,460 --> 00:04:06,520 面对的是两张完全不同的未来概率图 108 00:04:06,520 --> 00:04:08,760 这就相当于给每一种操作指令 109 00:04:08,760 --> 00:04:11,840 都建了一个独立的平行宇宙阅览室 110 00:04:11,840 --> 00:04:12,560 好 111 00:04:12,560 --> 00:04:13,680 有了这个矩阵 112 00:04:13,680 --> 00:04:15,960 作者干了一件堪称魔法的事情 113 00:04:15,960 --> 00:04:18,380 你注意看屏幕上的Theorem 3.1 114 00:04:18,380 --> 00:04:19,600 看明白了吗 115 00:04:19,600 --> 00:04:21,360 左边是Jabber架构 116 00:04:21,360 --> 00:04:23,460 在做预训练时的风险函数 117 00:04:23,460 --> 00:04:24,420 也就是Loss 118 00:04:24,420 --> 00:04:27,980 右边是一个矩阵的低值分解误差 119 00:04:27,980 --> 00:04:31,420 作者用极其优雅的数学严格证明了 120 00:04:31,420 --> 00:04:33,340 我们在深度学习框架里 121 00:04:33,340 --> 00:04:35,540 哼哧哼哧练单调餐 122 00:04:35,540 --> 00:04:37,200 最小化Jabber的Loss 123 00:04:37,200 --> 00:04:40,080 在数学本质上完全等价于 124 00:04:40,080 --> 00:04:43,060 我们在对那庞大的条件贡献矩阵 125 00:04:43,060 --> 00:04:44,720 进行矩阵分解 126 00:04:44,720 --> 00:04:47,020 这就彻底神经气爽了 127 00:04:47,020 --> 00:04:50,320 这就好比你本来是在玄学一样的蒙眼调悠 128 00:04:50,320 --> 00:04:52,660 现在作者直接塞给你一张 129 00:04:52,660 --> 00:04:54,880 天体力学的受力分析图 130 00:04:54,880 --> 00:04:56,600 只要矩阵分解的好 131 00:04:56,600 --> 00:04:58,520 你预训练的模型底子就好 132 00:04:58,520 --> 00:04:59,520 但是 133 00:05:00,000 --> 00:05:01,160 看下没有免费的午餐 134 00:05:01,160 --> 00:05:03,480 有分解就有tradeoff 135 00:05:03,480 --> 00:05:05,740 就有既要又要的取舍 136 00:05:05,740 --> 00:05:06,980 在论文中 137 00:05:06,980 --> 00:05:10,180 这个取舍体现在前空间的维度上 138 00:05:10,180 --> 00:05:11,360 也就是参数K 139 00:05:11,360 --> 00:05:13,780 如果你把维度K设得很小 140 00:05:13,780 --> 00:05:17,520 就意味着你对图画进行了极其暴力的压缩 141 00:05:17,520 --> 00:05:19,120 好处是什么呢 142 00:05:19,120 --> 00:05:20,500 是去尾存真 143 00:05:20,500 --> 00:05:24,180 把那些光影噪点全都过滤掉了 144 00:05:24,180 --> 00:05:27,120 这在机器学习里叫样本误差小 145 00:05:27,120 --> 00:05:28,820 那代价是什么呢 146 00:05:28,820 --> 00:05:31,100 你可能会把真正有用的信息 147 00:05:31,100 --> 00:05:33,900 比如远处的红绿灯也不小心扔了 148 00:05:33,900 --> 00:05:35,960 这叫逼近误差大 149 00:05:35,960 --> 00:05:36,920 反过来 150 00:05:36,920 --> 00:05:39,600 如果你把K设得跟原图一样大 151 00:05:39,600 --> 00:05:42,480 那就退化成了传统的输入级预测 152 00:05:42,480 --> 00:05:44,140 逼近误差没了 153 00:05:44,140 --> 00:05:46,580 但你会因为要拟合没处造点 154 00:05:46,580 --> 00:05:48,640 导致样本误差爆炸 155 00:05:48,640 --> 00:05:52,140 这就像我们用JPEG格式压缩图片 156 00:05:52,140 --> 00:05:53,600 压缩率太高 157 00:05:53,600 --> 00:05:54,540 图片糊了 158 00:05:54,540 --> 00:05:55,460 细节没了 159 00:05:55,460 --> 00:05:56,740 压缩率太低 160 00:05:56,740 --> 00:05:57,840 文件极大 161 00:05:57,840 --> 00:05:59,120 传输卡顿 162 00:05:59,120 --> 00:06:01,920 那怎么在这两指之间找平衡呢 163 00:06:01,920 --> 00:06:06,120 作者搭建了一个纯粹的二维连接控制合成环境 164 00:06:06,120 --> 00:06:10,120 在这个系统里真实的动态状态只有四维 165 00:06:10,120 --> 00:06:11,400 位置和速度 166 00:06:11,400 --> 00:06:17,120 但作者给观测画面里加了大量的高维的非线性干扰特征 167 00:06:17,120 --> 00:06:19,400 和完全不可预测的随机造点 168 00:06:19,400 --> 00:06:23,200 训练时模型只往前预测短短的三步 169 00:06:23,200 --> 00:06:25,400 但在下游的动作规划测试中 170 00:06:25,400 --> 00:06:30,400 作者要求模型规划一步五步甚至极其变态的25步 171 00:06:30,400 --> 00:06:36,400 那我们现在来看看在这个算力炼丹炉里究竟炼出了什么真经白银 172 00:06:36,400 --> 00:06:37,520 你注意看屏幕 173 00:06:37,520 --> 00:06:39,480 如果你平时只看论文的摘要 174 00:06:39,480 --> 00:06:43,000 你绝对会错过这种工程反直觉现象 175 00:06:43,000 --> 00:06:44,240 大家做业务 176 00:06:44,240 --> 00:06:45,440 老板最喜欢问 177 00:06:45,440 --> 00:06:47,280 我们上了最新世界模型 178 00:06:47,280 --> 00:06:48,920 准确率能提多少 179 00:06:48,920 --> 00:06:50,440 你看第一个画板 180 00:06:50,440 --> 00:06:53,560 当规划部署只有一步到五步 181 00:06:53,560 --> 00:06:55,520 也就是极短周期的任务时 182 00:06:55,520 --> 00:07:00,620 呈现代表的前空间JEPA和蓝线代表的输入级像素预测 183 00:07:00,620 --> 00:07:02,260 私自的咬合在一起 184 00:07:02,260 --> 00:07:05,220 成功率都在百分之百附近横跳 185 00:07:05,220 --> 00:07:06,800 这意味着什么呢 186 00:07:06,800 --> 00:07:09,840 这意味着如果你的机器狗只是用来做 187 00:07:09,840 --> 00:07:14,160 拿下面前的杯子这种短视剧的低复杂度的任务 188 00:07:14,160 --> 00:07:15,640 你搞什么前空间 189 00:07:15,640 --> 00:07:16,980 搞什么特征提取 190 00:07:16,980 --> 00:07:19,080 都是在浪费研发精力 191 00:07:19,080 --> 00:07:21,420 像素级预测完全够用 192 00:07:21,420 --> 00:07:24,060 前空间甚至没有捞到一点好处 193 00:07:24,060 --> 00:07:28,020 但是你注意图二右下角这个异常的拐点 194 00:07:28,020 --> 00:07:30,500 当我们把业务难度拉满 195 00:07:30,500 --> 00:07:33,020 要求agent连续规划25步 196 00:07:33,020 --> 00:07:39,420 并且把环境的随机噪音标准差拉到0.6甚至1.0的极高水平时 197 00:07:39,420 --> 00:07:40,480 你看蓝线 198 00:07:40,480 --> 00:07:42,720 也就是输入级像素预测 199 00:07:42,720 --> 00:07:47,980 它就像断崖一样直接从0.8的成功率暴跌到了0.2以下 200 00:07:47,980 --> 00:07:50,120 你的机器人彻底瞎了 201 00:07:50,120 --> 00:07:51,320 系统崩溃了 202 00:07:51,320 --> 00:07:53,820 而代表JEPA前空间的呈现 203 00:07:53,820 --> 00:07:55,700 它虽然也在下降 204 00:07:55,700 --> 00:08:00,300 但它像一根极其坚韧的钢丝死死的维持在0.2 205 00:08:00,300 --> 00:08:03,060 为什么会发生这种经典逆转呢 206 00:08:03,060 --> 00:08:07,600 这就引出了全篇最隐和最极有理论深度的核心发现 207 00:08:07,600 --> 00:08:11,300 那就是我们在单步规划和多步规划时的 208 00:08:11,300 --> 00:08:13,700 泛化误差界到底长什么样 209 00:08:13,700 --> 00:08:16,300 来我们来做一个深呼吸 210 00:08:16,300 --> 00:08:19,860 我们要上全篇最长的一串数学公式了 211 00:08:19,860 --> 00:08:23,960 这是一段极其华丽的有限样本单步规划界 212 00:08:23,960 --> 00:08:27,920 我知道你看到积分求和和符号就头疼 213 00:08:27,920 --> 00:08:29,980 我来帮你做个降维翻译 214 00:08:29,980 --> 00:08:31,900 等号左边E of Ahead 215 00:08:31,900 --> 00:08:35,560 就是你模型做动作规划时的期望误差 216 00:08:35,560 --> 00:08:37,420 等号右边第一大项 217 00:08:37,420 --> 00:08:40,320 那个带着根号和Sigma-Sep-I东西 218 00:08:40,320 --> 00:08:41,760 叫做逼近误差 219 00:08:41,760 --> 00:08:43,700 这里的Sigma-Sep-I 220 00:08:43,700 --> 00:08:47,820 就是我们前面说的动作条件贡献矩阵的奇异值 221 00:08:47,820 --> 00:08:50,380 奇异值求和被你截断了 222 00:08:50,380 --> 00:08:52,620 你丢掉的那些微小奇异值 223 00:08:52,620 --> 00:08:54,340 就构成你的信息损失 224 00:08:54,340 --> 00:08:56,140 等号右边第二大项 225 00:08:56,140 --> 00:08:57,900 那个带着花体字母的NR 226 00:08:57,900 --> 00:08:59,180 叫做样本误差 227 00:08:59,180 --> 00:09:00,700 在原论文里 228 00:09:00,700 --> 00:09:02,100 要让这个式子成立 229 00:09:02,100 --> 00:09:05,560 作者给出了极其严苛的前提常数定义 230 00:09:05,560 --> 00:09:08,800 比如模型函数的无穷大范数必须有介 231 00:09:08,800 --> 00:09:12,220 也就是F的无穷范数小于等于卡帕 232 00:09:12,220 --> 00:09:13,000 基同理 233 00:09:13,000 --> 00:09:17,540 并且这个花体的RN代表的是拉德马赫复杂性 234 00:09:17,540 --> 00:09:19,080 用大白话翻译 235 00:09:19,080 --> 00:09:21,100 拉德马赫复杂性衡量的是 236 00:09:21,100 --> 00:09:22,140 你的模型 237 00:09:22,140 --> 00:09:24,020 你和随机噪声的能力 238 00:09:24,020 --> 00:09:26,320 你的前空间维度可以越大 239 00:09:26,320 --> 00:09:27,160 常数C1 240 00:09:27,160 --> 00:09:29,640 也就是16K平方卡帕平方 241 00:09:29,640 --> 00:09:31,540 加上16K平方卡帕 242 00:09:31,540 --> 00:09:33,280 就会指数级膨胀 243 00:09:33,280 --> 00:09:35,640 这相当于在理论账本上 244 00:09:35,640 --> 00:09:37,500 给你狠狠地记了一笔 245 00:09:37,500 --> 00:09:39,440 假设空间过大的罚单 246 00:09:39,440 --> 00:09:42,580 这就是为什么当模型噪音极大时 247 00:09:42,580 --> 00:09:44,820 输入级预测会彻底崩溃 248 00:09:44,820 --> 00:09:47,640 因为它的拉德马赫复杂性炸了 249 00:09:47,640 --> 00:09:49,620 吃满了样本误差的惩罚 250 00:09:49,620 --> 00:09:52,540 而JEPA因为有前空间的强压缩 251 00:09:52,540 --> 00:09:54,100 扛住了这波伤害 252 00:09:54,100 --> 00:09:55,640 更觉得在后面 253 00:09:55,640 --> 00:09:58,720 Zerom 4.6给出了多部规划的结论 254 00:09:58,720 --> 00:10:00,000 你只看这个 255 00:10:00,000 --> 00:10:02,560 它代表你规划的部署 256 00:10:02,560 --> 00:10:04,800 数学公式冰冷的告诉我们 257 00:10:04,800 --> 00:10:07,140 多部规划的总体误差界 258 00:10:07,140 --> 00:10:10,200 大约是单部误差上界乘以T 259 00:10:10,200 --> 00:10:12,140 这是一个什么概念呢 260 00:10:12,140 --> 00:10:14,500 这叫做误差的陷阱累积 261 00:10:14,500 --> 00:10:17,640 而不是我们平时做梦都害怕的指数爆炸 262 00:10:17,640 --> 00:10:21,280 这就像是多线程编程里的lockstep 263 00:10:21,280 --> 00:10:22,480 锁不同步 264 00:10:22,480 --> 00:10:24,800 你每往未来多看一步 265 00:10:24,800 --> 00:10:27,700 就固定多交一次同步购路费 266 00:10:27,700 --> 00:10:30,840 因为数据预测的基础不差大 267 00:10:30,840 --> 00:10:32,620 乘上T等于25之后 268 00:10:32,620 --> 00:10:34,480 直接把系统撑爆了 269 00:10:34,480 --> 00:10:35,880 而JEPA的底子好 270 00:10:35,880 --> 00:10:38,480 乘上25依然在生死线之上 271 00:10:38,480 --> 00:10:40,560 前空间预测就像是 272 00:10:40,560 --> 00:10:43,860 Gain-ed agent穿上一层防灶的防弹衣 273 00:10:43,860 --> 00:10:45,960 当然理论再漂亮 274 00:10:45,960 --> 00:10:47,920 我们也从不掩饰它的缺陷 275 00:10:47,920 --> 00:10:50,000 基于极客的工程直觉 276 00:10:50,000 --> 00:10:53,260 这篇论文有四个不可忽视的局限性 277 00:10:53,260 --> 00:10:53,900 第一 278 00:10:53,900 --> 00:10:55,720 你去看定理4.6的前提 279 00:10:55,720 --> 00:10:59,340 它强制假设了动态系统是确定性的 280 00:10:59,340 --> 00:11:00,120 也就是说 281 00:11:00,120 --> 00:11:01,960 给定状态A和动作B 282 00:11:01,960 --> 00:11:04,120 未来必然是状态C 283 00:11:04,120 --> 00:11:05,900 这在代码里是对的 284 00:11:05,900 --> 00:11:07,760 但在真实物理世界里 285 00:11:07,760 --> 00:11:09,180 一阵狂风刮过 286 00:11:09,180 --> 00:11:11,080 传感器底造抖动 287 00:11:11,080 --> 00:11:12,860 世界是非确定性的 288 00:11:12,860 --> 00:11:14,520 这个假设削弱了理论 289 00:11:14,520 --> 00:11:16,820 在复杂物理环境中的普世性 290 00:11:16,820 --> 00:11:17,500 第二 291 00:11:17,500 --> 00:11:19,220 刚才讲的那一大串 292 00:11:19,220 --> 00:11:20,640 泛化误差上界 293 00:11:20,640 --> 00:11:26,080 严重依赖于函数范数有界和拉德马和复杂性同阶的假设 294 00:11:26,080 --> 00:11:27,260 说实话 295 00:11:27,260 --> 00:11:29,460 这在纸面上推导极其丝滑 296 00:11:29,460 --> 00:11:33,820 但如果你今天拉起一个几百亿参数的Vision Transformer 297 00:11:33,820 --> 00:11:34,720 做Encoder 298 00:11:34,720 --> 00:11:38,180 你告诉我它的拉德马和复杂性怎么算 299 00:11:38,180 --> 00:11:39,720 算不出来的 300 00:11:39,720 --> 00:11:41,000 在生产环境里 301 00:11:41,000 --> 00:11:44,120 这个数学上限只能当作定性指导 302 00:11:44,120 --> 00:11:46,360 很难作为定量的验收标准 303 00:11:46,360 --> 00:11:47,160 第三 304 00:11:47,160 --> 00:11:48,500 实验的单薄 305 00:11:48,500 --> 00:11:51,920 论文只在纯合成的2D系统里做了验证 306 00:11:51,920 --> 00:11:56,240 这跟最近爆火的直接吃真实流媒体视频的系统相比 307 00:11:56,240 --> 00:11:58,100 GAP实在太大了 308 00:11:58,100 --> 00:12:00,780 它是一份极其精美的实验室切片 309 00:12:00,780 --> 00:12:05,100 但还不是能够直接搬进车间里的施工图纸 310 00:12:05,100 --> 00:12:05,940 第四 311 00:12:05,940 --> 00:12:07,680 也是最核心的业务局限 312 00:12:07,680 --> 00:12:10,880 这篇论文非黑即白的只对比了 313 00:12:10,880 --> 00:12:13,600 纯前空间和纯输入空间 314 00:12:13,600 --> 00:12:15,160 这两种极端范式 315 00:12:15,160 --> 00:12:16,820 但在今天的工业界 316 00:12:16,820 --> 00:12:18,840 大家都在搞混合模型 317 00:12:18,840 --> 00:12:21,360 也就是多尺度的Hybrid范式 318 00:12:21,360 --> 00:12:23,780 大尺度上做前空间规划 319 00:12:23,780 --> 00:12:27,280 局部小尺度引入部分像素做微调 320 00:12:27,280 --> 00:12:29,360 这个广阔的中间地带 321 00:12:29,360 --> 00:12:31,800 论文的理论并没有覆盖到 322 00:12:31,800 --> 00:12:32,440 好 323 00:12:32,440 --> 00:12:34,560 剖析完方法和局限 324 00:12:34,560 --> 00:12:37,380 我们进入今天这期视频最干货的环节 325 00:12:37,380 --> 00:12:41,860 我们想要真正吃透这篇2026年的JEPA泛化理论 326 00:12:41,860 --> 00:12:45,180 必须要在脑子里建立一张知识足谱 327 00:12:45,180 --> 00:12:46,940 你做人工智能框架 328 00:12:46,940 --> 00:12:50,020 必须要知道自己站在谁的肩膀上 329 00:12:50,020 --> 00:12:52,100 我们来看这颗技能树 330 00:12:52,100 --> 00:12:54,500 这里有三座大山座位支撑 331 00:12:54,500 --> 00:12:58,600 头把交易自然是杨立坤在2022年发布的蓝皮书 332 00:12:58,600 --> 00:13:02,520 走向自主机器智能之路0.9.2版 333 00:13:02,520 --> 00:13:05,880 正是这份文件第一次在系统层面定义了 334 00:13:05,880 --> 00:13:09,800 要在前空间里做非生成式预测的大愿景 335 00:13:09,800 --> 00:13:13,200 可以说这是整个JEPA宇宙的创世纪 336 00:13:13,200 --> 00:13:17,720 但是要把大神的吹牛落地成可以计算的数学公式 337 00:13:17,720 --> 00:13:25,320 文本重度依赖了浩晨等人在2021年Neural IPS上发表的传世经典 338 00:13:25,320 --> 00:13:29,600 他们第一次把对比学习抽象成了普图理论里的增强图 339 00:13:29,600 --> 00:13:34,400 用拉普拉斯矩阵证明了自监督学习为什么有效 340 00:13:34,400 --> 00:13:35,860 到了2026年 341 00:13:35,860 --> 00:13:41,780 Balestero和杨立坤本人联合发表了IEE信号处理的长文 342 00:13:41,780 --> 00:13:47,620 全面把普图理论和自监督学习在斜播分析的层面上挂钩 343 00:13:47,620 --> 00:13:50,040 本文提出的动作条件普图 344 00:13:50,040 --> 00:13:54,040 就是直接继承了这套最正统的数学班底 345 00:13:54,040 --> 00:13:58,860 只是把对称的增强图改造成了不对称的转移图 346 00:13:58,860 --> 00:13:59,940 设计数干继续 347 00:13:59,940 --> 00:14:02,560 在探究JEPA为什么好这个问题上 348 00:14:02,560 --> 00:14:04,960 这篇论文的团队不是孤军奋战 349 00:14:04,960 --> 00:14:08,400 Litwin团队在2024年的Neural IPS上 350 00:14:08,400 --> 00:14:10,980 从隐性偏执的角度证明了 351 00:14:10,980 --> 00:14:16,220 深度线性蒸馏网络天生就会偏好高影响力的语义特征 352 00:14:16,220 --> 00:14:19,320 也就是所谓的JEPA骨子里就排斥噪音 353 00:14:19,320 --> 00:14:23,280 紧接着2025年Balestero的另一篇论文证明了 354 00:14:23,280 --> 00:14:25,140 JEPA里的高斯正则化 355 00:14:25,140 --> 00:14:28,980 实际上是在暗中做输入数据的密度估计 356 00:14:28,980 --> 00:14:31,780 到了今年Litwin团队 357 00:14:31,780 --> 00:14:34,320 又从可识别性的角度做了解读 358 00:14:34,320 --> 00:14:35,640 你看出来了吗 359 00:14:35,640 --> 00:14:38,600 这些学术大佬都在从网络偏执 360 00:14:38,600 --> 00:14:39,620 密度估计 361 00:14:39,620 --> 00:14:42,180 参数可辨识性的角度盲人摸想 362 00:14:42,180 --> 00:14:45,120 而今天这篇论文是独辟蹊径 363 00:14:45,120 --> 00:14:47,620 在这些基础之上走出了 364 00:14:47,620 --> 00:14:51,080 泛化误差界限这条全新的康康大道 365 00:14:51,080 --> 00:14:52,220 再继续 366 00:14:52,220 --> 00:14:54,460 这里2023年打响的第一强 367 00:14:54,460 --> 00:14:57,420 IJEPA把研码预测带入了前空间 368 00:14:57,420 --> 00:15:00,000 有2025年加入视频 369 00:15:00,000 --> 00:15:01,000 和动作控制 370 00:15:01,000 --> 00:15:03,640 直接去搞机器人规划的VJP2 371 00:15:03,640 --> 00:15:05,780 有利用预训练特征 372 00:15:05,780 --> 00:15:08,420 做零样本规划的DinoWM 373 00:15:08,420 --> 00:15:10,380 有直接从像素端到端 374 00:15:10,380 --> 00:15:11,740 硬选的Lover Model 375 00:15:11,740 --> 00:15:14,300 还有把视觉和语言 376 00:15:14,300 --> 00:15:17,000 融合的多模态VLJP2 377 00:15:17,000 --> 00:15:18,720 这帮做应用框架的团队 378 00:15:18,720 --> 00:15:20,440 就像是在前线开荒的 379 00:15:20,440 --> 00:15:21,600 重装突击队 380 00:15:21,600 --> 00:15:23,700 只管冲锋不管后勤 381 00:15:23,700 --> 00:15:25,940 遇到bug就加大算力 382 00:15:25,940 --> 00:15:28,040 遇到崩溃就调超参数 383 00:15:28,040 --> 00:15:30,280 而今天这篇理论落文 384 00:15:30,280 --> 00:15:31,660 就是拿着计算器 385 00:15:31,660 --> 00:15:33,180 坐在后方大本营 386 00:15:33,180 --> 00:15:35,460 做沙盘推演的总参谋部 387 00:15:35,460 --> 00:15:37,880 这篇理论告诉这帮突击队 388 00:15:37,880 --> 00:15:40,240 你们之前之所以没死在 389 00:15:40,240 --> 00:15:41,840 长石运规划坑里 390 00:15:41,840 --> 00:15:44,240 是因为你们瞎调的前空间维度 391 00:15:44,240 --> 00:15:46,520 凑巧满足了条件贡献 392 00:15:46,520 --> 00:15:48,620 矩阵分解的低质边界 393 00:15:48,620 --> 00:15:51,640 最后顺带提提背景拼图 394 00:15:51,640 --> 00:15:54,920 比如张团队在2024年ICML 395 00:15:54,920 --> 00:15:57,620 对自回归和野马玉训练的 396 00:15:57,620 --> 00:15:58,960 底层理论比较 397 00:15:58,960 --> 00:16:01,280 这让本文的矩阵分解视角 398 00:16:01,280 --> 00:16:03,000 有了横向的印证 399 00:16:03,000 --> 00:16:05,420 再比如审团队和崔团队 400 00:16:05,420 --> 00:16:07,780 分别在无监督领域自适应 401 00:16:07,780 --> 00:16:09,920 和弱监督场景下的 402 00:16:09,920 --> 00:16:11,240 普图应用探索 403 00:16:11,240 --> 00:16:13,440 这些编较量夯实了 404 00:16:13,440 --> 00:16:15,080 理论的适用范围 405 00:16:15,080 --> 00:16:16,040 看懂了这张图 406 00:16:16,040 --> 00:16:18,140 你就懂了这篇论文的血脉 407 00:16:18,140 --> 00:16:20,620 它绝不是凭空蹦出来的 408 00:16:20,620 --> 00:16:23,180 它是过去五年自监督学习 409 00:16:23,180 --> 00:16:25,080 普图理论和世界模型 410 00:16:25,080 --> 00:16:26,640 三股滔天巨浪 411 00:16:26,640 --> 00:16:28,380 交汇的必然产物 412 00:16:28,380 --> 00:16:29,580 视频的最后 413 00:16:29,580 --> 00:16:31,320 我们来把这篇秘密麻麻 414 00:16:31,320 --> 00:16:33,340 充斥着拉德马和复杂性 415 00:16:33,340 --> 00:16:35,080 和不等式的学术常文 416 00:16:35,080 --> 00:16:37,240 提炼成可以直接装进你 417 00:16:37,240 --> 00:16:38,280 大脑的压缩包 418 00:16:38,280 --> 00:16:41,060 全篇最核心的一句话就是 419 00:16:41,060 --> 00:16:43,260 JEPA架构在前空间的预测 420 00:16:43,260 --> 00:16:44,920 在数学本质上 421 00:16:44,920 --> 00:16:47,980 就是将时间流转的因果实序图 422 00:16:47,980 --> 00:16:49,640 暴力的拆解成了一道 423 00:16:49,640 --> 00:16:52,340 非对称的低质矩阵分解体 424 00:16:52,340 --> 00:16:54,620 如果你是个AI算法架构师 425 00:16:54,620 --> 00:16:56,620 或者你正在带团队 426 00:16:56,620 --> 00:16:58,360 搞巨身机器人的研发 427 00:16:58,360 --> 00:17:00,040 这篇论文能带给你 428 00:17:00,040 --> 00:17:02,500 三个极其昂贵的工程指导 429 00:17:02,500 --> 00:17:03,300 第一点 430 00:17:03,300 --> 00:17:05,140 我们看误差结构的账本 431 00:17:05,140 --> 00:17:06,660 别再盲目追求 432 00:17:06,660 --> 00:17:08,740 全知全能的生成模型 433 00:17:08,740 --> 00:17:10,280 前空间维度K 434 00:17:10,280 --> 00:17:13,000 就是信息瓶颈的实体化旋钮 435 00:17:13,000 --> 00:17:14,820 小维度利出噪音 436 00:17:14,820 --> 00:17:16,740 但容易丢失关键信号 437 00:17:16,740 --> 00:17:19,000 大维度保留所有细节 438 00:17:19,000 --> 00:17:21,180 但会吃光你的训练样本 439 00:17:21,180 --> 00:17:22,080 引发灾难 440 00:17:22,080 --> 00:17:25,280 这就跟我们CICD Pipeline里的 441 00:17:25,280 --> 00:17:28,240 Lint静态代码检查一模一样 442 00:17:28,240 --> 00:17:30,620 你不需要让代码的每一次构建 443 00:17:30,620 --> 00:17:34,140 都强行通过所有的内存泄漏警告 444 00:17:34,140 --> 00:17:35,420 和缩紧报错 445 00:17:35,420 --> 00:17:37,640 你不需要预测全像素 446 00:17:37,640 --> 00:17:39,460 你只需要跑通那些 447 00:17:39,460 --> 00:17:42,140 对系统崩溃有决定性影响的 448 00:17:42,140 --> 00:17:43,040 核心业务流 449 00:17:43,040 --> 00:17:44,680 过滤掉噪音 450 00:17:44,680 --> 00:17:45,760 保住主干 451 00:17:45,760 --> 00:17:47,620 才是工程学的真谛 452 00:17:47,620 --> 00:17:49,120 接下来是第二点 453 00:17:49,120 --> 00:17:51,520 明确你的业务食欲对症狭咬 454 00:17:51,520 --> 00:17:54,880 如果你的机械臂只负责在流水线上 455 00:17:54,880 --> 00:17:58,080 夹起面前仅仅10厘米元的一颗螺丝 456 00:17:58,080 --> 00:18:00,040 这么短的规划食欲 457 00:18:00,040 --> 00:18:02,260 这么干净的低噪音环境 458 00:18:02,260 --> 00:18:04,160 请你立刻停下开发 459 00:18:04,160 --> 00:18:06,580 复杂摘爬前空间的动作 460 00:18:06,580 --> 00:18:08,020 去考像素去预测 461 00:18:08,020 --> 00:18:11,940 甚至去写几段简单的端到端模仿学习代码 462 00:18:11,940 --> 00:18:13,780 就能给你最高的ROI 463 00:18:13,780 --> 00:18:18,660 但如果你做的是穿梭在暴雨泥泥里的无人物流车 464 00:18:18,660 --> 00:18:20,900 需要在极其复杂的街道上 465 00:18:20,900 --> 00:18:23,580 做长达百步甚至千步的规划 466 00:18:23,580 --> 00:18:25,500 请死死的记住那个定律 467 00:18:25,500 --> 00:18:27,600 误差是线性累积的 468 00:18:27,600 --> 00:18:29,320 是单步误差乘以T 469 00:18:29,320 --> 00:18:32,720 这时候用前空间模型去扛住 470 00:18:32,720 --> 00:18:34,680 后期的样本误差爆炸 471 00:18:34,680 --> 00:18:37,640 是你必须做的架构底座升级 472 00:18:37,640 --> 00:18:39,080 最后是第三点 473 00:18:39,080 --> 00:18:40,860 理论的终极价值在于 474 00:18:40,860 --> 00:18:43,860 让我们从碰运气变成精准施药 475 00:18:43,860 --> 00:18:45,240 过去三年 476 00:18:45,240 --> 00:18:47,000 大模型和agent的工程界 477 00:18:47,000 --> 00:18:49,620 被大家戏称为炼丹玄学 478 00:18:49,620 --> 00:18:52,480 我们总是丢着起一堆海量数据 479 00:18:52,480 --> 00:18:55,580 然后祈祷模型在测试集上表现好 480 00:18:55,580 --> 00:18:59,100 这些泛化理论论文的伟大意义在于 481 00:18:59,100 --> 00:19:00,900 它在数学的荒原上 482 00:19:00,900 --> 00:19:03,040 打下了一根死死盯住 483 00:19:03,040 --> 00:19:04,720 世界模型天花板的木桩 484 00:19:04,720 --> 00:19:07,760 它让我们在做系统架构设计时 485 00:19:07,760 --> 00:19:09,340 心里终于有了底气 486 00:19:09,340 --> 00:19:10,100 好的 487 00:19:10,100 --> 00:19:11,600 今天视频就先聊到这里 488 00:19:11,600 --> 00:19:12,980 如果你喜欢今天的节目 489 00:19:12,980 --> 00:19:15,560 别忘了点赞分享并订阅我的频道 490 00:19:15,560 --> 00:19:17,820 及时获取科技资讯和深度解析 491 00:19:17,820 --> 00:19:18,780 感谢观看 492 00:19:18,780 --> 00:19:19,540 我们下期再见 493 00:19:19,540 --> 00:19:38,080 1970年 gehad 494 00:19:38,080 --> 00:19:39,000 您费么 495 00:19:39,000 --> 00:19:44,160 但赞分享并愿下