返回首頁

JEPA 世界模型泛化理論:為什麼長步規劃別再預測像素

發布時間:2026-08-17 18:24
YouTube 影片重點整理

JEPA 世界模型泛化理論:為什麼長步規劃別再預測像素

📺 wow⏱ 19:30🗓 2026-08-16🌐 zh-Hans🔗 https://youtu.be/jd9ZMBqhqiQ

這支影片解讀北京大學王亦森團隊 2026 年論文《基於 JEPA 的世界模型的泛化理論》。核心結論是:JEPA 不在像素層級預測未來,而是在潛空間預測語義狀態;其訓練本質可被理解為對「動作條件共現矩陣」做非對稱低秩矩陣分解。這套理論把工程上常見的「潛空間比較省算力、比較抗噪」直覺,轉成可討論的泛化誤差邊界,並說明長步規劃時誤差近似線性累積,因此單步誤差底子越乾淨,越能撐住 25 步以上的規劃。

01

像素級世界模型的問題:算了太多無關細節

01:31

影片把傳統輸入級預測比喻成「想看一本書的劇情,卻被要求背下整個書架的封面顏色、紙張厚度與條碼」。在世界模型裡,這對應到不只預測車的位置,還要預測反光、路面紋理、邊緣噪點等像素細節。

這些細節在短期畫面重建上看似精準,但對動作規劃未必是關鍵訊號;在高噪音與長時域任務中,反而會拖垮樣本效率與泛化能力。

問題定義
02

JEPA 的核心:在潛空間預測語義狀態

02:37

JEPA 不要求模型生成未來每個像素,而是先把觀測壓縮成語義向量,再預測下一個潛在狀態。影片用「只預測車的位置變了」來說明這個取捨。

這個做法的價值不是單純「比較省算力」,而是把不穩定或無關的高頻噪音排除在規劃主幹之外,讓模型把容量集中在對未來動作有用的因果結構上。

架構核心
03

論文的數學轉譯:JEPA loss 等價於低秩矩陣分解問題

03:15

影片指出,論文把動作條件下的狀態轉移建成「動作條件共現矩陣」。和傳統對稱的圖不同,世界模型有時間箭頭:同一個狀態在踩油門、煞車、打方向盤時,會通往不同的未來分佈。

Theorem 3.1 的重點,是把 JEPA 預訓練風險函數和這個矩陣的低秩分解誤差連起來。換句話說,模型訓練不再只是憑直覺最小化 loss,而是在近似一個由動作條件定義的因果轉移結構。

理論主軸
04

K 是資訊瓶頸旋鈕:壓縮太多或太少都會出事

05:00

潛空間維度 K 是影片反覆強調的工程旋鈕。K 太小時,模型會有效濾掉光影與噪點,樣本誤差較小,但也可能把紅綠燈這類關鍵訊號一起丟掉,造成逼近誤差變大。

K 太大時,模型保留太多細節,逼近誤差下降,但會更容易擬合噪音,樣本誤差上升。影片用 JPEG 壓縮率作比喻:壓太狠會糊,壓太少檔案太大又難以傳輸。

工程取捨
05

短規劃不用迷信 JEPA;長規劃與高噪音纔是主戰場

06:36

在短期一到五步任務裡,影片指出 JEPA 與像素級預測幾乎咬合在一起,成功率都接近滿分。對低複雜度、短視距任務,複雜潛空間架構未必帶來 ROI。

差異出現在 25 步長規劃且噪音標準差很高時:像素級預測成功率斷崖式下降,而 JEPA 潛空間模型雖然也下降,但更能維持基礎表現。影片把這解釋為潛空間壓縮降低了樣本誤差爆炸的傷害。

實驗結論
06

多步誤差是線性累積:單步底子決定長程生死線

09:16

影片將單步泛化誤差拆成兩部分:逼近誤差來自被截斷的奇異值,也就是被丟掉的資訊;樣本誤差則和模型假設空間、拉德馬赫複雜性、前空間維度等因素相關。

多步規劃的定理被解釋成「總誤差約等於單步誤差上界乘以 T」。這不是指數爆炸,但當 T 到 25 或更長時,單步誤差仍會被放大到足以讓系統崩潰。

泛化誤差
07

理論仍有邊界:不能直接當成工廠施工圖

10:49

影片列出四個限制:第一,多步規劃定理假設動態系統是確定性的;第二,泛化上界依賴函數範數與拉德馬赫複雜性等紙面條件,對大型 Vision Transformer 很難直接計算;第三,實驗只在合成 2D 系統;第四,論文只比較純潛空間與純輸入空間,沒有涵蓋工業界常見的混合多尺度模型。

因此這篇論文比較像是「理論邊界與設計指南」,不是可以直接搬進真實車間或機器人產線的完整工程方案。

限制
08

工程建議:依時域與噪音選架構,不要盲目煉丹

17:58

影片最後把工程建議收斂成三點:第一,不要盲目追求全知全能的生成模型,K 是資訊瓶頸的實體旋鈕;第二,要先明確業務時域,短距離低噪音任務用簡單方法可能 ROI 最高,長距離高噪音任務才需要潛空間底座升級;第三,泛化理論的價值是讓架構設計從碰運氣變成有邊界感的精準施藥。

落地建議

「前空間維度 K,就是資訊瓶頸的實體化旋鈕。」

重點時間戳索引

  1. 00:00影片開場提出問題:實驗室有效的機器人,到了真實工廠有灰塵與噪音就翻車;長線規劃超過二十多步時,世界模型會出現智力降級。
  2. 01:31世界模型若在輸入空間預測像素,會把車漆反光、路面紋理、鏡頭噪點等細節一起建模,造成嚴重算力浪費。
  3. 02:37JEPA 的做法是把畫面壓縮成高維語義向量,在潛空間只預測「位置變了」這類核心語義,而不是重建所有像素。
  4. 03:15論文引入動作條件共現矩陣;世界模型的狀態轉移有時間箭頭與因果方向,因此矩陣不是對稱的,而且強依賴輸入動作。
  5. 04:18Theorem 3.1 將 JEPA 預訓練風險函數與矩陣低秩分解誤差對應起來,讓原本偏玄學的訓練 loss 有了數學解釋。
  6. 05:00潛空間維度 K 是核心 trade-off:K 太小會濾掉噪音但可能丟掉關鍵訊號;K 太大則接近像素預測,樣本誤差會膨脹。
  7. 06:36合成 2D 控制實驗中,短期一到五步規劃時,JEPA 與輸入級像素預測表現接近,前者沒有明顯優勢。
  8. 08:24當任務拉到 25 步且環境噪音很高時,像素級預測成功率出現斷崖式下跌,JEPA 潛空間模型則相對更能維持表現。
  9. 09:16單步泛化誤差界可拆成逼近誤差與樣本誤差:截斷奇異值造成資訊損失;模型複雜度與前空間維度會放大樣本誤差。
  10. 10:00多步規劃的總體誤差約為單步誤差上界乘以 T,是線性累積而非指數爆炸;因此長規劃更依賴乾淨的單步基礎。
  11. 10:49影片列出四個限制:確定性動態假設、泛化上界難以量化套到大型 ViT、只在合成 2D 系統驗證、沒有涵蓋混合多尺度架構。
  12. 12:44影片把這篇論文放進 JEPA / 自監督學習 / 圖理論脈絡:LeCun 2022 藍皮書、增強圖與拉普拉斯矩陣、後續 JEPA 理論與應用工作。
  13. 17:58給工程端的三點建議:別盲目追求全像素生成;依業務時域選架構;用泛化理論把煉丹式調參改成有邊界感的架構設計。

關鍵字

JEPA世界模型潛空間預測泛化理論低秩矩陣分解動作規劃具身智能樣本誤差逼近誤差自監督學習

⚠️ 未確認 / 無法核對項目

  • YouTube 官方逐字稿與自動字幕皆不可用;主內容依 Whisper STT 產出,部分專有名詞可能有 ASR 漂字。
  • 影片最後約 19:38 後 Whisper 產生疑似無意義尾段,本報告未採用該尾段作為內容依據。

🎙️ ASR 漂字對照表

事件模型世界模型
前空間 / Laternate State潛空間 / Latent Space
Jabber / Jabber 架構JEPA
贡献矩阵共現矩陣(依影片描述語境)
拉德马和复杂性拉德馬赫複雜性
Zerom / Zerom 4.6Theorem 4.6
Neural IPSNeurIPS
Gain-ed agent具身 agent(依語境)
📎 原始內容(查證 / AI 追查用,非閱讀主文,點擊展開)
YouTube shortDescription(原文)
为什么你的机器人在实验室里百步穿杨,一放到真实工厂里沾点灰尘就彻底“翻车”?为什么几十步的长线动作规划,会让千亿参数的世界模型智力瞬间降级?告别“盲人摸象”式的调参玄学!本期视频,我将为你深度拆解北京大学 Yisen Wang(王亦森教授)团队2026年的重磅论文《基于 JEPA 的世界模型的泛化理论》。我们将彻底掀开潜空间预测的“算力底牌”,用极其通透的工程白话,把你脑子里关于世界模型、动作规划与泛化误差的模糊直觉,全部钉死在清晰的数学边界上!
Why do robots that work perfectly in the lab fail the moment they face real-world dust? Why does long-horizon planning cause even massive world models to suffer catastrophic intelligence degradation? Say goodbye to blind hyperparameter tuning! In this video, I dive deep into the groundbreaking 2026 paper, "A Generalization Theory for JEPA-Based World Models," by Prof. Yisen Wang's team at Peking University. We'll uncover the secrets of latent space planning and translate complex generalization error bounds into practical engineering takeaways, ending the era of AI "alchemy."
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
📄 核心内容 & 关键词 | Key Content & Keywords:
潜空间预测与 JEPA (Latent Space & JEPA): 彻底搞懂联合嵌入预测架构(JEPA)的核心,为什么放弃输入级(Input-level)的像素预测,转而在潜空间进行特征压缩与规划是算力的最优解。
Understand the core of Joint-Embedding Predictive Architecture (JEPA) and why abandoning input-level pixel prediction for latent space planning is the ultimate compute optimization.
条件共现矩阵 (Conditional Co-occurrence Matrix): 揭秘 JEPA 预训练 Loss 的数学本质——如何将因果时序的流转图,暴烈地拆解成一道非对称的低秩矩阵分解题。
Revealing the mathematical essence of JEPA's pre-training loss: transforming causal temporal graphs into an asymmetric low-rank matrix factorization problem.
泛化误差界限 (Generalization Error Bounds): 解析全篇最硬核的数学发现,揭示逼近误差(Approximation Error)与样本误差(Sample Error)之间的致命博弈,以及多步规划中误差为何是线性累积而非指数爆炸。
Unpacking the hardcore math behind approximation vs. sample errors, and proving that multi-step planning errors accumulate linearly, not exponentially.
工程落地指南 (Engineering Takeaways): 给具身智能和 AI 算法架构师的三大指导:如何根据业务时域(短期 vs 长期)和环境噪音,精准设置信息瓶颈临界点,摆脱“炼丹”玄学。
Three crucial guidelines for Embodied AI architects on how to choose model architectures based on horizon length and environmental noise, moving from alchemy to exact science.
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
🔔 订阅并加入我的会员 | Subscribe & Join my membership!
你认为未来具身智能的主流架构,是纯潜空间(Pure Latent Space)、还是局部引入像素微调的混合多尺度模型(Hybrid Architecture)?在评论区分享你的看法!
Do you think the future of Embodied AI will rely on pure latent space models or hybrid multi-scale architectures? Share your thoughts in the comments below!
如果你喜欢本期内容,请不要忘记点赞、分享,并【订阅】我的频道,开启小铃铛,第一时间获取关于前沿科技的深度解析。
If you enjoyed this video, please like, share, and SUBSCRIBE for more deep dives into our technological future.
👉 支持我持续创作 | Support My Work:
加入我的会员频道,提前观看视频并获得专属福利!
Join my channel membership to get early access to videos and exclusive perks!
https://www.youtube.com/channel/UCUruNDxpAAIsagdOH9cBuXA/join
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
论文链接,请点击:https://www.youtube.com/post/UgkxJOdO_aSuNRlgCff8dLyzJ0QmYA0i57WF
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
#JEPA #WorldModels #EmbodiedAI #YannLeCun #MachineLearning #Robotics #DeepLearning #MatrixFactorization #AI #人工智能 #世界模型 #具身智能 #潜空间 #泛化理论 #算法架构 #科技解析 #深度学习
Whisper STT combined SRT(原文)
1
00:00:00,000 --> 00:00:13,240
为什么你的机器人在实验室里百步穿扬

2
00:00:13,240 --> 00:00:15,140
一放到真实工厂里

3
00:00:15,140 --> 00:00:17,820
摄像头只要粘上一点微尘

4
00:00:17,820 --> 00:00:20,500
它就会像个无头苍蝇一样撞墙呢

5
00:00:20,500 --> 00:00:23,380
为什么我们给Agent规划的部数

6
00:00:23,380 --> 00:00:25,020
只要超过20部

7
00:00:25,020 --> 00:00:27,980
哪怕是几千亿参数的事件模型

8
00:00:27,980 --> 00:00:30,960
也会出现不可逆的智力降级呢

9
00:00:30,960 --> 00:00:32,460
过去两年

10
00:00:32,460 --> 00:00:35,180
所有的自动驾驶和聚升智能公司

11
00:00:35,180 --> 00:00:38,000
都在疯狂追捧杨立坤提出的JEPA

12
00:00:38,000 --> 00:00:40,700
也就是联合嵌入预测架构

13
00:00:40,700 --> 00:00:42,900
大家凭工程直觉都知道

14
00:00:42,900 --> 00:00:44,900
在前空间里做预测

15
00:00:44,900 --> 00:00:48,740
比傻乎乎的生成未来视频的每个像素要好

16
00:00:48,740 --> 00:00:50,660
但是为什么好

17
00:00:50,660 --> 00:00:51,480
好多少

18
00:00:51,480 --> 00:00:54,220
在什么边界条件下它会翻车

19
00:00:54,220 --> 00:00:56,400
根本没有人算过这笔账

20
00:00:56,400 --> 00:00:59,500
大家全靠盲人摸像时的调餐

21
00:00:59,500 --> 00:01:02,540
我们今天要聊的这篇重磅论文

22
00:01:02,540 --> 00:01:04,600
彻底打破了这个玄学黑河

23
00:01:04,600 --> 00:01:06,240
这篇论文的题目叫

24
00:01:06,240 --> 00:01:09,380
基于JEPA的世界模型的泛化理论

25
00:01:09,380 --> 00:01:11,380
它在全世界范围内

26
00:01:11,380 --> 00:01:14,040
第一次用严密的数学公式

27
00:01:14,040 --> 00:01:17,140
把JEPA的放化能力趴了个底朝天

28
00:01:17,140 --> 00:01:18,740
在接下来的时间里

29
00:01:18,740 --> 00:01:21,340
我将用极其通透的工程大白化

30
00:01:21,340 --> 00:01:23,740
把你脑子里关于世界模型

31
00:01:23,740 --> 00:01:26,980
动作规划和特征降维的模糊直觉

32
00:01:26,980 --> 00:01:29,660
全部钉死在清晰的数学边界上

33
00:01:29,660 --> 00:01:31,840
在拆解复杂的数学之前

34
00:01:31,840 --> 00:01:34,020
我们先统一一下认知

35
00:01:34,020 --> 00:01:36,160
到底什么是世界模型呢

36
00:01:36,160 --> 00:01:38,240
传统的生成式模型

37
00:01:38,240 --> 00:01:40,000
比如大家以前玩过的

38
00:01:40,000 --> 00:01:41,340
视频生成大模型

39
00:01:41,340 --> 00:01:43,720
它的预测未来是怎么做的呢

40
00:01:43,720 --> 00:01:45,000
是挖图

41
00:01:45,000 --> 00:01:46,780
你给它一个动作指令

42
00:01:46,780 --> 00:01:48,400
它要把下一秒的画面

43
00:01:48,400 --> 00:01:50,260
每一帧每一个像素

44
00:01:50,260 --> 00:01:52,440
都严丝合缝地渲染出来

45
00:01:52,440 --> 00:01:53,640
在工程上

46
00:01:53,640 --> 00:01:55,580
这就叫在输入空间

47
00:01:55,580 --> 00:01:57,740
也就是input level做预测

48
00:01:57,740 --> 00:02:00,080
这带来的通面是什么呢

49
00:02:00,080 --> 00:02:02,200
是极其荒谬的算力浪费

50
00:02:02,200 --> 00:02:03,480
你看屏幕

51
00:02:03,480 --> 00:02:06,040
看原论文里的这张对比图

52
00:02:06,040 --> 00:02:07,740
左边是辆橘色的小汽车

53
00:02:07,740 --> 00:02:10,800
如果你用像素去预测它向前开

54
00:02:10,800 --> 00:02:13,680
你的模型不仅要算这辆车的位移

55
00:02:13,680 --> 00:02:15,720
还要算车漆的反光

56
00:02:15,720 --> 00:02:17,200
地面博右路的文理

57
00:02:17,200 --> 00:02:19,860
甚至镜头边缘的一点噪点

58
00:02:19,860 --> 00:02:21,480
这就像什么呢

59
00:02:21,480 --> 00:02:23,200
这就像你去图书馆

60
00:02:23,200 --> 00:02:25,480
只想借一本三体看个剧情

61
00:02:25,480 --> 00:02:27,080
但图书馆里面

62
00:02:27,080 --> 00:02:29,540
非要让你把整整一个书架的

63
00:02:29,540 --> 00:02:30,800
书的封面颜色

64
00:02:30,800 --> 00:02:31,900
纸张厚度

65
00:02:31,900 --> 00:02:33,220
甚至条形码的数字

66
00:02:33,220 --> 00:02:34,620
全都背下来

67
00:02:34,620 --> 00:02:35,780
这不是有病吗

68
00:02:35,780 --> 00:02:37,900
所以JEPA架构喊了停

69
00:02:37,900 --> 00:02:39,640
我们不预测像素了

70
00:02:39,640 --> 00:02:43,140
我们把画面压缩成一串高尾的语义相量

71
00:02:43,140 --> 00:02:45,260
也就是Laternate State前空间

72
00:02:45,260 --> 00:02:47,000
我只预测这辆车

73
00:02:47,000 --> 00:02:49,120
位置变了这个核心语义

74
00:02:49,120 --> 00:02:50,780
这就是JEPA的核心

75
00:02:50,780 --> 00:02:53,120
在前空间里预测未来

76
00:02:53,120 --> 00:02:55,380
直觉上是当然省算力

77
00:02:55,380 --> 00:02:58,180
但研究团队问了一个极其银合的问题

78
00:02:58,180 --> 00:02:59,920
你把信息压缩了

79
00:02:59,920 --> 00:03:02,140
你怎么保证压缩后的东西

80
00:03:02,140 --> 00:03:06,660
在下游做几步甚至几十步的复杂动作规划时

81
00:03:06,660 --> 00:03:08,220
还能保持精准呢

82
00:03:08,220 --> 00:03:09,980
为了回答这个问题

83
00:03:09,980 --> 00:03:13,600
作者掏出了全篇最漂亮的一个数学工具

84
00:03:13,600 --> 00:03:15,860
叫做条件普图建模

85
00:03:15,860 --> 00:03:18,120
我们先来看论文里的核心创新

86
00:03:18,120 --> 00:03:21,960
一个叫做动作条件贡献矩阵的数学结构

87
00:03:21,960 --> 00:03:23,760
符号是MOA

88
00:03:23,760 --> 00:03:25,180
这什么意思呢

89
00:03:25,180 --> 00:03:26,180
很简单

90
00:03:26,180 --> 00:03:28,720
在传统的字监督对比学习里

91
00:03:28,720 --> 00:03:30,700
图的连接是对称的

92
00:03:30,700 --> 00:03:32,920
狗的图片A增强成图片B

93
00:03:32,920 --> 00:03:35,340
图片B也能退回图片A

94
00:03:35,340 --> 00:03:36,940
它们是个无向图

95
00:03:36,940 --> 00:03:38,560
但世界模型不一样

96
00:03:38,560 --> 00:03:40,880
世界是有时间箭头的

97
00:03:40,880 --> 00:03:41,820
是有因果的

98
00:03:41,820 --> 00:03:42,960
你踩下油门

99
00:03:42,960 --> 00:03:44,460
也就是输入动作A

100
00:03:44,460 --> 00:03:47,820
车子从状态X变到了状态X+,

101
00:03:47,820 --> 00:03:51,060
这个转移概率W是单向的

102
00:03:51,060 --> 00:03:52,300
你不能凭空倒车

103
00:03:52,300 --> 00:03:55,760
所以这个矩阵MOA极其特殊

104
00:03:55,760 --> 00:03:57,240
它不是对称的

105
00:03:57,240 --> 00:04:00,160
并且它强依赖于你输入的动作A

106
00:04:00,160 --> 00:04:02,460
你打方向盘和踩刹车

107
00:04:02,460 --> 00:04:06,520
面对的是两张完全不同的未来概率图

108
00:04:06,520 --> 00:04:08,760
这就相当于给每一种操作指令

109
00:04:08,760 --> 00:04:11,840
都建了一个独立的平行宇宙阅览室

110
00:04:11,840 --> 00:04:12,560
好

111
00:04:12,560 --> 00:04:13,680
有了这个矩阵

112
00:04:13,680 --> 00:04:15,960
作者干了一件堪称魔法的事情

113
00:04:15,960 --> 00:04:18,380
你注意看屏幕上的Theorem 3.1

114
00:04:18,380 --> 00:04:19,600
看明白了吗

115
00:04:19,600 --> 00:04:21,360
左边是Jabber架构

116
00:04:21,360 --> 00:04:23,460
在做预训练时的风险函数

117
00:04:23,460 --> 00:04:24,420
也就是Loss

118
00:04:24,420 --> 00:04:27,980
右边是一个矩阵的低值分解误差

119
00:04:27,980 --> 00:04:31,420
作者用极其优雅的数学严格证明了

120
00:04:31,420 --> 00:04:33,340
我们在深度学习框架里

121
00:04:33,340 --> 00:04:35,540
哼哧哼哧练单调餐

122
00:04:35,540 --> 00:04:37,200
最小化Jabber的Loss

123
00:04:37,200 --> 00:04:40,080
在数学本质上完全等价于

124
00:04:40,080 --> 00:04:43,060
我们在对那庞大的条件贡献矩阵

125
00:04:43,060 --> 00:04:44,720
进行矩阵分解

126
00:04:44,720 --> 00:04:47,020
这就彻底神经气爽了

127
00:04:47,020 --> 00:04:50,320
这就好比你本来是在玄学一样的蒙眼调悠

128
00:04:50,320 --> 00:04:52,660
现在作者直接塞给你一张

129
00:04:52,660 --> 00:04:54,880
天体力学的受力分析图

130
00:04:54,880 --> 00:04:56,600
只要矩阵分解的好

131
00:04:56,600 --> 00:04:58,520
你预训练的模型底子就好

132
00:04:58,520 --> 00:04:59,520
但是

133
00:05:00,000 --> 00:05:01,160
看下没有免费的午餐

134
00:05:01,160 --> 00:05:03,480
有分解就有tradeoff

135
00:05:03,480 --> 00:05:05,740
就有既要又要的取舍

136
00:05:05,740 --> 00:05:06,980
在论文中

137
00:05:06,980 --> 00:05:10,180
这个取舍体现在前空间的维度上

138
00:05:10,180 --> 00:05:11,360
也就是参数K

139
00:05:11,360 --> 00:05:13,780
如果你把维度K设得很小

140
00:05:13,780 --> 00:05:17,520
就意味着你对图画进行了极其暴力的压缩

141
00:05:17,520 --> 00:05:19,120
好处是什么呢

142
00:05:19,120 --> 00:05:20,500
是去尾存真

143
00:05:20,500 --> 00:05:24,180
把那些光影噪点全都过滤掉了

144
00:05:24,180 --> 00:05:27,120
这在机器学习里叫样本误差小

145
00:05:27,120 --> 00:05:28,820
那代价是什么呢

146
00:05:28,820 --> 00:05:31,100
你可能会把真正有用的信息

147
00:05:31,100 --> 00:05:33,900
比如远处的红绿灯也不小心扔了

148
00:05:33,900 --> 00:05:35,960
这叫逼近误差大

149
00:05:35,960 --> 00:05:36,920
反过来

150
00:05:36,920 --> 00:05:39,600
如果你把K设得跟原图一样大

151
00:05:39,600 --> 00:05:42,480
那就退化成了传统的输入级预测

152
00:05:42,480 --> 00:05:44,140
逼近误差没了

153
00:05:44,140 --> 00:05:46,580
但你会因为要拟合没处造点

154
00:05:46,580 --> 00:05:48,640
导致样本误差爆炸

155
00:05:48,640 --> 00:05:52,140
这就像我们用JPEG格式压缩图片

156
00:05:52,140 --> 00:05:53,600
压缩率太高

157
00:05:53,600 --> 00:05:54,540
图片糊了

158
00:05:54,540 --> 00:05:55,460
细节没了

159
00:05:55,460 --> 00:05:56,740
压缩率太低

160
00:05:56,740 --> 00:05:57,840
文件极大

161
00:05:57,840 --> 00:05:59,120
传输卡顿

162
00:05:59,120 --> 00:06:01,920
那怎么在这两指之间找平衡呢

163
00:06:01,920 --> 00:06:06,120
作者搭建了一个纯粹的二维连接控制合成环境

164
00:06:06,120 --> 00:06:10,120
在这个系统里真实的动态状态只有四维

165
00:06:10,120 --> 00:06:11,400
位置和速度

166
00:06:11,400 --> 00:06:17,120
但作者给观测画面里加了大量的高维的非线性干扰特征

167
00:06:17,120 --> 00:06:19,400
和完全不可预测的随机造点

168
00:06:19,400 --> 00:06:23,200
训练时模型只往前预测短短的三步

169
00:06:23,200 --> 00:06:25,400
但在下游的动作规划测试中

170
00:06:25,400 --> 00:06:30,400
作者要求模型规划一步五步甚至极其变态的25步

171
00:06:30,400 --> 00:06:36,400
那我们现在来看看在这个算力炼丹炉里究竟炼出了什么真经白银

172
00:06:36,400 --> 00:06:37,520
你注意看屏幕

173
00:06:37,520 --> 00:06:39,480
如果你平时只看论文的摘要

174
00:06:39,480 --> 00:06:43,000
你绝对会错过这种工程反直觉现象

175
00:06:43,000 --> 00:06:44,240
大家做业务

176
00:06:44,240 --> 00:06:45,440
老板最喜欢问

177
00:06:45,440 --> 00:06:47,280
我们上了最新世界模型

178
00:06:47,280 --> 00:06:48,920
准确率能提多少

179
00:06:48,920 --> 00:06:50,440
你看第一个画板

180
00:06:50,440 --> 00:06:53,560
当规划部署只有一步到五步

181
00:06:53,560 --> 00:06:55,520
也就是极短周期的任务时

182
00:06:55,520 --> 00:07:00,620
呈现代表的前空间JEPA和蓝线代表的输入级像素预测

183
00:07:00,620 --> 00:07:02,260
私自的咬合在一起

184
00:07:02,260 --> 00:07:05,220
成功率都在百分之百附近横跳

185
00:07:05,220 --> 00:07:06,800
这意味着什么呢

186
00:07:06,800 --> 00:07:09,840
这意味着如果你的机器狗只是用来做

187
00:07:09,840 --> 00:07:14,160
拿下面前的杯子这种短视剧的低复杂度的任务

188
00:07:14,160 --> 00:07:15,640
你搞什么前空间

189
00:07:15,640 --> 00:07:16,980
搞什么特征提取

190
00:07:16,980 --> 00:07:19,080
都是在浪费研发精力

191
00:07:19,080 --> 00:07:21,420
像素级预测完全够用

192
00:07:21,420 --> 00:07:24,060
前空间甚至没有捞到一点好处

193
00:07:24,060 --> 00:07:28,020
但是你注意图二右下角这个异常的拐点

194
00:07:28,020 --> 00:07:30,500
当我们把业务难度拉满

195
00:07:30,500 --> 00:07:33,020
要求agent连续规划25步

196
00:07:33,020 --> 00:07:39,420
并且把环境的随机噪音标准差拉到0.6甚至1.0的极高水平时

197
00:07:39,420 --> 00:07:40,480
你看蓝线

198
00:07:40,480 --> 00:07:42,720
也就是输入级像素预测

199
00:07:42,720 --> 00:07:47,980
它就像断崖一样直接从0.8的成功率暴跌到了0.2以下

200
00:07:47,980 --> 00:07:50,120
你的机器人彻底瞎了

201
00:07:50,120 --> 00:07:51,320
系统崩溃了

202
00:07:51,320 --> 00:07:53,820
而代表JEPA前空间的呈现

203
00:07:53,820 --> 00:07:55,700
它虽然也在下降

204
00:07:55,700 --> 00:08:00,300
但它像一根极其坚韧的钢丝死死的维持在0.2

205
00:08:00,300 --> 00:08:03,060
为什么会发生这种经典逆转呢

206
00:08:03,060 --> 00:08:07,600
这就引出了全篇最隐和最极有理论深度的核心发现

207
00:08:07,600 --> 00:08:11,300
那就是我们在单步规划和多步规划时的

208
00:08:11,300 --> 00:08:13,700
泛化误差界到底长什么样

209
00:08:13,700 --> 00:08:16,300
来我们来做一个深呼吸

210
00:08:16,300 --> 00:08:19,860
我们要上全篇最长的一串数学公式了

211
00:08:19,860 --> 00:08:23,960
这是一段极其华丽的有限样本单步规划界

212
00:08:23,960 --> 00:08:27,920
我知道你看到积分求和和符号就头疼

213
00:08:27,920 --> 00:08:29,980
我来帮你做个降维翻译

214
00:08:29,980 --> 00:08:31,900
等号左边E of Ahead

215
00:08:31,900 --> 00:08:35,560
就是你模型做动作规划时的期望误差

216
00:08:35,560 --> 00:08:37,420
等号右边第一大项

217
00:08:37,420 --> 00:08:40,320
那个带着根号和Sigma-Sep-I东西

218
00:08:40,320 --> 00:08:41,760
叫做逼近误差

219
00:08:41,760 --> 00:08:43,700
这里的Sigma-Sep-I

220
00:08:43,700 --> 00:08:47,820
就是我们前面说的动作条件贡献矩阵的奇异值

221
00:08:47,820 --> 00:08:50,380
奇异值求和被你截断了

222
00:08:50,380 --> 00:08:52,620
你丢掉的那些微小奇异值

223
00:08:52,620 --> 00:08:54,340
就构成你的信息损失

224
00:08:54,340 --> 00:08:56,140
等号右边第二大项

225
00:08:56,140 --> 00:08:57,900
那个带着花体字母的NR

226
00:08:57,900 --> 00:08:59,180
叫做样本误差

227
00:08:59,180 --> 00:09:00,700
在原论文里

228
00:09:00,700 --> 00:09:02,100
要让这个式子成立

229
00:09:02,100 --> 00:09:05,560
作者给出了极其严苛的前提常数定义

230
00:09:05,560 --> 00:09:08,800
比如模型函数的无穷大范数必须有介

231
00:09:08,800 --> 00:09:12,220
也就是F的无穷范数小于等于卡帕

232
00:09:12,220 --> 00:09:13,000
基同理

233
00:09:13,000 --> 00:09:17,540
并且这个花体的RN代表的是拉德马赫复杂性

234
00:09:17,540 --> 00:09:19,080
用大白话翻译

235
00:09:19,080 --> 00:09:21,100
拉德马赫复杂性衡量的是

236
00:09:21,100 --> 00:09:22,140
你的模型

237
00:09:22,140 --> 00:09:24,020
你和随机噪声的能力

238
00:09:24,020 --> 00:09:26,320
你的前空间维度可以越大

239
00:09:26,320 --> 00:09:27,160
常数C1

240
00:09:27,160 --> 00:09:29,640
也就是16K平方卡帕平方

241
00:09:29,640 --> 00:09:31,540
加上16K平方卡帕

242
00:09:31,540 --> 00:09:33,280
就会指数级膨胀

243
00:09:33,280 --> 00:09:35,640
这相当于在理论账本上

244
00:09:35,640 --> 00:09:37,500
给你狠狠地记了一笔

245
00:09:37,500 --> 00:09:39,440
假设空间过大的罚单

246
00:09:39,440 --> 00:09:42,580
这就是为什么当模型噪音极大时

247
00:09:42,580 --> 00:09:44,820
输入级预测会彻底崩溃

248
00:09:44,820 --> 00:09:47,640
因为它的拉德马赫复杂性炸了

249
00:09:47,640 --> 00:09:49,620
吃满了样本误差的惩罚

250
00:09:49,620 --> 00:09:52,540
而JEPA因为有前空间的强压缩

251
00:09:52,540 --> 00:09:54,100
扛住了这波伤害

252
00:09:54,100 --> 00:09:55,640
更觉得在后面

253
00:09:55,640 --> 00:09:58,720
Zerom 4.6给出了多部规划的结论

254
00:09:58,720 --> 00:10:00,000
你只看这个

255
00:10:00,000 --> 00:10:02,560
它代表你规划的部署

256
00:10:02,560 --> 00:10:04,800
数学公式冰冷的告诉我们

257
00:10:04,800 --> 00:10:07,140
多部规划的总体误差界

258
00:10:07,140 --> 00:10:10,200
大约是单部误差上界乘以T

259
00:10:10,200 --> 00:10:12,140
这是一个什么概念呢

260
00:10:12,140 --> 00:10:14,500
这叫做误差的陷阱累积

261
00:10:14,500 --> 00:10:17,640
而不是我们平时做梦都害怕的指数爆炸

262
00:10:17,640 --> 00:10:21,280
这就像是多线程编程里的lockstep

263
00:10:21,280 --> 00:10:22,480
锁不同步

264
00:10:22,480 --> 00:10:24,800
你每往未来多看一步

265
00:10:24,800 --> 00:10:27,700
就固定多交一次同步购路费

266
00:10:27,700 --> 00:10:30,840
因为数据预测的基础不差大

267
00:10:30,840 --> 00:10:32,620
乘上T等于25之后

268
00:10:32,620 --> 00:10:34,480
直接把系统撑爆了

269
00:10:34,480 --> 00:10:35,880
而JEPA的底子好

270
00:10:35,880 --> 00:10:38,480
乘上25依然在生死线之上

271
00:10:38,480 --> 00:10:40,560
前空间预测就像是

272
00:10:40,560 --> 00:10:43,860
Gain-ed agent穿上一层防灶的防弹衣

273
00:10:43,860 --> 00:10:45,960
当然理论再漂亮

274
00:10:45,960 --> 00:10:47,920
我们也从不掩饰它的缺陷

275
00:10:47,920 --> 00:10:50,000
基于极客的工程直觉

276
00:10:50,000 --> 00:10:53,260
这篇论文有四个不可忽视的局限性

277
00:10:53,260 --> 00:10:53,900
第一

278
00:10:53,900 --> 00:10:55,720
你去看定理4.6的前提

279
00:10:55,720 --> 00:10:59,340
它强制假设了动态系统是确定性的

280
00:10:59,340 --> 00:11:00,120
也就是说

281
00:11:00,120 --> 00:11:01,960
给定状态A和动作B

282
00:11:01,960 --> 00:11:04,120
未来必然是状态C

283
00:11:04,120 --> 00:11:05,900
这在代码里是对的

284
00:11:05,900 --> 00:11:07,760
但在真实物理世界里

285
00:11:07,760 --> 00:11:09,180
一阵狂风刮过

286
00:11:09,180 --> 00:11:11,080
传感器底造抖动

287
00:11:11,080 --> 00:11:12,860
世界是非确定性的

288
00:11:12,860 --> 00:11:14,520
这个假设削弱了理论

289
00:11:14,520 --> 00:11:16,820
在复杂物理环境中的普世性

290
00:11:16,820 --> 00:11:17,500
第二

291
00:11:17,500 --> 00:11:19,220
刚才讲的那一大串

292
00:11:19,220 --> 00:11:20,640
泛化误差上界

293
00:11:20,640 --> 00:11:26,080
严重依赖于函数范数有界和拉德马和复杂性同阶的假设

294
00:11:26,080 --> 00:11:27,260
说实话

295
00:11:27,260 --> 00:11:29,460
这在纸面上推导极其丝滑

296
00:11:29,460 --> 00:11:33,820
但如果你今天拉起一个几百亿参数的Vision Transformer

297
00:11:33,820 --> 00:11:34,720
做Encoder

298
00:11:34,720 --> 00:11:38,180
你告诉我它的拉德马和复杂性怎么算

299
00:11:38,180 --> 00:11:39,720
算不出来的

300
00:11:39,720 --> 00:11:41,000
在生产环境里

301
00:11:41,000 --> 00:11:44,120
这个数学上限只能当作定性指导

302
00:11:44,120 --> 00:11:46,360
很难作为定量的验收标准

303
00:11:46,360 --> 00:11:47,160
第三

304
00:11:47,160 --> 00:11:48,500
实验的单薄

305
00:11:48,500 --> 00:11:51,920
论文只在纯合成的2D系统里做了验证

306
00:11:51,920 --> 00:11:56,240
这跟最近爆火的直接吃真实流媒体视频的系统相比

307
00:11:56,240 --> 00:11:58,100
GAP实在太大了

308
00:11:58,100 --> 00:12:00,780
它是一份极其精美的实验室切片

309
00:12:00,780 --> 00:12:05,100
但还不是能够直接搬进车间里的施工图纸

310
00:12:05,100 --> 00:12:05,940
第四

311
00:12:05,940 --> 00:12:07,680
也是最核心的业务局限

312
00:12:07,680 --> 00:12:10,880
这篇论文非黑即白的只对比了

313
00:12:10,880 --> 00:12:13,600
纯前空间和纯输入空间

314
00:12:13,600 --> 00:12:15,160
这两种极端范式

315
00:12:15,160 --> 00:12:16,820
但在今天的工业界

316
00:12:16,820 --> 00:12:18,840
大家都在搞混合模型

317
00:12:18,840 --> 00:12:21,360
也就是多尺度的Hybrid范式

318
00:12:21,360 --> 00:12:23,780
大尺度上做前空间规划

319
00:12:23,780 --> 00:12:27,280
局部小尺度引入部分像素做微调

320
00:12:27,280 --> 00:12:29,360
这个广阔的中间地带

321
00:12:29,360 --> 00:12:31,800
论文的理论并没有覆盖到

322
00:12:31,800 --> 00:12:32,440
好

323
00:12:32,440 --> 00:12:34,560
剖析完方法和局限

324
00:12:34,560 --> 00:12:37,380
我们进入今天这期视频最干货的环节

325
00:12:37,380 --> 00:12:41,860
我们想要真正吃透这篇2026年的JEPA泛化理论

326
00:12:41,860 --> 00:12:45,180
必须要在脑子里建立一张知识足谱

327
00:12:45,180 --> 00:12:46,940
你做人工智能框架

328
00:12:46,940 --> 00:12:50,020
必须要知道自己站在谁的肩膀上

329
00:12:50,020 --> 00:12:52,100
我们来看这颗技能树

330
00:12:52,100 --> 00:12:54,500
这里有三座大山座位支撑

331
00:12:54,500 --> 00:12:58,600
头把交易自然是杨立坤在2022年发布的蓝皮书

332
00:12:58,600 --> 00:13:02,520
走向自主机器智能之路0.9.2版

333
00:13:02,520 --> 00:13:05,880
正是这份文件第一次在系统层面定义了

334
00:13:05,880 --> 00:13:09,800
要在前空间里做非生成式预测的大愿景

335
00:13:09,800 --> 00:13:13,200
可以说这是整个JEPA宇宙的创世纪

336
00:13:13,200 --> 00:13:17,720
但是要把大神的吹牛落地成可以计算的数学公式

337
00:13:17,720 --> 00:13:25,320
文本重度依赖了浩晨等人在2021年Neural IPS上发表的传世经典

338
00:13:25,320 --> 00:13:29,600
他们第一次把对比学习抽象成了普图理论里的增强图

339
00:13:29,600 --> 00:13:34,400
用拉普拉斯矩阵证明了自监督学习为什么有效

340
00:13:34,400 --> 00:13:35,860
到了2026年

341
00:13:35,860 --> 00:13:41,780
Balestero和杨立坤本人联合发表了IEE信号处理的长文

342
00:13:41,780 --> 00:13:47,620
全面把普图理论和自监督学习在斜播分析的层面上挂钩

343
00:13:47,620 --> 00:13:50,040
本文提出的动作条件普图

344
00:13:50,040 --> 00:13:54,040
就是直接继承了这套最正统的数学班底

345
00:13:54,040 --> 00:13:58,860
只是把对称的增强图改造成了不对称的转移图

346
00:13:58,860 --> 00:13:59,940
设计数干继续

347
00:13:59,940 --> 00:14:02,560
在探究JEPA为什么好这个问题上

348
00:14:02,560 --> 00:14:04,960
这篇论文的团队不是孤军奋战

349
00:14:04,960 --> 00:14:08,400
Litwin团队在2024年的Neural IPS上

350
00:14:08,400 --> 00:14:10,980
从隐性偏执的角度证明了

351
00:14:10,980 --> 00:14:16,220
深度线性蒸馏网络天生就会偏好高影响力的语义特征

352
00:14:16,220 --> 00:14:19,320
也就是所谓的JEPA骨子里就排斥噪音

353
00:14:19,320 --> 00:14:23,280
紧接着2025年Balestero的另一篇论文证明了

354
00:14:23,280 --> 00:14:25,140
JEPA里的高斯正则化

355
00:14:25,140 --> 00:14:28,980
实际上是在暗中做输入数据的密度估计

356
00:14:28,980 --> 00:14:31,780
到了今年Litwin团队

357
00:14:31,780 --> 00:14:34,320
又从可识别性的角度做了解读

358
00:14:34,320 --> 00:14:35,640
你看出来了吗

359
00:14:35,640 --> 00:14:38,600
这些学术大佬都在从网络偏执

360
00:14:38,600 --> 00:14:39,620
密度估计

361
00:14:39,620 --> 00:14:42,180
参数可辨识性的角度盲人摸想

362
00:14:42,180 --> 00:14:45,120
而今天这篇论文是独辟蹊径

363
00:14:45,120 --> 00:14:47,620
在这些基础之上走出了

364
00:14:47,620 --> 00:14:51,080
泛化误差界限这条全新的康康大道

365
00:14:51,080 --> 00:14:52,220
再继续

366
00:14:52,220 --> 00:14:54,460
这里2023年打响的第一强

367
00:14:54,460 --> 00:14:57,420
IJEPA把研码预测带入了前空间

368
00:14:57,420 --> 00:15:00,000
有2025年加入视频

369
00:15:00,000 --> 00:15:01,000
和动作控制

370
00:15:01,000 --> 00:15:03,640
直接去搞机器人规划的VJP2

371
00:15:03,640 --> 00:15:05,780
有利用预训练特征

372
00:15:05,780 --> 00:15:08,420
做零样本规划的DinoWM

373
00:15:08,420 --> 00:15:10,380
有直接从像素端到端

374
00:15:10,380 --> 00:15:11,740
硬选的Lover Model

375
00:15:11,740 --> 00:15:14,300
还有把视觉和语言

376
00:15:14,300 --> 00:15:17,000
融合的多模态VLJP2

377
00:15:17,000 --> 00:15:18,720
这帮做应用框架的团队

378
00:15:18,720 --> 00:15:20,440
就像是在前线开荒的

379
00:15:20,440 --> 00:15:21,600
重装突击队

380
00:15:21,600 --> 00:15:23,700
只管冲锋不管后勤

381
00:15:23,700 --> 00:15:25,940
遇到bug就加大算力

382
00:15:25,940 --> 00:15:28,040
遇到崩溃就调超参数

383
00:15:28,040 --> 00:15:30,280
而今天这篇理论落文

384
00:15:30,280 --> 00:15:31,660
就是拿着计算器

385
00:15:31,660 --> 00:15:33,180
坐在后方大本营

386
00:15:33,180 --> 00:15:35,460
做沙盘推演的总参谋部

387
00:15:35,460 --> 00:15:37,880
这篇理论告诉这帮突击队

388
00:15:37,880 --> 00:15:40,240
你们之前之所以没死在

389
00:15:40,240 --> 00:15:41,840
长石运规划坑里

390
00:15:41,840 --> 00:15:44,240
是因为你们瞎调的前空间维度

391
00:15:44,240 --> 00:15:46,520
凑巧满足了条件贡献

392
00:15:46,520 --> 00:15:48,620
矩阵分解的低质边界

393
00:15:48,620 --> 00:15:51,640
最后顺带提提背景拼图

394
00:15:51,640 --> 00:15:54,920
比如张团队在2024年ICML

395
00:15:54,920 --> 00:15:57,620
对自回归和野马玉训练的

396
00:15:57,620 --> 00:15:58,960
底层理论比较

397
00:15:58,960 --> 00:16:01,280
这让本文的矩阵分解视角

398
00:16:01,280 --> 00:16:03,000
有了横向的印证

399
00:16:03,000 --> 00:16:05,420
再比如审团队和崔团队

400
00:16:05,420 --> 00:16:07,780
分别在无监督领域自适应

401
00:16:07,780 --> 00:16:09,920
和弱监督场景下的

402
00:16:09,920 --> 00:16:11,240
普图应用探索

403
00:16:11,240 --> 00:16:13,440
这些编较量夯实了

404
00:16:13,440 --> 00:16:15,080
理论的适用范围

405
00:16:15,080 --> 00:16:16,040
看懂了这张图

406
00:16:16,040 --> 00:16:18,140
你就懂了这篇论文的血脉

407
00:16:18,140 --> 00:16:20,620
它绝不是凭空蹦出来的

408
00:16:20,620 --> 00:16:23,180
它是过去五年自监督学习

409
00:16:23,180 --> 00:16:25,080
普图理论和世界模型

410
00:16:25,080 --> 00:16:26,640
三股滔天巨浪

411
00:16:26,640 --> 00:16:28,380
交汇的必然产物

412
00:16:28,380 --> 00:16:29,580
视频的最后

413
00:16:29,580 --> 00:16:31,320
我们来把这篇秘密麻麻

414
00:16:31,320 --> 00:16:33,340
充斥着拉德马和复杂性

415
00:16:33,340 --> 00:16:35,080
和不等式的学术常文

416
00:16:35,080 --> 00:16:37,240
提炼成可以直接装进你

417
00:16:37,240 --> 00:16:38,280
大脑的压缩包

418
00:16:38,280 --> 00:16:41,060
全篇最核心的一句话就是

419
00:16:41,060 --> 00:16:43,260
JEPA架构在前空间的预测

420
00:16:43,260 --> 00:16:44,920
在数学本质上

421
00:16:44,920 --> 00:16:47,980
就是将时间流转的因果实序图

422
00:16:47,980 --> 00:16:49,640
暴力的拆解成了一道

423
00:16:49,640 --> 00:16:52,340
非对称的低质矩阵分解体

424
00:16:52,340 --> 00:16:54,620
如果你是个AI算法架构师

425
00:16:54,620 --> 00:16:56,620
或者你正在带团队

426
00:16:56,620 --> 00:16:58,360
搞巨身机器人的研发

427
00:16:58,360 --> 00:17:00,040
这篇论文能带给你

428
00:17:00,040 --> 00:17:02,500
三个极其昂贵的工程指导

429
00:17:02,500 --> 00:17:03,300
第一点

430
00:17:03,300 --> 00:17:05,140
我们看误差结构的账本

431
00:17:05,140 --> 00:17:06,660
别再盲目追求

432
00:17:06,660 --> 00:17:08,740
全知全能的生成模型

433
00:17:08,740 --> 00:17:10,280
前空间维度K

434
00:17:10,280 --> 00:17:13,000
就是信息瓶颈的实体化旋钮

435
00:17:13,000 --> 00:17:14,820
小维度利出噪音

436
00:17:14,820 --> 00:17:16,740
但容易丢失关键信号

437
00:17:16,740 --> 00:17:19,000
大维度保留所有细节

438
00:17:19,000 --> 00:17:21,180
但会吃光你的训练样本

439
00:17:21,180 --> 00:17:22,080
引发灾难

440
00:17:22,080 --> 00:17:25,280
这就跟我们CICD Pipeline里的

441
00:17:25,280 --> 00:17:28,240
Lint静态代码检查一模一样

442
00:17:28,240 --> 00:17:30,620
你不需要让代码的每一次构建

443
00:17:30,620 --> 00:17:34,140
都强行通过所有的内存泄漏警告

444
00:17:34,140 --> 00:17:35,420
和缩紧报错

445
00:17:35,420 --> 00:17:37,640
你不需要预测全像素

446
00:17:37,640 --> 00:17:39,460
你只需要跑通那些

447
00:17:39,460 --> 00:17:42,140
对系统崩溃有决定性影响的

448
00:17:42,140 --> 00:17:43,040
核心业务流

449
00:17:43,040 --> 00:17:44,680
过滤掉噪音

450
00:17:44,680 --> 00:17:45,760
保住主干

451
00:17:45,760 --> 00:17:47,620
才是工程学的真谛

452
00:17:47,620 --> 00:17:49,120
接下来是第二点

453
00:17:49,120 --> 00:17:51,520
明确你的业务食欲对症狭咬

454
00:17:51,520 --> 00:17:54,880
如果你的机械臂只负责在流水线上

455
00:17:54,880 --> 00:17:58,080
夹起面前仅仅10厘米元的一颗螺丝

456
00:17:58,080 --> 00:18:00,040
这么短的规划食欲

457
00:18:00,040 --> 00:18:02,260
这么干净的低噪音环境

458
00:18:02,260 --> 00:18:04,160
请你立刻停下开发

459
00:18:04,160 --> 00:18:06,580
复杂摘爬前空间的动作

460
00:18:06,580 --> 00:18:08,020
去考像素去预测

461
00:18:08,020 --> 00:18:11,940
甚至去写几段简单的端到端模仿学习代码

462
00:18:11,940 --> 00:18:13,780
就能给你最高的ROI

463
00:18:13,780 --> 00:18:18,660
但如果你做的是穿梭在暴雨泥泥里的无人物流车

464
00:18:18,660 --> 00:18:20,900
需要在极其复杂的街道上

465
00:18:20,900 --> 00:18:23,580
做长达百步甚至千步的规划

466
00:18:23,580 --> 00:18:25,500
请死死的记住那个定律

467
00:18:25,500 --> 00:18:27,600
误差是线性累积的

468
00:18:27,600 --> 00:18:29,320
是单步误差乘以T

469
00:18:29,320 --> 00:18:32,720
这时候用前空间模型去扛住

470
00:18:32,720 --> 00:18:34,680
后期的样本误差爆炸

471
00:18:34,680 --> 00:18:37,640
是你必须做的架构底座升级

472
00:18:37,640 --> 00:18:39,080
最后是第三点

473
00:18:39,080 --> 00:18:40,860
理论的终极价值在于

474
00:18:40,860 --> 00:18:43,860
让我们从碰运气变成精准施药

475
00:18:43,860 --> 00:18:45,240
过去三年

476
00:18:45,240 --> 00:18:47,000
大模型和agent的工程界

477
00:18:47,000 --> 00:18:49,620
被大家戏称为炼丹玄学

478
00:18:49,620 --> 00:18:52,480
我们总是丢着起一堆海量数据

479
00:18:52,480 --> 00:18:55,580
然后祈祷模型在测试集上表现好

480
00:18:55,580 --> 00:18:59,100
这些泛化理论论文的伟大意义在于

481
00:18:59,100 --> 00:19:00,900
它在数学的荒原上

482
00:19:00,900 --> 00:19:03,040
打下了一根死死盯住

483
00:19:03,040 --> 00:19:04,720
世界模型天花板的木桩

484
00:19:04,720 --> 00:19:07,760
它让我们在做系统架构设计时

485
00:19:07,760 --> 00:19:09,340
心里终于有了底气

486
00:19:09,340 --> 00:19:10,100
好的

487
00:19:10,100 --> 00:19:11,600
今天视频就先聊到这里

488
00:19:11,600 --> 00:19:12,980
如果你喜欢今天的节目

489
00:19:12,980 --> 00:19:15,560
别忘了点赞分享并订阅我的频道

490
00:19:15,560 --> 00:19:17,820
及时获取科技资讯和深度解析

491
00:19:17,820 --> 00:19:18,780
感谢观看

492
00:19:18,780 --> 00:19:19,540
我们下期再见

493
00:19:19,540 --> 00:19:38,080
1970年 gehad

494
00:19:38,080 --> 00:19:39,000
您费么

495
00:19:39,000 --> 00:19:44,160
但赞分享并愿下