返回首頁

AI能改10萬行程式碼,卻栽在50公尺外的洗車店 #ai #科技 #vibecoding #shorts

發布時間:2026-08-09 23:36
YouTube 影片重點整理

AI能改10萬行程式碼,卻栽在50公尺外的洗車店 #ai #科技 #vibecoding #shorts

📺 昌健胡說⏱ 02:42🗓 2026-08-08🌐 zh-Hans🔗 https://www.youtube.com/watch?v=FbIp25kvq7o

這支 Shorts 轉述 Andrej Karpathy 近期訪談中的四個判斷:AI 正在把軟體開發從『寫程式碼』推向『說清楚需求』;AI 在數學、寫程式等可驗證任務上進步很快,卻容易在常識與分寸題上翻車;AI 智能體能加速工作,但結果是否可靠仍需人類判斷;最後,AI 可以協助思考,卻不能替代人的真正理解。影片用菜單生成圖片、十萬行程式碼重構、50 公尺外洗車,以及付款信箱對不上帳號信箱等例子,說明 AI 的強項與短板都來自訓練方式與可驗證性。結論是:越能直接判斷對錯的事情,AI 越擅長;越依賴常識、經驗與理解的事情,越需要人自己把關。

01

從寫程式碼,轉向把需求說清楚

00:16

影片把軟體演進分成三層:軟體 1.0 是人寫規則,軟體 2.0 是餵資料讓模型歸納做事方法,軟體 3.0 則是直接向模型說明想要什麼,讓它理解並執行。

菜單應用的例子凸顯這個轉變:原本要先辨識菜單上的菜名,再逐道生成圖片;後來只要把菜單照片交給圖像模型並下指令,就能把菜品圖片放回原本位置。Karpathy 因此認為,他原本做的應用『根本就不該存在』。

軟體 3.0
02

AI 越擅長可驗證的難題,越容易卡在常識題

00:55

影片指出,最先進的模型可以用一行指令整理十萬行程式碼,也可能挖出人找很久都沒找到的漏洞;但遇到『50 公尺外洗車該走路還是開車』這種題目時,卻可能給出看似合理但缺乏情境分寸的回答。

原因在於數學、寫程式這類任務很容易判斷答案對錯,因此訓練者會集中優化;但常識與經驗題沒有單一標準答案,也沒有人逐步教模型所有情境。影片形容這類 AI 是被資料與規則塑造出來的系統,沒有本能,也沒有好奇心。

可驗證性
03

智能體可以加速,但可靠性仍要由人負責

01:36

影片用一個付款案例說明 AI 智能體的風險:使用者用 Google 帳號註冊,卻用另一個信箱在 Stripe 付款買積分;智能體處理充值時,試圖靠比對兩個信箱地址判斷錢該歸給誰。這種問題人一眼就能看懂,但 AI 可能完全沒有概念。

因此,Vibe Coding 降低的是『做出東西』的門檻;真正的智能體工程仍要求成果可靠。影片明確說,不能因為做得快,就用不可靠的結果糊弄過去。

智能體工程
04

可以外包思考,但不能外包理解

02:08

影片最後引用一個觀點:你可以外包你的思考,但沒法外包你的理解。即使智能體越來越強,人仍需要知道自己到底想做什麼,以及為什麼這件事值得做。

Karpathy 之所以重視個人知識庫,是因為每次讀完文章後自己寫筆記、串成資料庫,是在訓練自己的理解力。影片收束成一個測試 AI 的標準:越能直接判斷對錯的事情,AI 越擅長;越依賴常識與分寸的事情,AI 越容易翻車。

理解力

越是能直接判斷對錯的事情,AI 做得越好;越是靠常識和分寸的事情,AI 越容易翻車。

重點時間戳索引

  1. 00:00影片開頭引用 Karpathy 的說法:他從未覺得自己作為程式員如此落後,並引出 Vibe Coding 與 AI 開發能力的變化。
  2. 00:16第一個判斷:軟體 3.0 讓人不必只靠自己寫程式碼,而是把需求說清楚,讓模型理解並執行。
  3. 00:31菜單應用案例:原本要讓程式辨識菜名再生成圖片,後來發現直接把照片交給圖像模型並下指令即可完成,讓原應用顯得不必要。
  4. 00:55第二個判斷:AI 在困難但可驗證的任務上表現好,例如重構十萬行程式碼或找漏洞;但在 50 公尺外洗車該走路還是開車這種常識題上反而容易失準。
  5. 01:12影片解釋原因:數學、寫程式等任務答案容易檢查,因此訓練者會集中優化;常識與經驗題沒有標準答案,AI 缺乏本能與好奇心。
  6. 01:36第三個判斷:AI 可以幫忙做事,但結果對不對仍需人負責;影片以註冊信箱與付款信箱不一致的充值案例說明智能體可能不懂基本情境。
  7. 01:54影片區分 Vibe Coding 與智能體工程:前者降低做出東西的門檻,後者要求即使更快,也仍要維持可靠性。
  8. 02:08第四個判斷:AI 能協助思考,卻替代不了真正理解;人仍需知道自己要做什麼、為什麼值得做。
  9. 02:22Karpathy 重視個人知識庫與筆記,因為這是在訓練自己的理解力;影片最後用『可判斷對錯 vs. 依賴常識分寸』作為檢驗 AI 的標準。

關鍵字

AIVibe CodingAndrej Karpathy智能體工程軟體 3.0常識推理個人知識庫

⚠️ 未確認 / 無法核對項目

  • YouTube 未提供官方字幕或自動字幕,內容來源為 Whisper STT;英文專名依語境校正並列於 ASR 漂字對照表。
  • 『Nano 不 Nano』疑似指圖像模型暱稱或專名,逐字稿無法完全確認,主文僅保留為『圖像模型』。
  • 逐字稿中的『打風規則』疑似為 ASR 漂字,語意應為訓練或評分規則,但未在主文中擴寫。

🎙️ ASR 漂字對照表

OpenEdOpenAI
卡帕西Andrej Karpathy
WiP Coding / webcodingVibe Coding
ManugentMenuGen(疑似)
strapStripe
Nano不Nano圖像模型專名未確認
📎 原始內容(查證 / AI 追查用,非閱讀主文,點擊展開)
Whisper 原始輸出
1
00:00:00,000 --> 00:00:01,760
朋友们又出猛料了

2
00:00:01,760 --> 00:00:03,000
OpenEd的联合创始人

3
00:00:03,000 --> 00:00:04,880
特斯拉的自动驾驶工程卡帕西

4
00:00:04,880 --> 00:00:06,800
最近他说了一句挺让人意外的话

5
00:00:06,800 --> 00:00:09,800
他说我从未觉得自己作为程序员这么落后果

6
00:00:09,800 --> 00:00:11,900
WiP Coding这个词还是他自己造的

7
00:00:11,900 --> 00:00:13,320
我刚看完了他的就段访谈

8
00:00:13,320 --> 00:00:15,360
给你分享四个他最关键的判断

9
00:00:15,360 --> 00:00:16,080
先说第一个

10
00:00:16,080 --> 00:00:17,260
以前你得会写代码

11
00:00:17,260 --> 00:00:18,940
但现在你只需要回说清楚

12
00:00:18,940 --> 00:00:21,160
他说软件1.0是人来写规则

13
00:00:21,160 --> 00:00:23,460
软件的2.0是你喂给他一堆的数据

14
00:00:23,460 --> 00:00:25,760
让他自己总结出一套做事的方法

15
00:00:25,760 --> 00:00:28,040
而软件的3.0是你不用再自己写代码了

16
00:00:28,040 --> 00:00:29,500
你直接跟他说你想要什么

17
00:00:29,500 --> 00:00:31,160
他自己就能理解你的意思去干

18
00:00:31,160 --> 00:00:33,100
他自己做过一个叫Manugent的应用

19
00:00:33,100 --> 00:00:34,780
你只需要拍一张菜单的照片

20
00:00:34,780 --> 00:00:36,680
他就能生成每道菜大概长什么样

21
00:00:36,680 --> 00:00:37,860
他费了很大的劲

22
00:00:37,860 --> 00:00:40,160
先让程序员认出菜单上写的是什么菜

23
00:00:40,160 --> 00:00:41,960
然后再一道道的把图片画出来

24
00:00:41,960 --> 00:00:43,180
结果他后来发现

25
00:00:43,180 --> 00:00:45,820
直接把照片发给一个叫Nano不Nano的图像模型

26
00:00:45,820 --> 00:00:48,080
只要说一句把这些菜品批到菜单上

27
00:00:48,080 --> 00:00:49,520
他直接就把照片改好

28
00:00:49,520 --> 00:00:52,140
而且就连菜的样子都出现在了原来的位置上

29
00:00:52,140 --> 00:00:55,020
他说我做的那个应用根本就不该存在

30
00:00:55,020 --> 00:00:56,980
第二越难的事情AI做的越好

31
00:00:56,980 --> 00:00:58,860
越简单的事情他反而想不明白

32
00:00:58,860 --> 00:01:00,540
他说现在最先进的模型

33
00:01:00,540 --> 00:01:02,560
能一行指令就把十万行的代码

34
00:01:02,560 --> 00:01:03,820
从头到尾重新捋一遍

35
00:01:03,820 --> 00:01:06,260
他也能挖出别人找了很久都没找到的漏洞

36
00:01:06,260 --> 00:01:08,400
但你问他我要去50米外洗车

37
00:01:08,400 --> 00:01:09,540
该走路还是开车

38
00:01:09,540 --> 00:01:11,360
他会一本正经的告诉你该走路

39
00:01:11,360 --> 00:01:12,200
因为太近了

40
00:01:12,200 --> 00:01:14,320
他说这背后其实是有规律的

41
00:01:14,320 --> 00:01:15,880
比如像数学写代码这种

42
00:01:15,880 --> 00:01:17,700
你答案对不对一眼就能看出来

43
00:01:17,700 --> 00:01:20,320
所以训练AI的人他会拼命在这上面下功夫

44
00:01:20,320 --> 00:01:22,340
因为他非常好教也好简易对错

45
00:01:22,340 --> 00:01:24,100
但像50米该不该走路这种

46
00:01:24,100 --> 00:01:25,080
他没有标准答案

47
00:01:25,080 --> 00:01:26,800
他全靠常识和经验的事情

48
00:01:26,800 --> 00:01:28,120
没有人手把手教他

49
00:01:28,120 --> 00:01:29,260
所以这就是他的短板

50
00:01:29,260 --> 00:01:32,260
他说这些AI他不是被大自然演化出来的动物

51
00:01:32,260 --> 00:01:34,440
他是被数据和一套打风规则捏出来的幽灵

52
00:01:34,440 --> 00:01:36,240
所以他没有本能也没有好奇心

53
00:01:36,240 --> 00:01:37,920
第三AI可以帮你干活

54
00:01:37,920 --> 00:01:39,400
但对不对得你自己说了算

55
00:01:39,400 --> 00:01:41,100
他之前自己的项目就翻过车

56
00:01:41,100 --> 00:01:42,740
用户用谷歌账号注册的时候

57
00:01:42,740 --> 00:01:45,080
却用另一个邮箱在strap上付款买积分

58
00:01:45,080 --> 00:01:47,160
AI的智能体处理这笔充值的时候

59
00:01:47,160 --> 00:01:49,100
他就来想靠比对这两个邮箱的地址

60
00:01:49,100 --> 00:01:50,560
来判断这笔钱该分给谁

61
00:01:50,560 --> 00:01:52,800
这种低级的问题基本人一眼就能看穿

62
00:01:52,800 --> 00:01:54,280
但AI却完全没有概念

63
00:01:54,280 --> 00:01:57,260
他说这也是webcoding和真正的智能体工程的区别

64
00:01:57,260 --> 00:01:59,700
webcoding这样的工具是把门槛给拉低了

65
00:01:59,700 --> 00:02:01,220
谁都能靠他做出点东西

66
00:02:01,220 --> 00:02:02,580
但智能体工程不一样

67
00:02:02,580 --> 00:02:03,660
你可以做得更快

68
00:02:03,660 --> 00:02:06,040
但你做出来的东西还得跟以前一样靠谱

69
00:02:06,040 --> 00:02:08,060
不能因为快你就去糊弄

70
00:02:08,060 --> 00:02:09,320
第四AI能替你想

71
00:02:09,320 --> 00:02:11,100
但它替不了你真正懂一件事情

72
00:02:11,100 --> 00:02:13,000
他说他最近刷到了一条推文

73
00:02:13,000 --> 00:02:14,820
意思就是你可以外包你的思考

74
00:02:14,820 --> 00:02:16,180
但你没法外包你的理解

75
00:02:16,180 --> 00:02:17,660
就算现在的智能体在墙

76
00:02:17,660 --> 00:02:19,620
你还是得知道自己到底想要做什么

77
00:02:19,620 --> 00:02:20,980
为什么这件事情值得做

78
00:02:20,980 --> 00:02:22,740
不然你就会成为那个拖后腿的人

79
00:02:22,740 --> 00:02:25,340
这也是为什么他这么痴迷个人的知识库这类工具

80
00:02:25,340 --> 00:02:26,560
每次读完一篇文章

81
00:02:26,560 --> 00:02:27,960
他都会自己动手写上笔记

82
00:02:27,960 --> 00:02:29,600
然后串成一个自己的资料库

83
00:02:29,600 --> 00:02:31,100
靠这个训练自己的理解力

84
00:02:31,100 --> 00:02:32,640
以后的机器会越来越能干

85
00:02:32,640 --> 00:02:34,260
但它不能替你理解一件事情

86
00:02:34,260 --> 00:02:36,980
你也可以拿这个标准来试试你自己天天在用的AI

87
00:02:36,980 --> 00:02:38,760
越是能直接判断对错的事情

88
00:02:38,760 --> 00:02:39,500
他做得越好

89
00:02:39,500 --> 00:02:41,260
而越是靠常识和分寸的事情

90
00:02:41,260 --> 00:02:42,200
他越容易翻车