AI能改10萬行程式碼,卻栽在50公尺外的洗車店 #ai #科技 #vibecoding #shorts
AI能改10萬行程式碼,卻栽在50公尺外的洗車店 #ai #科技 #vibecoding #shorts
這支 Shorts 轉述 Andrej Karpathy 近期訪談中的四個判斷:AI 正在把軟體開發從『寫程式碼』推向『說清楚需求』;AI 在數學、寫程式等可驗證任務上進步很快,卻容易在常識與分寸題上翻車;AI 智能體能加速工作,但結果是否可靠仍需人類判斷;最後,AI 可以協助思考,卻不能替代人的真正理解。影片用菜單生成圖片、十萬行程式碼重構、50 公尺外洗車,以及付款信箱對不上帳號信箱等例子,說明 AI 的強項與短板都來自訓練方式與可驗證性。結論是:越能直接判斷對錯的事情,AI 越擅長;越依賴常識、經驗與理解的事情,越需要人自己把關。
從寫程式碼,轉向把需求說清楚
00:16影片把軟體演進分成三層:軟體 1.0 是人寫規則,軟體 2.0 是餵資料讓模型歸納做事方法,軟體 3.0 則是直接向模型說明想要什麼,讓它理解並執行。
菜單應用的例子凸顯這個轉變:原本要先辨識菜單上的菜名,再逐道生成圖片;後來只要把菜單照片交給圖像模型並下指令,就能把菜品圖片放回原本位置。Karpathy 因此認為,他原本做的應用『根本就不該存在』。
軟體 3.0AI 越擅長可驗證的難題,越容易卡在常識題
00:55影片指出,最先進的模型可以用一行指令整理十萬行程式碼,也可能挖出人找很久都沒找到的漏洞;但遇到『50 公尺外洗車該走路還是開車』這種題目時,卻可能給出看似合理但缺乏情境分寸的回答。
原因在於數學、寫程式這類任務很容易判斷答案對錯,因此訓練者會集中優化;但常識與經驗題沒有單一標準答案,也沒有人逐步教模型所有情境。影片形容這類 AI 是被資料與規則塑造出來的系統,沒有本能,也沒有好奇心。
可驗證性智能體可以加速,但可靠性仍要由人負責
01:36影片用一個付款案例說明 AI 智能體的風險:使用者用 Google 帳號註冊,卻用另一個信箱在 Stripe 付款買積分;智能體處理充值時,試圖靠比對兩個信箱地址判斷錢該歸給誰。這種問題人一眼就能看懂,但 AI 可能完全沒有概念。
因此,Vibe Coding 降低的是『做出東西』的門檻;真正的智能體工程仍要求成果可靠。影片明確說,不能因為做得快,就用不可靠的結果糊弄過去。
智能體工程可以外包思考,但不能外包理解
02:08影片最後引用一個觀點:你可以外包你的思考,但沒法外包你的理解。即使智能體越來越強,人仍需要知道自己到底想做什麼,以及為什麼這件事值得做。
Karpathy 之所以重視個人知識庫,是因為每次讀完文章後自己寫筆記、串成資料庫,是在訓練自己的理解力。影片收束成一個測試 AI 的標準:越能直接判斷對錯的事情,AI 越擅長;越依賴常識與分寸的事情,AI 越容易翻車。
理解力越是能直接判斷對錯的事情,AI 做得越好;越是靠常識和分寸的事情,AI 越容易翻車。
重點時間戳索引
- 00:00影片開頭引用 Karpathy 的說法:他從未覺得自己作為程式員如此落後,並引出 Vibe Coding 與 AI 開發能力的變化。
- 00:16第一個判斷:軟體 3.0 讓人不必只靠自己寫程式碼,而是把需求說清楚,讓模型理解並執行。
- 00:31菜單應用案例:原本要讓程式辨識菜名再生成圖片,後來發現直接把照片交給圖像模型並下指令即可完成,讓原應用顯得不必要。
- 00:55第二個判斷:AI 在困難但可驗證的任務上表現好,例如重構十萬行程式碼或找漏洞;但在 50 公尺外洗車該走路還是開車這種常識題上反而容易失準。
- 01:12影片解釋原因:數學、寫程式等任務答案容易檢查,因此訓練者會集中優化;常識與經驗題沒有標準答案,AI 缺乏本能與好奇心。
- 01:36第三個判斷:AI 可以幫忙做事,但結果對不對仍需人負責;影片以註冊信箱與付款信箱不一致的充值案例說明智能體可能不懂基本情境。
- 01:54影片區分 Vibe Coding 與智能體工程:前者降低做出東西的門檻,後者要求即使更快,也仍要維持可靠性。
- 02:08第四個判斷:AI 能協助思考,卻替代不了真正理解;人仍需知道自己要做什麼、為什麼值得做。
- 02:22Karpathy 重視個人知識庫與筆記,因為這是在訓練自己的理解力;影片最後用『可判斷對錯 vs. 依賴常識分寸』作為檢驗 AI 的標準。
⚠️ 未確認 / 無法核對項目
- YouTube 未提供官方字幕或自動字幕,內容來源為 Whisper STT;英文專名依語境校正並列於 ASR 漂字對照表。
- 『Nano 不 Nano』疑似指圖像模型暱稱或專名,逐字稿無法完全確認,主文僅保留為『圖像模型』。
- 逐字稿中的『打風規則』疑似為 ASR 漂字,語意應為訓練或評分規則,但未在主文中擴寫。
🎙️ ASR 漂字對照表
| OpenEd | → | OpenAI |
| 卡帕西 | → | Andrej Karpathy |
| WiP Coding / webcoding | → | Vibe Coding |
| Manugent | → | MenuGen(疑似) |
| strap | → | Stripe |
| Nano不Nano | → | 圖像模型專名未確認 |
📎 原始內容(查證 / AI 追查用,非閱讀主文,點擊展開)
1 00:00:00,000 --> 00:00:01,760 朋友们又出猛料了 2 00:00:01,760 --> 00:00:03,000 OpenEd的联合创始人 3 00:00:03,000 --> 00:00:04,880 特斯拉的自动驾驶工程卡帕西 4 00:00:04,880 --> 00:00:06,800 最近他说了一句挺让人意外的话 5 00:00:06,800 --> 00:00:09,800 他说我从未觉得自己作为程序员这么落后果 6 00:00:09,800 --> 00:00:11,900 WiP Coding这个词还是他自己造的 7 00:00:11,900 --> 00:00:13,320 我刚看完了他的就段访谈 8 00:00:13,320 --> 00:00:15,360 给你分享四个他最关键的判断 9 00:00:15,360 --> 00:00:16,080 先说第一个 10 00:00:16,080 --> 00:00:17,260 以前你得会写代码 11 00:00:17,260 --> 00:00:18,940 但现在你只需要回说清楚 12 00:00:18,940 --> 00:00:21,160 他说软件1.0是人来写规则 13 00:00:21,160 --> 00:00:23,460 软件的2.0是你喂给他一堆的数据 14 00:00:23,460 --> 00:00:25,760 让他自己总结出一套做事的方法 15 00:00:25,760 --> 00:00:28,040 而软件的3.0是你不用再自己写代码了 16 00:00:28,040 --> 00:00:29,500 你直接跟他说你想要什么 17 00:00:29,500 --> 00:00:31,160 他自己就能理解你的意思去干 18 00:00:31,160 --> 00:00:33,100 他自己做过一个叫Manugent的应用 19 00:00:33,100 --> 00:00:34,780 你只需要拍一张菜单的照片 20 00:00:34,780 --> 00:00:36,680 他就能生成每道菜大概长什么样 21 00:00:36,680 --> 00:00:37,860 他费了很大的劲 22 00:00:37,860 --> 00:00:40,160 先让程序员认出菜单上写的是什么菜 23 00:00:40,160 --> 00:00:41,960 然后再一道道的把图片画出来 24 00:00:41,960 --> 00:00:43,180 结果他后来发现 25 00:00:43,180 --> 00:00:45,820 直接把照片发给一个叫Nano不Nano的图像模型 26 00:00:45,820 --> 00:00:48,080 只要说一句把这些菜品批到菜单上 27 00:00:48,080 --> 00:00:49,520 他直接就把照片改好 28 00:00:49,520 --> 00:00:52,140 而且就连菜的样子都出现在了原来的位置上 29 00:00:52,140 --> 00:00:55,020 他说我做的那个应用根本就不该存在 30 00:00:55,020 --> 00:00:56,980 第二越难的事情AI做的越好 31 00:00:56,980 --> 00:00:58,860 越简单的事情他反而想不明白 32 00:00:58,860 --> 00:01:00,540 他说现在最先进的模型 33 00:01:00,540 --> 00:01:02,560 能一行指令就把十万行的代码 34 00:01:02,560 --> 00:01:03,820 从头到尾重新捋一遍 35 00:01:03,820 --> 00:01:06,260 他也能挖出别人找了很久都没找到的漏洞 36 00:01:06,260 --> 00:01:08,400 但你问他我要去50米外洗车 37 00:01:08,400 --> 00:01:09,540 该走路还是开车 38 00:01:09,540 --> 00:01:11,360 他会一本正经的告诉你该走路 39 00:01:11,360 --> 00:01:12,200 因为太近了 40 00:01:12,200 --> 00:01:14,320 他说这背后其实是有规律的 41 00:01:14,320 --> 00:01:15,880 比如像数学写代码这种 42 00:01:15,880 --> 00:01:17,700 你答案对不对一眼就能看出来 43 00:01:17,700 --> 00:01:20,320 所以训练AI的人他会拼命在这上面下功夫 44 00:01:20,320 --> 00:01:22,340 因为他非常好教也好简易对错 45 00:01:22,340 --> 00:01:24,100 但像50米该不该走路这种 46 00:01:24,100 --> 00:01:25,080 他没有标准答案 47 00:01:25,080 --> 00:01:26,800 他全靠常识和经验的事情 48 00:01:26,800 --> 00:01:28,120 没有人手把手教他 49 00:01:28,120 --> 00:01:29,260 所以这就是他的短板 50 00:01:29,260 --> 00:01:32,260 他说这些AI他不是被大自然演化出来的动物 51 00:01:32,260 --> 00:01:34,440 他是被数据和一套打风规则捏出来的幽灵 52 00:01:34,440 --> 00:01:36,240 所以他没有本能也没有好奇心 53 00:01:36,240 --> 00:01:37,920 第三AI可以帮你干活 54 00:01:37,920 --> 00:01:39,400 但对不对得你自己说了算 55 00:01:39,400 --> 00:01:41,100 他之前自己的项目就翻过车 56 00:01:41,100 --> 00:01:42,740 用户用谷歌账号注册的时候 57 00:01:42,740 --> 00:01:45,080 却用另一个邮箱在strap上付款买积分 58 00:01:45,080 --> 00:01:47,160 AI的智能体处理这笔充值的时候 59 00:01:47,160 --> 00:01:49,100 他就来想靠比对这两个邮箱的地址 60 00:01:49,100 --> 00:01:50,560 来判断这笔钱该分给谁 61 00:01:50,560 --> 00:01:52,800 这种低级的问题基本人一眼就能看穿 62 00:01:52,800 --> 00:01:54,280 但AI却完全没有概念 63 00:01:54,280 --> 00:01:57,260 他说这也是webcoding和真正的智能体工程的区别 64 00:01:57,260 --> 00:01:59,700 webcoding这样的工具是把门槛给拉低了 65 00:01:59,700 --> 00:02:01,220 谁都能靠他做出点东西 66 00:02:01,220 --> 00:02:02,580 但智能体工程不一样 67 00:02:02,580 --> 00:02:03,660 你可以做得更快 68 00:02:03,660 --> 00:02:06,040 但你做出来的东西还得跟以前一样靠谱 69 00:02:06,040 --> 00:02:08,060 不能因为快你就去糊弄 70 00:02:08,060 --> 00:02:09,320 第四AI能替你想 71 00:02:09,320 --> 00:02:11,100 但它替不了你真正懂一件事情 72 00:02:11,100 --> 00:02:13,000 他说他最近刷到了一条推文 73 00:02:13,000 --> 00:02:14,820 意思就是你可以外包你的思考 74 00:02:14,820 --> 00:02:16,180 但你没法外包你的理解 75 00:02:16,180 --> 00:02:17,660 就算现在的智能体在墙 76 00:02:17,660 --> 00:02:19,620 你还是得知道自己到底想要做什么 77 00:02:19,620 --> 00:02:20,980 为什么这件事情值得做 78 00:02:20,980 --> 00:02:22,740 不然你就会成为那个拖后腿的人 79 00:02:22,740 --> 00:02:25,340 这也是为什么他这么痴迷个人的知识库这类工具 80 00:02:25,340 --> 00:02:26,560 每次读完一篇文章 81 00:02:26,560 --> 00:02:27,960 他都会自己动手写上笔记 82 00:02:27,960 --> 00:02:29,600 然后串成一个自己的资料库 83 00:02:29,600 --> 00:02:31,100 靠这个训练自己的理解力 84 00:02:31,100 --> 00:02:32,640 以后的机器会越来越能干 85 00:02:32,640 --> 00:02:34,260 但它不能替你理解一件事情 86 00:02:34,260 --> 00:02:36,980 你也可以拿这个标准来试试你自己天天在用的AI 87 00:02:36,980 --> 00:02:38,760 越是能直接判断对错的事情 88 00:02:38,760 --> 00:02:39,500 他做得越好 89 00:02:39,500 --> 00:02:41,260 而越是靠常识和分寸的事情 90 00:02:41,260 --> 00:02:42,200 他越容易翻车