返回首頁

逼大模型當「野人」:Caveman 與熵引導分支如何壓低 Agent 成本

發布時間:2026-08-12 20:16
YouTube 影片重點整理

逼大模型當「野人」:Caveman 與熵引導分支如何壓低 Agent 成本

📺 wow.哇⏱ 16:50🗓 2026-04-17🌐 zh-Hans🔗 https://www.youtube.com/watch?v=QgDgUxBU-ek

這支影片從 AI Agent 基礎設施的快速擴張談起,指出開發者正在面對兩種成本壓力:輸出端的 Token 稅,以及執行端在海量 API 空間中的搜尋成本。前半段介紹 Caveman 協議,影片稱它透過要求模型以極簡電報體回覆,平均砍掉 75% 的輸出 token,並用本地壓縮與文言文模式進一步壓縮上下文與字元。影片接著引用簡潔性約束相關研究,主張過度闡述不只費錢,也可能誘發幻覺;當模型被迫保持簡短時,特定科學與數學基準的準確率反而上升。後半段轉向佐治亞理工與亞馬遜的熵引導分支(EGB)論文,說明當企業有成千上萬個 API 時,傳統工具呼叫會遇到上下文爆炸、組合爆炸與試錯破產。EGB 的核心是根據模型預測的不確定度決定是否分支:低熵時單線前進,高熵時才展開多路探索,並在成功或走入死胡同後動態剪枝。影片最後把 MCP、Caveman、EGB 串成 Agent 走向企業級基礎設施的三層圖像:通信層統一工具、輸出層壓縮 token、執行層用數學路由與剪枝。

01

1. Agent 的成本問題不只在模型單價,而在高頻工作流累積出的 Token 稅

00:54

影片指出,大模型被訓練成禮貌的聊天助理後,常在輸出中帶有過度闡述、問候語與冗餘語法。這些文字在一般聊天視窗看起來像是貼心,但放進高頻、自動化的 Agent 工作流後,會在成百上千次微操作中被放大成實際費用與延遲。

這裡的核心概念是 Token 稅:不是單次回答多幾句而已,而是每一次讀檔、寫檔、執行腳本、回報狀態都被多餘語言拖慢。影片把它稱為開發者在 Agent 進入終端工程流程後撞上的成本惡夢。

Token Tax
02

2. Caveman 協議用「聰明野人」角色把輸出壓成電報體

01:33

影片介紹 Caveman 作為 token 優化協議,核心做法是透過輕量指令注入,要求模型在保持技術準確性的前提下剝離連詞、冠詞、口語填充與對沖語。模型被要求用接近「事物、動作、原因、下一步」的極簡電報體回答。

影片稱這種做法平均砍掉 75% 的輸出 token;同時,工具包還有本地壓縮模組,可壓縮專案記憶檔。影片也提到文言文模式,利用古漢語的高資訊密度進一步壓縮字元。

Caveman Protocol
03

3. 簡短不只是省錢:影片主張冗長解釋也可能誘發幻覺

03:46

影片接著把 Caveman 連到學術研究:傳統提示詞工程常以為模型思考與輸出越多,推理就越嚴謹;但影片引用 2026 年 3 月的簡潔性約束研究,說大型語言模型可能在冗長解釋中被自己的廢話繞暈,最後說服自己給出錯誤答案。

影片說,當透過類似 Caveman 的指令強制模型保持極度簡短時,特定科學與數學基準的準確率反而提高 26 個百分點。這段的重點不是「所有任務都越短越好」,而是影片明確主張:在工程工作流裡,剝離修辭可以同時降低成本與幻覺風險。

Brevity & Hallucination
04

4. 海量工具空間讓傳統工具呼叫從玩具 demo 變成組合爆炸

06:28

影片後半段轉向執行端:如果說 Caveman 是讓模型閉嘴做事,熵引導分支要解決的是模型在成千上萬個 API 中如何選路。影片指出,多數 demo 的工具庫只有個位數或十幾個工具,因此模型看起來很聰明;但真實企業環境可能有上百、上千、甚至上萬個內部 API。

影片列出三個失效點:第一,上下文爆炸,因為不可能把一萬個 API 文件全塞進 prompt;第二,組合爆炸,長週期任務連續十步工具呼叫時,錯誤機率會被放大;第三,試錯破產,傳統 Tree of Thought 或 DFS 可能讓 Agent 在大量錯誤分支上重試,直接推高 API 成本。

Large Tool Spaces
05

5. Slate 基準用長週期、多工具任務檢驗 Agent 的真實規劃能力

08:35

在提出 EGB 前,影片說佐治亞理工與亞馬遜團隊先建立 Slate 基準,因為既有測試集工具太少,或只看單步準確率,無法反映真實世界的多步協同。Slate 被描述成一個合成的電商微服務宇宙,Agent 必須在大量功能相似、命名容易混淆的 API 中完成退貨審批、跨國物流追蹤、複雜訂單修改等任務。

影片指出,頂尖模型在這種壓力測試中暴露出脆弱性:出錯後不一定能理解錯誤根源,可能用相同錯誤參數反覆請求;面對相似 API 時,也容易窮舉相關工具,浪費算力與 token。

Slate Benchmark
06

6. EGB 的核心:只在高熵、不確定的節點展開分支

10:19

影片把 EGB 描述為基於不確定性感知的動態搜尋算法。它用資訊熵衡量模型對下一個工具選擇的確定程度:如果模型很篤定,熵低;如果多個工具機率接近,熵高,代表模型處在不確定狀態。

傳統多路徑搜尋每一步都保留 Top-k 分支;影片批評這像是無論問題多簡單都強行切出平行宇宙。EGB 的做法則是 只在高熵節點分支:低熵時單線前進,高熵時才花成本探索。

Entropy-Guided Branching
07

7. 動態剪枝把算力用在刀口:低熵快走,高熵探索,成功後收縮

11:57

影片用「圍棋大師」比喻 EGB 的探索與利用。當 Agent 遇到熟悉、低熵的邏輯鏈條,EGB 會收縮分支、單線前進,不浪費 token 探索其他選項;當遇到模糊報錯或相似高階 API,熵上升,系統才在該節點展開分支。

最後,當某條探索路徑成功或走入死胡同,算法會剪掉無效分支,把算力重新收縮到正確軌道。影片稱這種機制在 Slate 長週期任務中提高成功率,並把平均 token 數與 API 呼叫次數降低一個數量級。

Dynamic Pruning
08

8. 影片的 Agent 終局圖像:MCP 擴工具、Caveman 壓輸出、EGB 管路由

13:57

影片最後把三件事拼成企業級 Agent 基礎設施:通信層由 MCP 統一工具介面,讓模型連接更多資料源與工具;輸出層由 Caveman 類協議壓縮自然語言中的多餘修辭;執行層則由 EGB 這類方法,在海量工具庫中做路由與剪枝。

影片的結論是,下一階段的價值不只在更會寫 prompt,而在能構建高熵動態路由的底層框架。誰能把 EGB 這類剪枝算法整合進 Agent 調度器,誰就更可能成為企業級 AI Agent 的路由基礎設施。

Agent Infrastructure

Agent 的效率,不只取決於模型多聰明,也取決於它少說多少廢話、少走多少錯路。

重點時間戳索引

  1. 00:00影片開場指出 AI Agent 基建快速升溫,Hermes Agent 與記憶插件等項目被視為本月開源雷達上的主角。
  2. 00:54當 Agent 被接入高頻自動化工作流,禮貌問候與冗長解釋會在大量微操作中累積成昂貴的 Token 稅。
  3. 01:33Caveman 被描述為 token 優化基礎設施,透過強制模型扮演「聰明的野人」來壓縮輸出。
  4. 02:15Caveman 的做法是剝離連詞、冠詞、填充詞與對沖語,要求模型以「事物、動作、原因、下一步」式的電報體回答。
  5. 02:44影片稱 Caveman 平均砍掉 75% 的輸出 token,並用本地壓縮模組壓縮專案記憶檔。
  6. 03:46影片引用簡潔性約束研究,主張過度闡述可能讓模型在冗長解釋中產生幻覺。
  7. 04:20影片稱類似 Caveman 的極簡指令在特定科學與數學基準中,讓準確率提高 26 個百分點。
  8. 05:43主題轉向「在 10 萬個 API 中尋找最優解」,也就是 Agent 工具鏈在執行端面對的搜尋問題。
  9. 06:28第一個問題是海量工具空間:玩具 demo 只處理少量工具,但真實企業可能有成百上千甚至上萬個內部 API。
  10. 07:39影片列出三個痛點:上下文爆炸、組合爆炸、試錯破產。
  11. 08:35佐治亞理工與亞馬遜團隊提出 Slate 基準,用來評估 Agent 面對大規模工具集與長週期任務時的表現。
  12. 10:19EGB 以資訊熵衡量模型對下一步工具選擇的不確定度,只有在高熵節點才展開分支。
  13. 11:57EGB 在低熵情境收縮成單線執行,在不確定情境才展開多路探索,並依結果動態剪枝與回溯。
  14. 13:57影片最後把 MCP、Caveman、EGB 分別放在通信層、輸出層、執行層,視為企業級 Agent 基礎設施的拼圖。
  15. 15:49結論強調,沒有底層演算法與 token 壓縮支撐,單靠病毒式敘事很難承受真實算力成本。

關鍵字

AI AgentCavemanToken 稅熵引導分支EGB工具呼叫MCPHermes AgentSlate BenchmarkAPI 路由

⚠️ 未確認 / 無法核對項目

  • YouTube 無字幕且 transcript API 顯示停用逐字稿;主文依影片描述與 Whisper STT 產生,專有名詞已做人工校正但仍建議以原影片確認。
  • 影片口播中的榜單名稱與部分專案名(如 Man Palace、Cloudman / Claude 相關字樣)受 ASR 漂字影響,未在主文做延伸判斷。

🎙️ ASR 漂字對照表

商引導 / 商營島 / 商引到分支熵引導分支(Entropy-Guided Branching, EGB)
EGPEGB
減值 / 減支 / 剪直剪枝
佐塞亞理工佐治亞理工
Julia BruziJulius Brussee(影片描述連結作者名;ASR 可能漂字)
CloudOps 4.6Claude / Claude Opus 相關字樣(未完全確認)
OpenCloudClaude Code / Claude 相關字樣(未完全確認)
Top cakeTop-k
Lost in the middle 幻覺Lost in the middle 問題
托捆稅Token 稅
📎 原始內容(查證 / AI 追查用,非閱讀主文,點擊展開)
YouTube shortDescription(原始描述)
AI Agent 正在疯狂进化,但高昂的“Token 税”却成了开发者的噩梦!大模型过度礼貌的“废话”不仅费钱,还会让 AI 降智产生幻觉?本期视频,我将带你潜入本月的开源黑暗森林,揭秘暴涨的底层框架,并深度解读“山顶洞人协议 (Caveman)”如何用极简电报体砍掉 75% 算力。同时,我们还将硬核拆解佐治亚理工与亚马逊的重磅论文,看看“熵引导分支 (EGB)”算法如何用热力学定律,拯救 Agent 在十万个 API 中的搜索迷宫!
AI Agents are evolving at an insane pace, but the astronomical "Token Tax" is becoming a developer's worst nightmare! Did you know that an LLM's polite "fluff" not only burns money but also induces hallucinations? In this video, we dive into the open-source dark forest to explore how the "Caveman Protocol" cuts compute by 75% through extreme brevity. We also break down a groundbreaking paper from Georgia Tech & Amazon, revealing how "Entropy-Guided Branching (EGB)" uses thermodynamics to help Agents navigate the massive maze of 10,000+ APIs!
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
📄 核心内容 & 关键词 | Key Content & Keywords:
Token税与山顶洞人协议 (Token Tax & Caveman Protocol): 为什么大模型的“礼貌废话”会拖垮自动化工作流?我们剖析了 Caveman 协议如何通过强制模型扮演“聪明的野人”,实现 75% 的算力节省与极高的物理压缩比。
Why does an LLM's "politeness" destroy automated workflows? We explore how the Caveman protocol forces models to act as "smart cavemen," saving 75% in compute and achieving massive physical compression.
简洁性与降智干预 (Brevity & Hallucination Mitigation): 结合学术界最新发现,揭示为什么“剥夺大模型的修辞特权”能将其在科学数学基准上的准确率暴增 26%,从物理层面消除幻觉温床。
Drawing on recent academic findings, we reveal why "stripping LLMs of their rhetorical privileges" boosts accuracy by 26% on scientific benchmarks and eliminates the root causes of hallucinations.
海量工具空间难题 (Large Tool Spaces): 当真实企业环境中存在上万个 API 时,传统的工具调用范式为何会面临“上下文爆炸”与“组合爆炸”?
Why do traditional tool-calling paradigms face "context explosion" and "combinatorial explosion" when dealing with tens of thousands of internal APIs in real enterprise environments?
熵引导分支策略 (Entropy-Guided Branching, EGB): 深度解读佐治亚理工与亚马逊的联合论文。这套基于不确定性感知(Uncertainty-aware)的动态剪枝算法,如何像围棋大师一样在探索与利用中找到最优解。
A deep dive into the joint paper by Georgia Tech & Amazon. How does this uncertainty-aware dynamic pruning algorithm find the optimal path like a Go master balancing exploration and exploitation?
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
🔔 订阅并加入我的会员 | Subscribe & Join my membership!
你认为在未来的 AI Agent 时代,大模型应该保留“人类的情感温度”,还是变成“极致冷酷的算力机器”?在评论区分享你的看法!
Do you think future AI Agents should retain "human-like warmth" or become "ruthlessly efficient compute machines"? Share your thoughts in the comments below!
如果你喜欢本期内容,请不要忘记点赞、分享,并【订阅】我的频道,开启小铃铛,第一时间获取关于前沿科技的深度解析。
If you enjoyed this video, please like, share, and SUBSCRIBE for more deep dives into our technological future.
👉 支持我持续创作 | Support My Work:
加入我的会员频道,提前观看视频并获得专属福利!
Join my channel membership to get early access to videos and exclusive perks!
https://www.youtube.com/channel/UCUruNDxpAAIsagdOH9cBuXA/join
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
🔗 本期视频提及的项目与论文链接 | Mentioned Links:
https://github.com/JuliusBrussee/caveman
https://arxiv.org/pdf/2604.00025
https://arxiv.org/pdf/2604.12126
▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬▬
#AIAgent #TokenTax #OpenSource #LLM #CavemanProtocol #MachineLearning #ArtificialIntelligence #Web3 #TechTrends #人工智能 #AI代理 #大语言模型 #开源社区 #科技前沿 #深度学习 #算法 #效率优化
Whisper STT SRT(原始逐字稿)
1
00:00:00,000 --> 00:00:02,440
在本月的开源黑暗四林中

2
00:00:02,440 --> 00:00:04,600
I-Agent的基建狂潮

3
00:00:04,600 --> 00:00:07,640
正在以一种令人窒息的动能席卷一切

4
00:00:07,640 --> 00:00:09,140
我们来看今天

5
00:00:09,140 --> 00:00:12,020
奥姆利亨特雷达上的两大绝对霸主

6
00:00:12,020 --> 00:00:14,380
一个是底层编排框架

7
00:00:14,380 --> 00:00:15,320
Hermes Agent

8
00:00:15,320 --> 00:00:19,680
正在以每天激增近4200个星的恐怖云素

9
00:00:19,680 --> 00:00:22,940
稳健的向10万星的神座发起冲锋

10
00:00:22,940 --> 00:00:26,780
而主打持久化上下文的记忆插件Cloudman

11
00:00:26,780 --> 00:00:30,560
更是迎来了超过82%的二次加速

12
00:00:30,560 --> 00:00:32,860
日增突破4100星

13
00:00:32,860 --> 00:00:34,460
直逼6万星大关

14
00:00:34,460 --> 00:00:37,360
编排引擎与记忆神经的爆发

15
00:00:37,360 --> 00:00:38,660
标志着大模型

16
00:00:38,660 --> 00:00:42,980
已经彻底在复杂的终端工程流血线中扎根了

17
00:00:42,980 --> 00:00:46,860
但当这些Agent开始全天候的在终端里

18
00:00:46,860 --> 00:00:49,120
读写文件执行脚本的时候

19
00:00:49,120 --> 00:00:51,700
开发者们迎头撞上了一个

20
00:00:51,700 --> 00:00:53,800
极其痛楚的金具鞋恶梦

21
00:00:53,800 --> 00:00:54,580
Token税

22
00:00:54,580 --> 00:00:58,880
长期以来像CloudOps 4.6这样的大圆模型

23
00:00:58,880 --> 00:01:00,720
被训练成了礼貌的仆人

24
00:01:00,720 --> 00:01:04,120
他们在输出时充满了过度阐述

25
00:01:04,120 --> 00:01:07,700
礼貌性的问候以及冗余的语法结构

26
00:01:07,700 --> 00:01:09,020
在网页聊天框里

27
00:01:09,020 --> 00:01:11,100
这种废话看起来很贴心

28
00:01:11,100 --> 00:01:15,700
但当Agent被接入高频执行的自动化工作流失

29
00:01:15,700 --> 00:01:18,380
一句简单的我很高兴为您解答

30
00:01:18,380 --> 00:01:21,920
就会在成百上千次的微操作循环中

31
00:01:21,920 --> 00:01:24,800
疯狂燃烧掉天价的API费用

32
00:01:24,800 --> 00:01:27,920
并直接拖垮系统响应延迟

33
00:01:27,920 --> 00:01:30,920
为了应对这些吞噬预算的Token刺客

34
00:01:30,920 --> 00:01:33,780
今天雷达上的第三个爆点诞生了

35
00:01:33,780 --> 00:01:37,460
它就是主打Token优化的基础设施协议

36
00:01:37,460 --> 00:01:39,940
Caveman迎来了它的起点时刻

37
00:01:39,940 --> 00:01:43,980
它在今天单日狂揽2787颗星

38
00:01:43,980 --> 00:01:47,340
实现了796%的恐怖暴涨

39
00:01:47,340 --> 00:01:50,820
总薪数强势突破3.5万大关

40
00:01:50,820 --> 00:01:53,920
可能有很多观众不了解Caveman的来历

41
00:01:53,920 --> 00:01:55,200
我简单的说一下

42
00:01:55,200 --> 00:01:57,120
它是从10分钟的玩笑

43
00:01:57,120 --> 00:02:00,400
到节省75%算力的核心基建

44
00:02:00,400 --> 00:02:03,980
Caveman协议是由荷兰的莱顿大学的

45
00:02:03,980 --> 00:02:07,460
19岁数据科学学生Julia Bruzi开发的

46
00:02:07,460 --> 00:02:11,840
这个原本只花了他10分钟就写出来的玩笑项目

47
00:02:11,840 --> 00:02:15,000
其核心逻辑极其粗暴并且有效

48
00:02:15,000 --> 00:02:18,520
就是强制大模型扮演一个聪明的野人

49
00:02:18,520 --> 00:02:20,740
通过轻量级的指令注入

50
00:02:20,740 --> 00:02:23,960
系统强迫大模型在保持百分之百

51
00:02:23,960 --> 00:02:25,980
技术准确性的前提下

52
00:02:25,980 --> 00:02:27,260
无情的剥离

53
00:02:27,260 --> 00:02:30,140
一中所有的连词贯词

54
00:02:30,140 --> 00:02:33,000
口语填充词以及对冲性废话

55
00:02:33,000 --> 00:02:37,840
模型被要求必须以事物动作原因下一步

56
00:02:37,840 --> 00:02:41,960
这种极度克制的电报体结构来进行回复

57
00:02:41,960 --> 00:02:44,340
结果是毁灭性的高效

58
00:02:44,340 --> 00:02:47,300
Caveman将模型输出的token数量

59
00:02:47,300 --> 00:02:50,260
平均砍掉了惊人的75%

60
00:02:50,260 --> 00:02:53,240
为了对付agent每次启动都要读取

61
00:02:53,240 --> 00:02:56,000
庞大背景提示词的上下文税

62
00:02:56,000 --> 00:02:59,200
工具包还配备了本地压缩模块

63
00:02:59,200 --> 00:03:02,840
能将项目的核心记忆文件压缩46%

64
00:03:03,500 --> 00:03:05,000
更令人叛计觉得是

65
00:03:05,000 --> 00:03:09,920
为了追求极致的物理压缩协议甚至内置了一个文言文模式

66
00:03:09,920 --> 00:03:11,420
利用古汉语

67
00:03:11,420 --> 00:03:12,500
省略主语

68
00:03:12,500 --> 00:03:15,200
无动词变味的极高信息密度

69
00:03:15,200 --> 00:03:19,660
系统能在维持技术参数不丢失的情况下

70
00:03:19,660 --> 00:03:24,220
实现高达80%到90%的字符及缩减

71
00:03:24,220 --> 00:03:28,780
这是对算力榨取最硬核的东方烂门主义演绎

72
00:03:28,780 --> 00:03:32,100
其实我们大众都在用脚投票

73
00:03:32,100 --> 00:03:34,480
废话不仅费钱还会降制

74
00:03:34,480 --> 00:03:36,200
如果仅仅是省钱

75
00:03:36,200 --> 00:03:39,080
Caveman是不足以引爆整个工程界的

76
00:03:39,080 --> 00:03:40,840
真正让他封城的是他

77
00:03:40,840 --> 00:03:43,480
无意间踩中了AI学术界

78
00:03:43,480 --> 00:03:46,420
关于模型降制的底层秘密

79
00:03:46,420 --> 00:03:47,680
在传统的提示词

80
00:03:47,680 --> 00:03:48,820
工程认知中

81
00:03:48,820 --> 00:03:50,520
开发者普遍认为

82
00:03:50,520 --> 00:03:52,940
模型思考和输出的越多

83
00:03:52,940 --> 00:03:54,260
推理就越严谨

84
00:03:54,260 --> 00:03:57,040
但2026年3月的这篇论文

85
00:03:57,040 --> 00:03:59,600
简洁性约束对原模型

86
00:03:59,600 --> 00:04:01,680
性能排序的逆转效应

87
00:04:01,680 --> 00:04:03,400
彻底推翻了这一尝试

88
00:04:03,400 --> 00:04:07,080
研究团队在评估了31个大模型后发现

89
00:04:07,080 --> 00:04:10,680
大型语言模型经常因为过度阐述

90
00:04:10,680 --> 00:04:12,520
而产生严重的幻觉

91
00:04:12,520 --> 00:04:14,840
他们在漫长的冗余解释中

92
00:04:14,840 --> 00:04:17,280
往往会用废话把自己绕晕

93
00:04:17,280 --> 00:04:20,280
最终说服自己给出一个错误的答案

94
00:04:20,280 --> 00:04:23,960
实验揭示了一个惊人的因果干预结果

95
00:04:23,960 --> 00:04:27,320
当通过类似Caveman的指令强制大模型

96
00:04:27,320 --> 00:04:29,360
保持极度减暖的时候

97
00:04:29,360 --> 00:04:32,760
他们在特定科学和数学基准上的准确率

98
00:04:32,760 --> 00:04:34,760
反而暴增了26个百分点

99
00:04:34,760 --> 00:04:37,920
研究指出在标准的大元回复中

100
00:04:37,920 --> 00:04:39,520
真正有技术价值的答案

101
00:04:39,520 --> 00:04:41,520
通常只占42%

102
00:04:41,520 --> 00:04:44,960
其余58%全是涂增噪音的废话

103
00:04:44,960 --> 00:04:46,000
换句话说

104
00:04:46,000 --> 00:04:49,000
Caveman协议不仅帮企业省下了钱

105
00:04:49,000 --> 00:04:53,800
还在物理层面上剥离了诱发AI产生幻觉的温床

106
00:04:53,800 --> 00:04:57,640
让聪明的大模型不再因为化劳而变笨

107
00:04:57,640 --> 00:05:00,000
随着Caveman协议光速渗透

108
00:05:00,000 --> 00:05:02,000
进各大主流的agent的终端

109
00:05:02,000 --> 00:05:06,240
这标志着AI开发者社区的一次认知大觉醒

110
00:05:06,240 --> 00:05:08,660
对于硬核的软件工程而言

111
00:05:08,660 --> 00:05:12,540
我们必须彻底抛弃对大模型的拟人化迷梦

112
00:05:12,540 --> 00:05:15,840
他们根本不是用来嘘寒问暖的虚理员工

113
00:05:15,840 --> 00:05:18,960
而是高并发高成本的算的引擎

114
00:05:18,960 --> 00:05:22,800
让一台超级计算机对你进行人类礼仪上的寒暄

115
00:05:22,800 --> 00:05:24,900
是一种极度奢侈的浪费

116
00:05:24,900 --> 00:05:27,840
当模型被剥夺了修辞特权

117
00:05:27,840 --> 00:05:29,940
回归冷酷的代码本质时

118
00:05:29,940 --> 00:05:34,120
他们才真正成为开发者大脑的高带宽延伸

119
00:05:34,120 --> 00:05:39,380
而当野人协议在输出端将算力效率逼近物理极限时

120
00:05:39,380 --> 00:05:43,120
这就引出了我们今天要深度探讨的下一个残酷命题

121
00:05:43,120 --> 00:05:45,980
在10万个API中寻找最优解

122
00:05:45,980 --> 00:05:49,640
商引到分支与agent工具链的暴力美学

123
00:05:49,640 --> 00:05:53,880
当我们将视角从输出端转向执行端时

124
00:05:53,880 --> 00:05:58,040
一个更加恐怖的算力黑洞正在吞噬着整个agent的赛道

125
00:05:58,040 --> 00:06:02,380
我们尝试通过这篇重磅论文去探索迷思

126
00:06:02,380 --> 00:06:07,800
来自佐塞亚理工学院与亚马逊联合团队的商引导分支策略

127
00:06:07,800 --> 00:06:11,520
如果说Caveman教会的大模型闭嘴做事

128
00:06:11,520 --> 00:06:13,940
那么这篇论文则是在交纳模型

129
00:06:13,940 --> 00:06:19,140
当面对一个拥有成千上万个可用API的真实企业环境时

130
00:06:19,140 --> 00:06:21,940
如何不迷失在无尽的角色术中

131
00:06:21,940 --> 00:06:26,100
用最少的试错成本找到一条通往成功的路径

132
00:06:26,100 --> 00:06:28,780
我们接下来分成这四部分来拆解

133
00:06:28,780 --> 00:06:31,520
第一部分我们要告别玩具沙盒

134
00:06:31,520 --> 00:06:34,400
直面海量工具空间的真实噩梦

135
00:06:34,400 --> 00:06:36,180
在过去的两年里

136
00:06:36,180 --> 00:06:38,580
让大约模型调用外部工具

137
00:06:38,580 --> 00:06:42,560
已经从前沿探索变成了烂大街的基础功能

138
00:06:42,560 --> 00:06:46,300
但这其中隐藏着一个巨大的幸存者偏差

139
00:06:46,300 --> 00:06:49,220
目前市面上绝大多数的agent的演示

140
00:06:49,220 --> 00:06:52,160
无论是帮你查天气订机票

141
00:06:52,160 --> 00:06:54,540
还是在终端里运行几行pattern代码

142
00:06:54,540 --> 00:06:57,940
他们所面对的工具库通常是个位数

143
00:06:57,940 --> 00:06:59,560
最多不超过十几个

144
00:06:59,560 --> 00:07:02,880
在只有5个工具的玩具沙盒里

145
00:07:02,880 --> 00:07:04,680
大模型显得极其聪明

146
00:07:04,680 --> 00:07:08,540
它可以轻松的把所有工具的描述和参数

147
00:07:08,540 --> 00:07:09,760
塞进promptly

148
00:07:09,760 --> 00:07:14,160
然后通过简单的思维链决定先用哪个后用哪个

149
00:07:14,160 --> 00:07:17,580
但是真实的商业环境是极度残酷的

150
00:07:17,580 --> 00:07:23,720
想象一下亚马逊谷歌或者任何一家大型互联网公司的微服务架构

151
00:07:23,720 --> 00:07:26,880
我们可以看到一个真实的企业级agent

152
00:07:26,880 --> 00:07:28,600
面对的不是5个工具

153
00:07:28,600 --> 00:07:31,800
而是成百上千甚至上万个内部API

154
00:07:31,800 --> 00:07:35,920
在这个被论文称为海量工具空间的黑暗森林里

155
00:07:35,920 --> 00:07:39,700
传统的工具调用范式会瞬间土崩瓦解

156
00:07:39,700 --> 00:07:41,600
首先就是上下文爆炸

157
00:07:41,600 --> 00:07:45,900
你不可能把1万个API的文档全塞进上下文窗口里

158
00:07:45,900 --> 00:07:48,600
这会直接撑爆EM token的极限

159
00:07:48,600 --> 00:07:51,400
并引发严重的lost in the middle幻觉

160
00:07:51,400 --> 00:07:54,260
然后还会面临组合爆炸

161
00:07:54,260 --> 00:07:58,500
当一个长周期任务需要连续调用10个不同的工具时

162
00:07:58,500 --> 00:08:04,160
它潜在的调用路径是一个指数级膨胀的组合数学恶梦

163
00:08:04,160 --> 00:08:08,420
哪怕模型在每一步只有1%的概率选错工具

164
00:08:08,420 --> 00:08:13,160
在十步之后任务失败率也将变成一个令人绝望的天文数字

165
00:08:13,160 --> 00:08:15,420
最后就是试错破产

166
00:08:15,420 --> 00:08:22,640
传统的tree of thought或者DFS算法会让agent在无数个错误分支上疯狂重视

167
00:08:22,640 --> 00:08:27,240
导致API调用费用瞬间击穿企业的财务预算

168
00:08:27,240 --> 00:08:30,800
为了解决这个工业界迫在眉睫的痛点

169
00:08:30,800 --> 00:08:35,080
研究团队首先做了一件极其硬核的基础设施建设

170
00:08:35,080 --> 00:08:41,220
这就是第二部分Slate基准测试扯下LM规划能力的遮羞补

171
00:08:41,220 --> 00:08:43,620
在提出解决方案之前

172
00:08:43,620 --> 00:08:47,480
论文团队敏锐的发现了一个学术界的盲区

173
00:08:47,480 --> 00:08:51,220
也就是在目前根本没有一个合格的框架

174
00:08:51,220 --> 00:08:56,740
能够评估agent在面对海量工具执行长周期任务时的表现

175
00:08:56,740 --> 00:08:59,640
现有的测试集要么工具数量太少

176
00:08:59,640 --> 00:09:01,640
要么只看单部准确率

177
00:09:01,640 --> 00:09:04,980
完全无法反映真实事件的多部协同

178
00:09:04,980 --> 00:09:07,640
为此团队开发了Slate

179
00:09:07,640 --> 00:09:11,220
这是一个专为评估海量工具集成agent

180
00:09:11,220 --> 00:09:15,360
而设计的大规模的上下文感知的基准测试

181
00:09:15,360 --> 00:09:18,320
在这个合成的电商微服宇宙中

182
00:09:18,320 --> 00:09:21,340
agent必须在无数功能相似

183
00:09:21,340 --> 00:09:23,660
命名迷惑的API中穿梭

184
00:09:23,660 --> 00:09:25,600
完成退货审批

185
00:09:25,600 --> 00:09:26,960
跨国物流追踪

186
00:09:26,960 --> 00:09:28,500
复杂订单修改

187
00:09:28,500 --> 00:09:30,580
等等长周期任务

188
00:09:30,580 --> 00:09:31,800
在这个照耀镜下

189
00:09:31,800 --> 00:09:33,180
目前顶尖的大模型

190
00:09:33,180 --> 00:09:35,180
暴露出了令人震惊的脆弱

191
00:09:35,180 --> 00:09:36,340
这包括第一

192
00:09:36,340 --> 00:09:37,560
纠错能力丧失

193
00:09:37,560 --> 00:09:38,420
在论文中

194
00:09:38,420 --> 00:09:41,520
当agent在第三步调用了一个错误的API

195
00:09:41,520 --> 00:09:42,720
导致报错事

196
00:09:42,720 --> 00:09:45,100
他往往无法理解错误的根源

197
00:09:45,100 --> 00:09:46,440
会陷入死循环

198
00:09:46,440 --> 00:09:49,580
疯狂用相同的错误参数反复请求

199
00:09:49,580 --> 00:09:52,060
直到达到最大失措次数

200
00:09:52,060 --> 00:09:52,880
第二

201
00:09:52,880 --> 00:09:54,320
搜索效率极低

202
00:09:54,320 --> 00:09:56,160
面对相似的API时

203
00:09:56,160 --> 00:09:57,840
agent往往会选择

204
00:09:57,840 --> 00:09:59,880
把所有相关的API穷取

205
00:10:00,000 --> 00:10:02,640
这极其浪费算力和Token

206
00:10:02,640 --> 00:10:05,560
面对这种人工智障般的表现

207
00:10:05,560 --> 00:10:07,240
传统的打补丁方法

208
00:10:07,240 --> 00:10:09,920
比如给Prompt加上请仔细思考

209
00:10:09,920 --> 00:10:11,260
已经完全失效了

210
00:10:11,260 --> 00:10:13,700
我们需要一种全新的数学机制

211
00:10:13,700 --> 00:10:15,420
来引导Agent的决策

212
00:10:15,420 --> 00:10:17,540
这就引出了论文的核心杀起

213
00:10:17,540 --> 00:10:19,560
我们现在进入第三个部分

214
00:10:19,560 --> 00:10:23,800
EGB用热力学定律拯救Agent搜索迷宫

215
00:10:23,800 --> 00:10:25,820
在计算机科学中

216
00:10:25,820 --> 00:10:29,120
解决指数及搜索数爆炸的唯一方法

217
00:10:29,120 --> 00:10:30,180
就是减值

218
00:10:30,180 --> 00:10:31,500
但问题是

219
00:10:31,500 --> 00:10:34,000
当大模型站在一个分叉路口

220
00:10:34,000 --> 00:10:36,700
面对100个可能的工具调用时

221
00:10:36,700 --> 00:10:39,040
它应该减掉哪99个呢

222
00:10:39,040 --> 00:10:42,220
研究团队从信息论和热力学中

223
00:10:42,220 --> 00:10:43,060
汲取了灵感

224
00:10:43,060 --> 00:10:45,360
提取了商引导分支算法

225
00:10:45,360 --> 00:10:48,000
这是一个基于不确定性感知的

226
00:10:48,000 --> 00:10:49,360
动态搜索算法

227
00:10:49,360 --> 00:10:50,680
要理解EGB

228
00:10:50,680 --> 00:10:53,180
我们首先要理解什么是预测商

229
00:10:53,180 --> 00:10:54,440
在信息论中

230
00:10:54,440 --> 00:10:56,780
商代表了系统的不确定度

231
00:10:56,780 --> 00:10:59,480
当大模型在预测下一个工具时

232
00:10:59,480 --> 00:11:01,340
如果处于低商状态

233
00:11:01,340 --> 00:11:05,760
也就是如果模型对于下一步该调用什么工具非常笃定

234
00:11:05,760 --> 00:11:07,980
这时信息商就极低

235
00:11:07,980 --> 00:11:09,620
如果处于高商状态

236
00:11:09,620 --> 00:11:13,540
也就是如果模型面对5个看起来都差不多的工具

237
00:11:13,540 --> 00:11:16,380
给它们的概率都是20%左右

238
00:11:16,380 --> 00:11:18,320
这时的信息商就极高

239
00:11:18,320 --> 00:11:21,080
说明模型处于严重的不确定中

240
00:11:21,080 --> 00:11:23,680
传统的多路径搜索算法

241
00:11:23,680 --> 00:11:24,780
不管三七二十一

242
00:11:24,780 --> 00:11:27,780
每一步都会强制保留top cake分支

243
00:11:27,780 --> 00:11:31,000
这就像一个无论遇到多简单的问题

244
00:11:31,000 --> 00:11:34,600
都要强行分裂出几个平行宇宙去尝试的疯子

245
00:11:34,600 --> 00:11:38,560
而EGP算法的做法极其优雅并且高效

246
00:11:38,560 --> 00:11:41,620
它只在高商的节点进行分支扩展

247
00:11:41,620 --> 00:11:44,100
最后我们将进入第四个部分

248
00:11:44,100 --> 00:11:47,980
动态减值的暴力美学将好钢用在刀刃上

249
00:11:47,980 --> 00:11:51,240
EGP算法在执行长周期任务时

250
00:11:51,240 --> 00:11:54,200
展现出了一种如同围棋大师般

251
00:11:54,200 --> 00:11:57,580
动态调整探索与利用的暴力美学

252
00:11:57,580 --> 00:12:00,460
这包括首先是确定性突破

253
00:12:00,460 --> 00:12:04,700
当agent遇到一条熟悉的低伤的逻辑链条的时候

254
00:12:04,700 --> 00:12:07,500
EGP算法会瞬间收缩分支

255
00:12:07,500 --> 00:12:09,560
像一把利剑一样单线途径

256
00:12:09,560 --> 00:12:12,300
绝不浪费哪怕一个多余的token

257
00:12:12,300 --> 00:12:14,680
去探索毫无意义的其他选项

258
00:12:14,680 --> 00:12:18,320
这种行为极大地降低了运算延迟

259
00:12:18,320 --> 00:12:21,600
把最基础的执行成本压到了最低

260
00:12:21,600 --> 00:12:23,760
其次是不确定性展开

261
00:12:23,760 --> 00:12:25,720
一旦任务进入深水期

262
00:12:25,720 --> 00:12:27,920
比如遇到了一个模糊的暴挫

263
00:12:27,920 --> 00:12:31,680
或者面临几个极其相似的高级API时

264
00:12:31,680 --> 00:12:34,520
系统的信息商就会瞬间飙升

265
00:12:34,520 --> 00:12:39,120
此时EGP算法会敏锐地捕捉到这种不确定性

266
00:12:39,120 --> 00:12:41,780
并立刻在这个节点展开分支

267
00:12:41,780 --> 00:12:46,120
它允许agent同时在几个不同的假设路径上

268
00:12:46,120 --> 00:12:47,060
进行试探

269
00:12:47,060 --> 00:12:49,860
最后是动态减支与回溯

270
00:12:49,860 --> 00:12:53,040
当其中一条探索分支获得成功

271
00:12:53,040 --> 00:12:54,780
或者遭遇此胡同时

272
00:12:54,780 --> 00:12:57,820
算法会果断减断其他无效分支

273
00:12:57,820 --> 00:13:01,200
将算力重新收缩到正确的轨道上

274
00:13:01,200 --> 00:13:05,480
这种该快就快该慢就慢的动态调度机制

275
00:13:05,480 --> 00:13:09,680
完美解决了海量工具空间中的算力分配问题

276
00:13:09,680 --> 00:13:11,480
它不是盲目的穷举

277
00:13:11,480 --> 00:13:15,240
而是让agent拥有了类似人类的原认知

278
00:13:15,240 --> 00:13:17,500
也就是知道自己什么时候懂了

279
00:13:17,500 --> 00:13:18,660
什么时候没懂

280
00:13:18,660 --> 00:13:20,540
在实验数据上

281
00:13:20,540 --> 00:13:23,700
这套机制彻底碾压了现有的基线算法

282
00:13:23,700 --> 00:13:27,680
它不仅在slate基准测试的长周期任务中

283
00:13:27,680 --> 00:13:31,000
大幅提高了任务完成的绝对成功率

284
00:13:31,000 --> 00:13:32,000
更关键的是

285
00:13:32,000 --> 00:13:36,380
它将执行这些复杂任务所消耗的平均token数量

286
00:13:36,380 --> 00:13:39,440
和API调用次数降低了一个数量级

287
00:13:39,440 --> 00:13:43,260
那么当我们把这一篇商营岛分支策略的论文

288
00:13:43,260 --> 00:13:46,420
与今天雷达上狂飙的Hermes Agent

289
00:13:46,420 --> 00:13:48,800
以及我们刚讨论完的Caveman协议

290
00:13:48,800 --> 00:13:50,440
放在一起审视时

291
00:13:50,440 --> 00:13:54,900
你会发现一幅关于AI Agent终局的宏大拼图

292
00:13:54,900 --> 00:13:57,220
已经完整的拼合在了一起

293
00:13:57,220 --> 00:14:01,060
目前的Agent赛道正在经历一场隐秘的大迁徙

294
00:14:01,060 --> 00:14:02,860
首先在通信层

295
00:14:02,860 --> 00:14:05,520
MCP正在统一所有的工具接口

296
00:14:05,520 --> 00:14:09,440
让大模型可以无缝连接世界上的所有数据源

297
00:14:09,440 --> 00:14:12,640
这导致了工具池的无限膨胀

298
00:14:12,640 --> 00:14:14,380
其次是输出层

299
00:14:14,380 --> 00:14:17,000
像Caveman这样的极简协议

300
00:14:17,000 --> 00:14:20,840
正在榨干自然源中每一滴多余的修辞损分

301
00:14:20,840 --> 00:14:23,980
把token利用率逼近物理极限

302
00:14:23,980 --> 00:14:25,860
再是在执行层

303
00:14:25,860 --> 00:14:28,940
这是今天这篇EGB论文所揭示的

304
00:14:28,940 --> 00:14:33,100
如何在面对因MCP而爆炸的海量工具库时

305
00:14:33,100 --> 00:14:35,900
用数学的方法进行简直与路由

306
00:14:35,900 --> 00:14:38,540
这三者的结合宣告了Agent

307
00:14:38,540 --> 00:14:40,300
他已经不再是玩具了

308
00:14:40,300 --> 00:14:43,900
他也为企业级自主编排系统指明了道路

309
00:14:43,900 --> 00:14:45,480
对于我们普通人而言

310
00:14:45,480 --> 00:14:47,040
我们不要再去觉

311
00:14:47,040 --> 00:14:48,960
如何写一个更好的prompt

312
00:14:48,960 --> 00:14:51,040
让模型调用不够工具了

313
00:14:51,040 --> 00:14:53,120
下一个百亿级别的赛道

314
00:14:53,120 --> 00:14:58,280
属于那些能够构建高商动态路由的基础设施框架

315
00:14:58,280 --> 00:15:00,080
谁能将EGB这种

316
00:15:00,000 --> 00:15:02,120
热力学级别的简直算法

317
00:15:02,120 --> 00:15:04,520
无缝集成到类似Hermes Agent

318
00:15:04,520 --> 00:15:07,420
或者OpenCloud的底层调度器中

319
00:15:07,420 --> 00:15:10,140
谁就能成为企业级Air Agent的

320
00:15:10,140 --> 00:15:11,060
终极路由器

321
00:15:11,060 --> 00:15:12,060
在未来

322
00:15:12,060 --> 00:15:14,580
这不仅意味着极高的任务达成率

323
00:15:14,580 --> 00:15:17,060
更意味着能为企业省下

324
00:15:17,060 --> 00:15:19,300
数以千万计的托捆税

325
00:15:19,300 --> 00:15:21,180
在算力及权力的时代

326
00:15:21,180 --> 00:15:22,680
这就是最冷酷

327
00:15:22,680 --> 00:15:25,180
也是最无法反驳的商业护城河

328
00:15:25,180 --> 00:15:27,080
那么今天的视频

329
00:15:27,080 --> 00:15:28,220
却要接近尾声了

330
00:15:28,220 --> 00:15:29,820
看着今日榜单上

331
00:15:29,820 --> 00:15:34,160
Man Palace那高达2088%的强力反弹

332
00:15:34,160 --> 00:15:36,620
我们必须保持极致的冷静

333
00:15:36,620 --> 00:15:38,780
在Hermes Agent和Cloud面

334
00:15:38,780 --> 00:15:43,300
双双日增突破4100颗星的绝对统治力面前

335
00:15:43,300 --> 00:15:46,100
Man Palace这种低基数的跳跃

336
00:15:46,100 --> 00:15:49,160
更像是叙事崩溃后的一次死猫跳

337
00:15:49,160 --> 00:15:52,460
这正揭示了Agent赛道最残酷的真相

338
00:15:52,460 --> 00:15:55,840
一旦核心圈层的开发者转化完毕

339
00:15:55,840 --> 00:15:58,120
如果缺乏像论文里提到的

340
00:15:58,120 --> 00:16:01,920
商引导分支这种突破性的底层算法支撑

341
00:16:01,920 --> 00:16:03,920
动能就会迅速衰竭

342
00:16:03,920 --> 00:16:06,160
没有数学上的确定性减值

343
00:16:06,160 --> 00:16:08,200
没有物理层面的token压榨

344
00:16:08,200 --> 00:16:09,920
再华丽的病毒叙事

345
00:16:09,920 --> 00:16:13,420
也终将在真实的算力成本面前败下阵来

346
00:16:13,420 --> 00:16:14,960
当Hermes Agent

347
00:16:14,960 --> 00:16:18,760
稳健的向着10万星神座发起最后冲锋

348
00:16:18,760 --> 00:16:24,760
当Caveman以796%的惊人增速撕开token优化赛道的时候

349
00:16:24,760 --> 00:16:28,160
我们应当看清这场认知套利的终局

350
00:16:28,160 --> 00:16:31,480
永远属于那些能将沉重的认知负担

351
00:16:31,480 --> 00:16:35,160
转化为高效和可靠的基础设施的项目

352
00:16:35,160 --> 00:16:39,040
这才是我们在这场淘汰赛中活下去的唯一户篮

353
00:16:39,040 --> 00:16:41,560
好的 今天的视频就先聊到这里

354
00:16:41,560 --> 00:16:42,960
如果你喜欢今天的节目

355
00:16:42,960 --> 00:16:45,560
别忘了点赞分享并订阅我的频道

356
00:16:45,560 --> 00:16:47,880
及时获取科技资讯和生的解析

357
00:16:47,880 --> 00:16:49,460
感谢观看 我们下期再见