返回首頁

Google WikiSkill:為什麼 Agent 有了 Skill,還是會重複踩同一個坑?

發布時間:2026-09-06 08:08
YouTube 影片重點整理

Google WikiSkill:為什麼 Agent 有了 Skill,還是會重複踩同一個坑?

📺 wow⏱ 22:01🗓 2026-09-05🌐 zh-Hans🔗 https://www.youtube.com/watch?v=E2HTVNuvmOk

這支影片是 wow 對 Google Research 與 Virginia Tech 論文《WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution》的解讀。影片目前是 YouTube 會員專屬內容,無法取得可播放影像或逐字稿;本報告的影片部分只採用 YouTube metadata / shortDescription,並用 KL 補充的原論文連結交叉核對。核心主題是:WikiSkill 不只是讓 Agent 自動生成 Skill,而是在 raw execution traces 與 executable skills 中間加入可持續累積的 wiki knowledge layer。這讓失敗的 skill 更新可以被 rollback,但失敗留下的經驗仍保留在 wiki,供後續 skill proposer 使用。論文聲稱 WikiSkill 在五項 benchmark 與五種模型上,多數設定優於 no-skill baseline 與既有 skill-evolution 方法;其中 Qwen-3.5-9B + WikiSkill 的平均表現為 47.4%,高於 Qwen-3.6-27B without skills 的 39.4%。原論文連結:https://arxiv.org/html/2608.27454v1

01

1. WikiSkill 的重點不是『自動寫 Skill』,而是讓經驗可累積

影片描述指出,WikiSkill 真正有意思的地方不是單純讓 Agent 自動生成 Skill,而是在執行軌跡與 Skill 之間加入一層可持續積累的知識。

這個設計解決的是 skill evolution 常見問題:一次失敗的 skill update 可能需要 rollback,但這次失敗暴露出的模式、錯誤原因、環境限制不應該一起消失。WikiSkill 把這些經驗整理到 wiki,讓下一輪 skill proposer 可以接著用。

原論文: https://arxiv.org/html/2608.27454v1

Persistent Knowledge
02

2. Raw → Wiki → Skill:三層知識架構

論文將 agent workspace 分成三層:Raw layer 保存不可變 execution traces;Wiki layer 維護結構化、可累積的 knowledge;Skills layer 則保存演化中的 procedural knowledge。

這樣分層後,raw traces 不會被直接塞進 skill;wiki 也不是直接交給 inference agent 無限制使用,而是讓 skill proposer 在更新 skill 時能讀到更穩定、整合過的經驗。

影片描述中的『Raw → Wiki → Skill 三層架構如何讓經驗真正累積』對應的就是這個方法核心。

Architecture
03

3. Wiki 不應該直接塞給執行 Agent

影片描述特別列出『為什麼 Wiki 不應該直接塞給執行 Agent』。論文的 ablation 也支持這點:預設配置是 Skill Proposer 有 wiki access,但 Inference Agent 沒有。

論文 Table 3 指出,在 Gemini-3.5-Flash 的 ablation 中,給 Skill Proposer persistent wiki access 可把平均表現從 48.7% 提到 63.7%;但讓 Inference Agent 在 evolution rollout 時也直接讀 wiki,反而會降低最終 skill quality。

可讀成:wiki 適合用來整理與產生 skill,不一定適合在執行任務時直接塞進上下文,否則可能增加干擾。

Ablation
04

4. Skill Discovery 與 Skill Execution 可能是不同能力

論文 cross-model transfer 的觀察是:其他模型演化出的 skill,有時比模型自己演化出的 skill 更有效。影片描述也把這點列為重點之一。

具體數字上,論文提到 ALFWorld 中,Qwen-3.5-9B 使用 Qwen-3.6-27B 演化出的 skill 可達 70.2%,高於使用自己演化出的 skill 的 63.4%。

這表示『找出好程序』與『照著好程序執行』可能不是同一種模型能力;較強模型可能比較會發現泛化程序,較小模型仍可能能執行那些程序。

Cross-model Transfer
05

5. 9B + WikiSkill 超過 27B without skills,代表 Skill 可以補部分模型規模差距

影片描述強調的反直覺結果是:Qwen-3.5-9B + WikiSkill 達到 47.4%,超過沒有 Skill 的 Qwen-3.6-27B 的 39.4%。

論文同時指出,在 Qwen family 中,WikiSkill 對 4B、9B、27B 平均表現的提升分別是 12.3%、17.5%、23.9%,代表 skill evolution 並不是只替小模型補洞,也會隨模型能力變強而取得更大增益。

比較保守的解讀是:這不是說 9B 全面勝過 27B,而是在這些 benchmark 與這套 skill evolution 設定下,可累積的 procedural knowledge 足以補上部分模型規模差距。

Scaling
06

6. 距離真實生產仍有問題:驗證集、上下文干擾、skill 品質控制

影片描述最後列出『這套經驗複利機制距離真實生產還有哪些問題』。從論文內容看,至少有三個實務問題:skill update 需要 validation gate、wiki 內容不適合無限制塞給執行 agent、不同資料集上提升幅度不均。

論文也把 accepted skill updates 的分佈、small validation sets 的 robustness、optimizer API call complexity 放在 appendix 裡討論,表示這套方法不是免費午餐,而是一個需要嚴格評估與治理的 skill-evolution pipeline。

因此 WikiSkill 最有價值的訊息不是『自動生成更多 skill』,而是把失敗經驗、模式整理、skill 更新、回滾驗證拆成可審計的流程。

Production Risks

Skill 可以回滾,但經驗不該跟著消失;WikiSkill 的核心是把 Agent 的失敗編譯成下一輪可用的知識。

重點時間戳索引

  1. 00:00影片描述把 WikiSkill 的關鍵差異放在『失敗經驗如何留下來』:skill 可以回滾,但 wiki 中累積的經驗不會跟著消失。
  2. 00:00WikiSkill 採三層架構:Raw layer 保存不可變的 execution traces,Wiki layer 整理可累積知識,Skill layer 保存可執行程序。
  3. 00:00每輪 evolution 包含 inference agent、wiki maintainer、skill proposer、gating/rollback;skill update 要通過 validation 才保留。
  4. 00:00論文結果指出 WikiSkill 在五項 benchmark、五種模型上取得一致提升,且 skill evolution 與模型 scaling 互補。
  5. 00:00Qwen-3.5-9B + WikiSkill 達 47.4%,高於沒有 skill 的 Qwen-3.6-27B 39.4%;這是影片描述特別標出的反直覺結果。
  6. 00:00論文的 cross-model transfer 結果顯示,skill discovery 與 skill execution 可能是不同能力:別的模型演化出的 skill 有時比自己演化的 skill 更好用。

關鍵字

WikiSkillAgent SkillsSkill EvolutionPersistent KnowledgeGoogle ResearchQwenAI Agent

⚠️ 未確認 / 無法核對項目

  • YouTube playabilityStatus 顯示會員專屬內容,無法播放;yt-dlp 與 youtube-transcript-api 都回報 members-only / unplayable,因此沒有影片逐字稿可核對。
  • 影片沒有公開章節時間戳;key_points 的 00:00 只代表來源為影片描述與論文,而非實際段落時間。
  • 主文中超出影片描述的技術細節,均來自 KL 提供的原論文 arXiv HTML,而非影片逐字稿。
📎 原始內容(查證 / AI 追查用,非閱讀主文,點擊展開)
YouTube shortDescription(原文)
Google Research 与 Virginia Tech 提出的 WikiSkill,真正有意思的地方并不是“让 Agent 自动生成 Skill”,而是在执行轨迹与 Skill 之间加入了一层可以持续积累的知识:失败的 Skill 可以回滚,但这次失败留下的经验不会跟着消失。

更反直觉的是,在论文的五项基准平均成绩中,Qwen 3.5 9B + WikiSkill 达到 47.4%,超过没有 Skill 的 Qwen 3.6 27B 的 39.4%。

这期视频我们重点拆解:

• WikiSkill 和普通 Skill / Skill Evolution 到底有什么区别  
• Raw → Wiki → Skill 三层架构如何让经验真正积累  
• 为什么 Wiki 不应该直接塞给执行 Agent  
• 为什么 Skill Discovery 和 Skill Execution 可能由不同模型完成  
• 9B + WikiSkill 超过 27B,真正说明了什么  
• 这套“经验复利”机制距离真实生产还有哪些问题

论文:
请点击会员贴 https://www.youtube.com/post/UgkxGdvwKI_GC9cGrtc_unuO50xTcaLxe13G

#AI #AIAgent #WikiSkill #AgentSkills #LLM #GoogleResearch
arXiv 論文摘要與關鍵段落(節錄)
Title: WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
Authors: Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu. Google Research / Virginia Tech. arXiv:2608.27454v1, 27 Aug 2026. URL: https://arxiv.org/html/2608.27454v1

Abstract excerpt: Agent skills package specialized knowledge and workflows into reusable resources that extend AI agent capabilities. WikiSkill co-evolves agent skills with a persistent knowledge base, separating raw execution experience, accumulated knowledge, and executable skills. Across diverse benchmarks and models, WikiSkill outperforms state-of-the-art skill-evolution methods and improves over no-skill baselines in most settings.

Key paper excerpt: WikiSkill organizes the agent workspace into three layers: a Raw Layer that stores immutable execution traces, a Wiki Layer that maintains structured knowledge, and a Skill Layer that contains evolving procedural knowledge. Each iteration involves an Inference Agent, a Wiki Maintainer, a Skill Proposer, and a Gating and Rollback mechanism.

Key result excerpt: Qwen-3.5-9B with WikiSkill outperforms Qwen-3.6-27B without skills (47.4% vs. 39.4%). On ALFWorld, Qwen-3.5-9B reaches 70.2% with a Qwen-3.6-27B-evolved skill, compared with 63.4% using its own skill. Table 3 ablation: with Inference Agent wiki access disabled, giving the Skill Proposer persistent wiki access increases average benchmark performance from 48.7% to 63.7%.