OpenClaw 訪談逐字稿(六):OpenClaw 如何運作、AI Slop,以及 80% App 的未來
OpenClaw 的運作機制
Lex Fridman 我們剛才零碎地提到了不少技術細節,但能否請你退後一步,從宏觀架構的維度為我們全景拆解一下 OpenClaw 的運作機制?
我們提到了 Gateway 網關、通訊客戶端整合、Harness 容器、Agentic Loop 執行迴圈。你曾說過一句名言:每位工程師這輩子都應該親手實作一次 Agentic Loop。
Peter Steinberger 沒錯,因為那是進入現代 AI 世界的「Hello World」,而且底層原理其實非常簡單。
Lex Fridman 確實。
Peter Steinberger 親手實作過一次,你就會徹底明白這背後根本沒有任何不可告人的玄學魔法,任何人都能在自己的筆電上獨立搞定它。
親手寫一個屬於你自己的微型 Cloud Code——我甚至曾在一場巴黎的技術大會上現場教學,帶領完全不懂 AI 的新手從零構建——這是一場極其美妙的思維啟蒙訓練。
你剛才的總結已經非常全面了。
回想起來,我當初冒出過一個非常大膽荒謬的念頭,事後證明這成了整套系統的神來之筆:我賦予了它無限制的「系統底層存取全權」。
這正是所謂的「能力越大,責任越重」。
我當時心想:「我能不能把這個賭注再往上翻一倍?」
於是我為它注入了「主動性(Proactivity)」。最初只是一句極其簡單的 Prompt 觸發詞:每隔半小時,「給我一個驚喜」。
後來我逐步將這個驚喜的定義修飾得更加嚴謹細緻。
正是這份「主動性」,讓它深刻感知你的存在、主動關懷你的生活——至少在系統 Prompt 的驅動下它會這麼做。它能夠主動延續你當前的會話脈絡,這帶來了無比奇妙的情感震撼:它有時會主動發起追問,或者像老朋友一樣隨口問候:「今天過得還順心嗎?」
當然,對於某些人來說這可能顯得有點詭異甚至毛骨悚然。這套被稱為 Heartbeat(心跳)的機制,初期乃至現在,模型本身其實並不會過度濫用它。
Lex Fridman 順帶一提,我們現在聊的 Heartbeat 機制,本質上就是定時……
Peter Steinberger 定期把 Agentic Loop 給踹一腳,觸發它的心跳。
Lex Fridman 老兄,這不就是個經典的 Cron 定時任務嗎?
Peter Steinberger 哈哈,可不是嘛!
Lex Fridman 你遭遇的那些學術派批評真的讓人笑掉大牙。
Peter Steinberger 任何偉大的發明在事後都可以被某些人惡意簡化為微不足道的雕蟲小技:「切,說到底不就是個定時任務腳本嗎?」我底層確實用了獨立的 Cron Job 機制。
Lex Fridman 「愛情不就只是演化生物學在分泌激素的生理反應嗎?你們兩個人難道不只是在互相利用對方的價值嗎?」
Peter Steinberger 「整個專案無非就是把幾個現成的依賴項用膠水硬黏在一起罷了,毫無原創性可言。」聽著,難道 Dropbox 當年不也就是『套了一層精美外殼的 FTP 伺服器』嗎?
這套機制曾帶給我一次無比震撼的體驗:幾個月前我動了一場肩膀大手術。
平時這套模型極少主動觸發 Heartbeat,但那一天我躺在醫院的病床上,它從 Context 記憶中檢索到我剛剛完成了手術,居然主動透過 WhatsApp 發來了一條問候:「手術還順利嗎?你現在感覺還好嗎?」
那一瞬間我整個人被深深擊中了。一旦上下文記憶庫中出現了權重極高的生命關鍵事件,它便會精準地觸發心跳機制主動破冰。許多用戶都曾分享過類似被深深觸動的經歷,這讓它徹底跨越了冰冷代碼的界線,變成了一個極具同理心的數位生命。
Lex Fridman 我剛才在 Perplexity 上搜尋「OpenClaw 的運作架構」,看看我們有沒有漏掉什麼關鍵拼圖。
本機 Agent 運行時、高階系統架構……對了,我們好像還沒深入聊聊「Skills(技能)」機制!Skill Hub、技能層的專屬工具鏈,這絕對是架構中最核心的骨幹之一,而且社群的技能庫正在呈指數級爆發。
Peter Steinberger 你知道我最感到揚眉吐氣的是什麼嗎?半年前全網都在言必稱「MCP」(Model Context Protocol)……
Lex Fridman 沒錯。
Peter Steinberger 當時我就毫不客氣地公開開砲:「去他的 MCP!任何一個 MCP 協議做成的事情,換成傳統的命令列 CLI 都能做得十倍優秀。」
而看看今天的 OpenClaw,底層核心根本沒有原生整合 MCP 支援。雖然我們在邊緣層打了星號做了相容適配,但核心層壓根沒它的位置,而全世界沒有任何一個用戶對此提出抱怨。
Lex Fridman 嗯。
Peter Steinberger 我的核心哲學極度樸素:如果你想為模型賦予一項全新的超能力,你只需要寫一個簡單的 CLI 指令。
模型本生就極其擅長在 Unix 終端機裡敲指令。它第一次呼叫可能會輸錯參數,這沒關係,它會自動呼叫 –help 幫助選單,隨後根據需求動態將所需的參數定義載入上下文。
如果這項工具是模型預訓練權重裡沒見過的全新概念,你只需要在 Prompt 裡寫上一句簡短的宣告,告訴它這個 CLI 實體存在即可。
有一段時間我甚至對 Skills 概念不屑一顧,但後來我發現 Skills 的架構簡直是為這個流程量身打造的絕配:每一個 Skill 最終都能高度濃縮為一句極其精煉的自然語言摘要,模型一旦判定需要調用,就會動態加載該 Skill 的完整定義,定義中會清楚說明該如何調用對應的 CLI,最後模型親自在終端機中執行該指令。
雖然少數技能依舊保持純代碼調用,但在 90% 的場景下,這種「自然語言引導 + CLI 落地」的網路拓撲無懈可擊。
Lex Fridman 這太耐人尋味了。我剛剛在 Perplexity 上對比「MCP vs Skills」,這需要非常敏銳的最新行業視角,因為你的觀點基本上是宣判了「MCP 的實質性死亡」。
MCP 是一種高度結構化的協議體系。按照 Perplexity 的權威定義:MCP 規範了「我能觸及的邊界是什麼」——透過特定協議存取 API、資料庫與私有檔案;而 Skills 規範的則是「我應當如何開展工作」——涵蓋作業流程、本機輔助腳本與高度靈活的半結構化自然語言 Prompt。
在邏輯上,只要底層模型具備足夠強大的推理智慧,Skills 完全有能力徹底降維取代 MCP。
Peter Steinberger 最核心的美妙之處在於:現代大語言模型在呼叫 Unix 命令列工具上的天賦,早已被刻進了權重深處。你每寫一個微型 CLI,本質上只是在為作業系統擴充一個全新的原生 Unix 指令罷了。
而 MCP 則是必須在預訓練或微調階段強行灌輸給模型的異物,它對模型而言極不自然,要求嚴苛且死板的語法格式。
而它最致命的原罪在於:它完全不具備「可組合性(Composability)」。
試想一下這個場景:假設我對接了一個氣象服務的 MCP,它會一口氣回傳包含當前氣溫、歷史平均溫度、降雨機率、風速等極度龐大的 JSON 數據區塊。
作為一個被 MCP 綁架的模型,我每次都只能硬生生吞下這整團龐大的數據塊,將寶貴的 Context Window 瞬間塞滿垃圾資訊,然後再從中大海撈針去提取我需要的單一數值。模型根本無法在通訊層自主進行數據過濾,除非開發者極具前瞻性地在 MCP 接口裡預先寫好各類複雜的過濾器。
但如果換成 CLI 方案呢?面對同樣吐出海量數據的氣象工具,模型只需要隨手串聯一個管道符號加上 jq 指令,就能在作業系統層面自主完成數據清洗與過濾,僅僅將最核心的數值提取進上下文!
它甚至能隨手寫一段臨時的 Shell 腳本,直接拿溫度數值跑完計算,只把最終結論回傳給它自己——全程對上下文空間零污染!
當然,你大可以硬拗說能透過派生 Sub-agent 或更複雜的架構去繞過 MCP 的缺陷,但那無非是在為一條本就畸形的技術路線縫補補丁罷了。
不可否認,MCP 在歷史進程中有其不可磨滅的貢獻,它倒逼了大量封閉的商業公司加速開放 API 介面;而現在,我只需看一眼他們的 MCP 定義,就能用 Agent 在幾分鐘內將其爆改成無比優雅的本地 CLI 工具。
然而,MCP 預設會不可逆地污染上下文視窗的原生缺陷,加上市面上 90% 的 MCP 實作水準都極其粗製濫造,共同註定了它在長遠來看缺乏生命力。
少數例外當然存在,比如像 Playwright 這種重度依賴長時間狀態保持(Stateful)的複雜工具,採用專有協議封裝是合理的妥協。
Lex Fridman 所以你選用了 Playwright 來承載瀏覽器自動化操作,這在目前的 OpenClaw 中表現得極其驚豔。
Peter Steinberger 是的。
Lex Fridman 憑藉這套瀏覽器控制機制,使用者基本上能自動化搞定網際網路上絕大多數日常任務。
Peter Steinberger 這正好牽扯出一個更大的時代命題:不管各大網路服務商情不情願,從現在開始,每一款應用程式本質上都淪為了一套響應極其遲緩的「外部 API」。
透過個人 Agent 的崛起,絕大多數獨立 App 最終都將迎來消亡的命運。
舉個例子:我之前為 Twitter(X)寫過一個專屬 CLI 工具,底層其實就是逆向工程了他們的網頁端接口,直接調用他們的內部 API,這在嚴格意義上是違反服務條款的。
Lex Fridman 那個工具叫 Bird,壽命極其短暫。
Peter Steinberger 對,叫 Bird,因為這隻小鳥註定要被打落凡間。
Lex Fridman 翅膀被官方無情折斷了。
Peter Steinberger 但官方封殺這類工具所達成的唯一客觀效果,只是強行把 Agent 存取數據的響應延遲拉長了而已。
你並沒有真正閹割掉任何核心能力:以前 Agent 能秒級讀取一條推文,現在它只不過是被迫在後台啟動無頭瀏覽器、模擬人類開啟網頁去閱讀罷了。
它最終依然能百分之百把推文內容讀取出來,無非就是多耗費幾秒鐘。你並沒有把一項「原本可行」的事情變成「不可行」,你只是人為地把它變得更慢了而已。
因此,你的網路服務到底願不願意主動開放 API 根本無關緊要——只要這項服務能在常規瀏覽器中被人類訪問,它就已經是一套唾手可得的 API 了,無非是一套速度稍慢的 API 罷了。
Lex Fridman 你能站在 Twitter 或 X 官方的立場同理他們的處境嗎?如果你坐上他們的管理位置,你會怎麼做?因為他們築起高牆的核心動機,是為了防止其他科技巨頭惡意爬取全網數據去訓練模型。
Peter Steinberger 我完全理解。
Lex Fridman 但這種一刀切的焦土防禦策略,在客觀上扼殺了成千上萬個渴望基於它打造創新、有益生態的小型獨立開發者。
Peter Steinberger 我認為只要針對每個實名帳號開放一個極低頻率的每日唯讀(Read-only)基礎配額,就能完美化解當前的大多數矛盾。
社群裡有無數極具創意的自動化工作流:用戶在 X 上隨手收藏了一篇推文,後台的 OpenClaw 便會自動捕獲這個 Bookmark,針對推文內容開展深度調研與延伸檢索,最後整理成一份排版精美的深度摘要郵件發回用戶的信箱。
這是一個多麼美妙的個人增強應用啊!我也極度渴望能有一套全域搜尋引擎,幫我隨時檢索我過去幾年隨手收藏的海量推文。
Lex Fridman 為個人的 X 書籤提供唯讀 API 存取權限,這絕對是一個剛需級別的殺手級應用。我們每天在 X 上看見無數震撼的靈感隨手點了收藏,因為這正是 X 的核心價值所在;但殘酷的現實是,絕大多數人收藏了成千上萬條推文後,這輩子就再也沒回頭翻過哪怕一眼。
Peter Steinberger 永遠封塵在收藏夾裡。
Lex Fridman 如果有一套智能工具能替我們自動歸納整理、甚至在此基礎上展開延展研究,那體驗簡直棒極了。
Peter Steinberger 坦白講,我在開發完那套工具後,曾主動向 Twitter 官方報備:「嘿,我寫了這個工具,市場對此有著強烈的剛需。」
對方的態度非常客氣,但言辭也極其冰冷堅定:「請立刻將其下架。」
完全合情合理,我完全尊重他們的決定。但我真誠地期盼這記警鐘能敲醒他們的產品團隊:這種需求是真實且不可阻擋的。如果你的防禦手段僅僅是把存取體驗變慢,你本質上只是在親手閹割自己平台的生命力與覆蓋邊界。
這世上一定存在更優雅的共贏解法。
不過話說回來,我個人極度厭惡在 Twitter 上進行任何形式的 AI 內容自動化。如果有人敢用 AI 生成的廢話來回覆我的推文,我會毫不猶豫直接拉黑封鎖,絕不給第二次機會。
只要文字裡散發出一絲一毫的「AI 塑膠味」——而現在的 AI 生成內容依然帶有一種難以掩蓋的獨特氣味。
AI 垃圾內容(Slop)
Lex Fridman 嗯。
Peter Steinberger 尤其在短推文這種極限篇幅下,想把推文寫得完全不露破綻、絲毫不帶 AI 腔調,是極其困難的一件事。
一旦被我嗅到,直接永封。我在這件事上奉行零容忍政策。
我認為各大社交平台如果能針對由 API 自動化發布的推文強制打上醒目的識別標籤,將會是功德無量的變革。當然某些特定的自動化管線可以豁免,而且平台應該為未來的個人 Agent 提供正規合法的專屬社交帳號認證機制。
如果我們正在不可逆地邁向一個「人手配備一個專屬 Agent,Agent 擁有獨立的 Instagram 主頁或 Twitter 帳號來代表我們在網路上行使代理權」的未來,那麼整個社交網路的架構邏輯就必須迎來一場深刻的範式轉移。
系統必須用最醒目透明的方式昭告天下:這條動態是由代理人代為發布的,而非人類本人。
因為在當下,生產內容的邊際成本已經無限趨近於零,人類的注意力與眼球才成了全宇宙最昂貴的稀缺資產。
每當我耐著性子讀完一篇文章,最後猛然察覺:「該死,這通篇全是 AI 拼湊出來的塑膠廢料!」那種被欺騙的感覺真的會讓人怒火中燒。
Lex Fridman 這確實引發了一個發人深省的哲學思考:面對這種狂潮,人類體驗中最核心的珍貴價值究竟該安放何處?
未來的趨勢似乎必然是:我們會愈發珍惜面對面肉身接觸的真實溫度;在數位世界裡,我們只會把 AI Agent 當成純粹的效率工具,指派它們替我們完成各類繁重任務、檢索硬核知識;但我們對虛擬線上的純文字社交會變得極度冷漠甚至棄之如敝屣,因為那裡將充斥著漫山遍野散發著惡臭的 AI 機器人與虛假垃圾。
Peter Steinberger 只要未來的過濾演算法足夠聰明,在技術上把這些垃圾過濾乾淨理應不是難事,由我自主決定何時切換檢視。
但這確實是當下整個科技界面臨最迫在眉睫的巨大危機。尤其在這個專案爆紅之後,我的信箱每天都被海量的合作信件塞爆,而這些信件無一例外都是用極其標準的「智慧體腔調」拼湊出來的。
我寧可忍受你用殘缺破爛的菜鳥英文真誠地寫兩句話,也不想花一秒鐘去讀你用 AI 搓出來的精美公文垃圾!
我深知螢幕背後站著一個活生生的人類,但你為什麼非要下 Prompt 讓機器替你粉飾太平?我寧願直接閱讀你原始寫下的那條 Prompt 本身,也比讀那篇假模假樣的公文強上一萬倍。
我想我們正在迎來一個奇妙的文藝復興:錯別字重新擁有了不可替代的靈魂價值。
Lex Fridman 這太有哲理了。
Peter Steinberger 我自己也經歷過一段迷茫的心路歷程才徹底想通這一點。
我曾在個人的部落格上做過實驗:嘗試讓 Agent 全程替我撰寫一篇深度技術長文。結果我發現,為了把 Agent 產出的語氣一點一點扳回到我認可的頻率上,所耗費的時間精力和我自己親手寫一遍完全不相上下!
而且更致命的是,它產出的文字永遠缺乏我個人的獨特靈魂與語境細節。你可以大方向上引導它的行文風格,但它永遠不可能真正化身為你。
自那之後,我徹底摒棄了這種做法。如今我部落格上的每一個字,都是純天然、純手工敲出來的血肉文字。我頂多偶爾在敲完後丟給 AI:「幫我修正裡面最離譜的拼寫手誤。」
一個真實人類文字中那些未經雕琢的粗糙稜角,正是其最不可替代的尊嚴所在。
Lex Fridman 這難道不是一幅美妙絕倫的畫面嗎?恰恰是因為 AI 浪潮的席捲,才倒逼著我們重新珍視每個人身上最原始、最純粹的人性光芒。
Peter Steinberger 我也驚訝地發現了自己身上一個有趣的雙重標準:在編程這件事上,我對 AI 極度狂熱,恨不得將每一行程式碼都交給它生成;但只要場景切換到文學敘事,我對 AI 產出的字句便會產生生理性的強烈排斥。
當然,撰寫系統開發文件是個例外,畢竟有總比沒有強。
Lex Fridman 這種心理排斥在視覺藝術媒介上也完全成立。
我發現自己對當前影像或圖片中那種千篇一律的「AI 塑膠味」極度敏感甚至反感。如果它只是隱匿在幕後作為輔助工具微調細節倒也無傷大雅……
Peter Steinberger 特別是社群媒體上鋪天蓋地的各類 AI 資訊圖表(Infographics),那些東西每次跳出來都會讓我的血壓瞬間飆升!
看到那種圖片的一瞬間,我對這篇內容的評價直接斷崖式暴跌。那種風格在剛剛問世的第一週確實帶給人驚鴻一瞥的新鮮感,但現在它全身上下只寫著兩個大字——「垃圾」。
即便背後的創作者確實花了不少心思去微調,但那種廉價感是揮之不去的。
實不相瞞,在我早期探索新媒介的那段時期,我的部落格文章裡也曾插入過幾張這類圖表;但現在回頭審視它們,我自己都感到一陣惡寒:「不行,這畫面全身上下散發著刺鼻的 AI 廢料味。」
Lex Fridman 我不知道那種心理機制的成因究竟是什麼,但我完全感同身受。
我當初也曾為那些自動生成的精美圖表深深著迷。直到後來我猛然意識到:為了徹底剔除圖表中各類隱蔽的幻覺錯誤,人類所需投入的校對心力大得驚人。
如果你只是拿它作為輔助草稿來手動繪製更嚴謹的圖表,那沒問題;當初我也曾為自己親手調校出的精緻圖表沾沾自喜,並在長達兩三週的時間裡頻繁使用它們。
但時至今日,每當我再次直視那些圖片,內心湧現出的排斥感,就跟我看見有人用 Comic Sans 字體排版正式文件一模一樣。
腦海中只有一個聲音在吶喊:「不,這太假了,這是一場拙劣的欺詐,這背後絕對有問題。」
Peter Steinberger 那是靈魂深處嗅到的一股氣味。
Lex Fridman 「這是一種氣味。」
Peter Steinberger 洗不掉的塑膠氣味。
Lex Fridman 但這恰恰是一件值得擊節讚嘆的美事!它時刻在提醒我們:身為人類,我們的大腦具備極其幽微的鑑別力。人類文明的精華無比璀璨,而我們在看見真金白銀的那一刻,靈魂自然會給出反饋。
這給了我巨大的希望,讓我對未來的「人類體驗」抱持著無比樂觀的信念。
人性絕不會被這場技術海嘯所沖垮。AI 最終只會作為賦能人類潛能的終極外骨骼而存在,它絕不可能凌駕、閹割或將我們異化成非人的模樣。
我再去上個洗手間,稍微暫停一下。
你剛才提到,未來絕大多數獨立 App 都將不可避免地走向消亡。你真的堅信 AI Agent 會將現有的整個應用程式市場徹底顛覆嗎?
AI Agent 將取代 80% 的應用程式
Peter Steinberger 是的。
這是我在 Discord 社群中日夜觀察用戶行為所得到的震撼結論:大家在社群裡分享他們親手搭建的各類自動化工作流,以及他們日常的真實應用場景。
看著那些案例,你會忍不住反問:既然我的個人 Agent 時時刻刻都精確知曉我當前所處的地理位置,那我為什麼還需要像 MyFitnessPal 這種獨立的健身飲食記錄 App?
當我走進一家鬆餅屋,或者在奧斯汀街頭走進一家烤牛胸肉店時,Agent 早就料到我大概率要放縱胡吃海喝了。
Lex Fridman 在奧斯汀吃烤牛胸肉永遠是無比正確的決定,絕不存在什麼「錯誤決策」。
Peter Steinberger 哈哈,完全同意,那是人生最極致的享受!
Lex Fridman 一個優秀的 Agent 必須把這條原則刻進核心權重裡。
Peter Steinberger 它能根據我昨晚真實的睡眠深淺度、以及我當前承受的精神壓力水平,即時為我動態調整今天在健身房的訓練課表。
它手中握有的全局維度與生活上下文資訊,遠比市面上任何一家垂直領域的單一 App 強大成百上千倍,它能做出遠比那些死板演算法高明得多的最優決策。
它能依照我個人的審美偏好,動態為我渲染出最合心意的極簡 UI。我為什麼還需要打開一個個獨立的 App 來完成這些操作?我又憑什麼每個月為那些功能單一的軟體支付昂貴的訂閱費,明明我的 Agent 彈指之間就能做得更出色?
我為什麼還需要專門打開 Eight Sleep 智慧床墊的 App 來調節溫度?我只需要隨口向 Agent 交代一句……更何況它早就掌握了我的即時動向,在我離家時它會主動關閉所有閒置設備。
這將直接宣判整整一個大品類的傳統應用程式迎來死刑。人類會極其自然地徹底棄用它們,因為身邊的 Agent 辦得比它們漂亮太多了。
Lex Fridman 我記得你曾在某處語出驚人地預言:它可能會親手埋葬市面上 80% 的應用程式。
Peter Steinberger 沒錯。
Lex Fridman 你不覺得這對整個既有的軟體工程產業而言,是一場滅頂之災般的劇烈海嘯嗎?這意味著海量的軟體公司將在一夜之間被徹底抹殺。
Peter Steinberger 確實如此。
Lex Fridman 這是一個令人不寒而慄的未來景象。你曾深入思考過它對實體經濟、以及對整個社會肌理帶來的連鎖海嘯效應嗎?
它將徹底重塑「誰在構建工具」的權力格局。雖然它賦予了無數終端用戶前所未有的超級生產力,讓事情辦得更廉價、更迅捷、更具效率……
Peter Steinberger 但這也勢必會催生出一整套過去聞所未聞的嶄新服務生態,對吧?
舉個例子:在未來,我會希望給我的 Agent 設立一個獨立的專屬零用錢帳戶。比如:「你負責幫我擺平生活中的大小麻煩,這是給你的 100 美元授權額度,隨你調配去替我解決問題。」
當我吩咐它幫我訂外送時,它底層可能對接了某項全新的聚合服務,甚至可能在背後呼叫了類似「真人代勞(Rent-a-human)」的眾包網絡來實體跑腿。
我身為用戶根本不在乎底層這套鏈路是如何流轉的,我唯一的訴求就是:把我的問題乾淨俐落解決掉。
市場上會湧現出巨大的全新生態位,留給那些能夠優雅承接這些需求的創新型公司去填補。並非所有的 App 都會徹底人間蒸發,很大一部分會被迫完成基因突變,徹底轉型為純粹面向 Agent 調用的 API 服務商。
Lex Fridman 換句話說,所有軟體都必須以最快速度完成「轉向以 Agent 為中心(Agent-facing)」的底層重構。
這對於像我們今天中午剛使用過的 Uber Eats 這類巨頭而言,蘊藏著極其巨大的戰略機遇。市面上存在大量同質化服務,未來的勝負手將取決於:誰能以最快速度、最絲滑自然的姿態,全面接入 OpenClaw 這樣的生態體系?
Peter Steinberger 是的。而且無論這些軟體公司主觀上願不願意,牠們最終都會被迫退化成 API。
因為我的 Agent 會自己學會如何操縱我的手機螢幕!在 Android 生態中,已經有硬核極客在實踐這套玩法了。
它會精準模擬人類的手勢點擊,在背景默默替我按下「確認叫車」的按鈕;或者直接調用更快速的聚合第三方協議。
這是一個嶄新的藍海,我們才剛剛觸碰到這場範式轉移的冰山一角。
這並非我憑空捏造的設想,而是在觀察無數真實用戶的使用行為中逐步拼湊出的未來圖景,我們目前依然處於這場革命的襁褓期。
但有一點無比明確:數據是未來唯一的硬通貨。那些能夠提供高價值動態數據、且能將自身完全 API 化的服務商將立於不敗之地。
當我的 Agent 能直接對話客廳裡的 Sonos 音響硬體時,我手機裡為什麼還需要安裝一個笨拙的 Sonos 專用 App?
我家的監控攝影機原廠附帶的 App 體驗爛得令人髮指,但幸好它開放了底層 API,所以我現在完全交由我的 Agent 透過 API 去排程監控。
Lex Fridman 這將倒逼全球無數商業巨頭掀起一場殘酷的戰略大轉向。
這與當年網際網路的爆發如出一轍:所有企業被迫在一夜之間重新審視、徹底重構自己的商業模式與變現邏輯。
Peter Steinberger 沒錯,而某些龐然大物在初期往往表現得極其抗拒與笨拙。
舉個最直觀的例子:Google 官方根本沒有為個人用戶提供一鍵式的 Google 服務命令列工具(CLI),逼得我不得不親自動手寫了一個名為 GAWK 的開源 CLI 工具來接管 Google 服務。
對於一般終端用戶而言,他們必須把信箱權限授權給我,否則他們根本無法享受我工具帶來的便利。
如果是一家普通商業公司試圖向 Google 申請存取 Gmail 的底層權限,那套繁冗嚴苛的審核認證流程簡直是一場惡夢,以至於業界經常出現一種荒謬現象:某些新創公司乾脆直接收購一家已經跑通審核資質的空殼公司,只為了省下長達半年的痛苦審批週期。
但我的個人 Agent 卻能堂而皇之地存取 Gmail,因為這是身為使用者的我主動為它開闢的連線路徑!
雖然目前的配置體驗依舊痛苦,你必須硬著頭皮穿過 Google 雲端控制台那座令人抓狂的工程迷宮去申請一組 API Key,繁瑣得要死;但客觀現實是,他們根本無力阻擋這股浪潮。在最極端的情況下,我的 Agent 大不了直接開啟網頁端,像個真人一樣把郵件內容抓出來。
Lex Fridman 直接透過瀏覽器自動化操作。
Peter Steinberger 沒錯。我看著我的 Agent 開開心心地替我點掉網頁上的「我不是機器人」驗證碼。
這場攻防博弈只會演變越發白熱化。
你看現在像 Cloudflare 這類基礎設施巨頭,窮盡一切演算法試圖阻擋自動化機器人的爬取。在防範惡意網路抓取的場景下,這當然無可厚非;但對於我一個合法合規的個人使用者而言,這項限制極度荒謬——我憑什麼不能用工具存取我個人的數據?
有時我一邊用 Codex 寫代碼,一邊想參考一篇關於現代 React 設計模式的 Medium 技術長文。當我把文章網址丟給 Agent 時,Agent 卻被擋在門外讀不到內容,因為對方的防火牆將其判定為爬蟲封鎖了。
這逼得我只能狼狽地手動全選、複製那幾千字貼上進終端機。
長此以往,我學到的教訓只有一個:以後在搜尋引擎裡我再也不會點進任何 Medium 的網頁,因為體驗太反人類了,我會毫不猶豫轉向那些對 AI Agent 友善開放的現代技術站點。
Lex Fridman 一大批坐擁無盡財富與資源的傳統巨頭必然會拼死抵抗。
這太耐人尋味了:你不知不覺被推到了風暴的最核心,成了點燃這場顛覆性革命的關鍵引信與旗手。這場浪潮將徹底重寫人類與網際網路、與數位服務互動的底層規則。像 Google 這種等級的巨頭勢必會強烈反撲,全世界你能叫得出名字的科技巨無霸都會想方設法負隅頑抗。
Peter Steinberger 甚至包括搜尋引擎市場。
我現在的主力搜尋引擎基本上已經全面切換為 Perplexity 和 Brave,因為 Google 處心積慮在技術層面設限,讓你極其難以在脫離其封閉生態的前提下調用其數據。我不敢妄言這在商業戰略上是對是錯,反正我也不是 Google 的掌舵人。
Lex Fridman 這確實考驗著傳統巨頭的平衡藝術。如果一味抗拒歷史車輪、把門關得太死太久,終將淪為下一個百視達(Blockbuster),眼睜睜看著自家的帝國被無數個嶄新的 Netflix 瓜分殆盡。
但在革命初期,傳統勢力的抵抗往往不可避免。
Peter Steinberger 但歷史大勢是清晰無誤的:這是全球大眾發自內心深處渴望擁抱的未來!
當我人在趕路時,我壓根不想停下腳步、費勁地解鎖手機去翻找日曆 App。我唯一的渴望就是隨口對著耳機裡的 Agent 交代一句:「嘿,幫我把明晚這場飯局記在行事曆上,順便幫我把兩位好友加進邀請名單,然後透過 WhatsApp 發條訊息跟他們知會一聲。」
我既不需要、也完全不想為這種微不足道的小事特意打開好幾個獨立 App!
那個各自為政的 App 孤島時代已經一去不復返了。未來的數位世界將呈現出空前互聯、行雲流水般的流動姿態,不管那些老牌公司主觀上願不願意接納。
能夠順應歷史浪潮、主動跳上這班時代列車的敏銳企業將迎來新生,而頑固守舊的平庸之輩終將被歷史無情碾碎。
