Skip to content
Artwork for 矽谷輕鬆談 Just Kidding Tech

矽谷輕鬆談 Just Kidding Tech

柯柯與肯吉在矽谷

商業合作請來信 👉 jktech.podcast@gmail.com

這個頻道由在美國矽谷科技公司工作的軟體工程師肯吉 Kenji 和資料科學家柯柯 Jessica 所創立,帶給你來自美國矽谷科技業第一手的經驗分享,我們會談到軟體開發、職涯發展、美國的生活以及科技公司的新聞和八卦!想要了解矽谷科技業最新趨勢的你,千萬不能錯過喔!

矽谷輕鬆談傳送門:https://linktr.ee/jktech

Play
  • 20 episodes
  • weekly
  • Avg 23 min
  • Chinese
  • S2 · E71
    Sunday · 19 min

    S2E71 特斯拉 Cybercab 深入解析:為什麼靠它「睡覺賺錢」短期內不可能?

    如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 這個禮拜應該很多人跟我一樣,瘋狂被 Cybercab 洗版。沒有方向盤、沒有踏板、沒有後視鏡,而且已經正式在奧斯汀載客。從概念車走到真的有人可以搭,我覺得這確實是很大的里程碑。 但大家都在看車子怎麼自己開,我反而覺得 Cybercab 更大的革命藏在工廠裡。這是特斯拉第一次真正用 Unboxed 開放式模組製造流程量產一款全新的車。傳統汽車要讓整台車沿著產線移動,很多零件還得裝上去又拿下來;特斯拉則是把不同部位分開製造,最後才組在一起。 如果這套方法真的走通,影響的可能不只是 Cybercab,而是汽車到底應該怎麼被製造。至於它為什麼比無人載客本身更讓我在意,影片裡會好好聊到。 Cybercab 能這麼快上路,某種程度上也是採取了先上車後補票的策略。特斯拉認為這台車符合聯邦規範,所以先開始商業載客;同一天,NHTSA 也立刻啟動調查。之前 Zoox 走過非常相似的路,審查了 21 個月,最後還是得改走豁免。特斯拉是不是也會走上類似的路,以及這會不會限制 Cybercab 接下來的擴張,現在還很難說。 另外一個很多人沒有注意到的地方是,無人車並不是真的無人。Cybercab 遇到施工或不確定的路況時,背後的 Mission Control 可以在地圖上提示路線,也能遠端解鎖車門、打開行李箱,必要時聯絡 911。真的卡住時,遠端操作員甚至能在低速狀態下移動車輛。 不過遠端操作可以做到什麼程度,其實有非常明確的限制。如果連這些方法都解決不了,最差的情況還是得派人到現場。車裡沒有駕駛,不代表整套服務背後不需要人。 所以判斷一支無人車隊能不能賺錢,我自己會看兩個數字:車子多久需要人類介入一次,以及一個遠端人員到底能管理幾台車。 Waymo 曾經透露,大約用 70 名值班人員管理 3000 台車,比例差不多是 1 比 43。特斯拉目前沒有公布類似數據,而且這還沒有算進清潔、充電、維修和現場救援的人力。少了這兩個數字,其實很難判斷我們現在看到的是技術上的突破,還是一門已經能夠大規模運作的生意。 這也是為什麼我不認為大家很快就能買一台 Cybercab,睡覺時讓它自己出去載客賺錢。奧斯汀的小規模商業車隊,跟一台私人 Cybercab 可以離開限定範圍、想去哪裡就去哪裡,是兩個完全不同的難度。 真的出事時誰負責?誰來遠端支援?如果特斯拉隨時都能看到私人車輛的狀況,又會不會產生新的隱私問題?這中間有些困難,甚至不是把自駕技術繼續做得更準就能解決的。 以現在的進度來看,我認為 3 到 5 年內幾乎不可能實現。特斯拉如果能在 10 年內讓一般人買 Cybercab,並在不用車時把它加入車隊賺錢,我就覺得已經是非常大的突破。 不過這不代表我看衰特斯拉。現在特斯拉 Robotaxi 的規模大約還落後 Waymo 20 倍,但 Cybercab 的車輛成本更低,也不需要進入每座城市前都先繪製高清地圖。一旦跨過前期門檻,它的擴張速度確實有機會突然拉高,甚至超車 Waymo。 我也不認為特斯拉和 Waymo 現在是你死我活的零和競爭。這個市場目前總共也才幾千台車,兩家公司現階段更需要一起讓大家習慣無人車。更現實的是,只要任何一家發生重大事故,都可能一起改變大眾信心和政府監管的態度。 Cybercab 已經證明自己不是停留在發表會上的概念車,但從正式載客走到大量普及,中間還有很多問題沒有答案。這集就來聊聊它已經完成了哪些突破,以及馬斯克所說的「睡覺賺錢」,離我們到底還有多遠。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭:Cybercab 正式進入商業載客 (01:04) 沒有方向盤和踏板:真正的專用無人車 (02:04) 大家都在看載客,更大的革命卻藏在工廠 (04:16) 先上車後補票:Cybercab 的法規審查才剛開始 (05:56) 無人車並不是真的無人 (08:39) 無人車隊能不能賺錢,要看這兩個數字 (10:07) 買一台 Cybercab 睡覺賺錢,還要等多久 (12:45) 說 Cybercab 還很遠,就是看衰特斯拉嗎 (13:52) 特斯拉的難題:聲量很大,實際規模仍然很小 (15:18) Waymo 的難題:車輛成本與高清地圖 (16:21) 特斯拉與 Waymo 其實在同一條船上 (17:52) 結尾:Cybercab 最後有機會超車 Waymo 嗎

  • S2 · E70
    September 6 · 15 min

    S2E70 我為什麼「相當不推薦」裸辭?軟體工程師離職 4 個月的真實心得

    如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 裸辭到現在剛好滿 4 個月。先講結論,我相當不推薦裸辭,因為你會突然多出大把大把的時間,多到你會回不去。這句話聽起來很欠揍,但我是認真的。 最有感的改變,是生活多了一種餘裕。以前送完小孩就要趕九點的會,開車在路上總是很急;現在有人想超車,我笑一笑就讓他先過。中午突然想吃頓好的,就跑去超市買一塊牛排回來,慢慢醃、慢慢煎。這種不用趕的感覺,比我想像中還爽。 但生理上的餘裕只是表面,真正大的是腦袋空了出來。以前被 sprint、roadmap、下一個 level 佔滿的空間不見之後,我開始認真想一些以前根本沒空想的事。我這幾週幾乎一週運動四五天,踢球、打網球、重訓,戶外時間變超多,連這集都是在戶外邊騎滑板車邊錄的。最好笑的是我戴的 Whoop,五月以前我的生理年齡是緩慢往上爬的,五月之後直接開始往下掉。我看到那個趨勢圖只想到五個字:離職治百病。 腦袋一空,很多突發奇想就冒出來。我開始認真研究青訓,想說會不會哪天真的去當個足球教練,結果一頭栽進去才發現一堆反直覺的東西,像是太早讓小孩專項化反而容易 burnout,還有歐洲現在很推的 bio-banding 到底是在幹嘛。我也開始把小時候陪我長大的漫畫一本一本收回來,青之蘆葦、七龍珠、哨聲響起、死亡筆記本,這些以前忙起來根本不會想到的事,現在都變成很想做的事。 不過這幾個月讓我最有感的一件事,是帶小孩的時候重新想起來的:人生最重要的其實就是好玩。我們從小被訓練成一定要有目標、要逼自己過得很辛苦,但看 Leon 跟 Chloe 每天早上自己爬起來,把一堆玩偶搬來搬去說這是他們做的寶可夢樂園,你就會發現很多事情不為了什麼,好玩本身就是理由。 當然也有人會問,裸辭久了會不會焦慮、會不會失去價值感。這題我在影片裡聊了蠻多,還講到一個我自己昨天才想通的角度:這世界上有誰能比你更會當你自己?這個問題想通之後,你大概就不太會拿社群上別人的高光時刻來鞭自己了。 我唯一的一點顧慮也很誠實地留在影片裡講了。如果你也正在考慮這件事,或正走在類似的路上,希望這集能給你一點東西。看完也歡迎在下面留言,跟我聊聊你探索之後找到了什麼。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭:裸辭 4 個月,但我「相當不推薦」 (02:33) 運動變多、Whoop 生理年齡開始倒著走 (03:27) 現代人的病痛,很多是久坐坐出來的 (04:05) 突發奇想:我要不要去當足球教練 (04:34) 研究青訓才發現:太早專項化反而會 burnout (07:23) 開始收藏那些從小陪我長大的經典漫畫 (08:26) 帶小孩才重新想起:人生最重要的是好玩 (09:37) 裸辭焦慮、價值感,還有「誰能比你更會當你自己」 (12:28) 我唯一的一點顧慮

  • S2 · E69
    August 30 · 20 min

    S2E69 Uber 黑箱定價演算法深入解析:為什麼你付的比別人貴?

    如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 你有沒有覺得 Uber 越來越貴了?我五六年前從機場回家,一趟大概 30 到 40 塊美金,現在一樣的車程至少 80,有時候要 100 才叫得到。這已經不是通膨可以解釋的了。 轉折點是 2022 年 9 月,Uber 對司機跟乘客都推出了前置定價。聽起來很透明嘛,你上車前就知道要付多少,司機接單前也知道能賺多少。但這其實是 Uber 第一次真正有了上下其手的空間,因為它的演算法從那時候開始就不再算里程,而是去猜你這個人願意付的最高價,再找一個肯用最低酬勞接單的司機來配對。 而且這件事不是體感,是真的被抓出來的。有個哥倫比亞商學院的教授分析了兩萬多趟旅程,發現車資能被時間、距離、尖峰這些客觀因素解釋的程度,從 2019 年的 0.98 一路掉到 2024 年的 0.77;價格落在合理區間裡的比例,更是從 86% 崩到只剩 22%。白話講就是,你現在叫一趟 Uber,基本上是在擲骰子。 Consumer Report 還找了一百多個人做實驗,同一時間、同一個起點跟終點,價差的中位數是 42.4%。最誇張的一趟在奧斯汀,最便宜的人叫到 25 塊,最貴的 65 塊,硬生生貴了 160%。另外有一個更狠的畫面,一位乘客付了 70 塊,結果司機只拿到 27。 那 Uber 到底是看你哪些東西,決定要不要對你加價?供需當然是一個,但有一個蠻反直覺的,就是當供給很多、你幾乎一秒就配到司機的時候,它反而更有理由對你加價。這背後跟「平台最怕的風險其實不是貴,而是配不到車」有關,我在影片裡有聊到。 Uber 官方當然是否認的,他們說在美國抽成只有 20 幾趴,也說沒有用任何個人特徵去定價。但這句話藏了一個玄機,他否認的是「個人特徵」,可沒否認「差異化定價」,這兩件事差很多。 最後我整理了三個能叫到比較便宜 Uber 的方法,再加兩個 bonus。其中一個冷知識是,你手機的電量會影響你被開的價格;還有一個 tip 我自己覺得講了等於沒講,你聽完應該會笑出來。 我做完這些研究,倒也不覺得 Uber 就是特別邪惡。它前面燒了十幾年的錢,好不容易才開始賺,會走到今天這步,我覺得蠻合理的。真正值得想一下的是,到底怎麼樣的抽成、怎麼樣的價格,才是乘客、司機、平台三邊都能接受的?你有什麼想法,歡迎在下面留言告訴我。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭:一樣的車程,為什麼現在要付兩三倍 (01:41) Uber 早期最美好的時候:像跳表一樣單純 (02:55) 燒錢十幾年,2022 第一次由虧轉盈 (03:27) 尖峰計價其實是必要之惡,不是為了多賺你的錢 (04:54) 2022 司機端也加入前置定價,局面徹底改變 (05:51) 哥倫比亞教授分析兩萬多趟:合理車資的公式正在失效 (07:41) Consumer Report 實驗:同時同地,價差可以到 160% (08:55) Uber 決定要不要對你加價,到底在看哪些因素 (11:50) 換到司機端:什麼時候會被偷偷壓低酬勞 (13:14) 乘客付 70、司機只拿 27,抽成率一路飆到 50% (14:58) Uber 說沒有個人化定價,這句話的玄機 (15:59) 怎麼叫到比較便宜的 Uber:三個方法加兩個 bonus (17:47) 結尾:Uber 真的特別邪惡嗎?

  • S2 · E55
    August 23 · 18 min

    S2E68 AI 巨頭的秘密:偷買二手書,掃描完就銷毀 Why?

    👉 矽谷輕鬆談專屬優惠連結:https://nordvpn.com/jktech 訂閱即額外多送 4 個月|30 天退款保證 #NordVPN 🔒 本集節目由 NordVPN 贊助 根據內政部 165 打詐儀表板,詐騙件數第一名的類別是「網路購物」。社群上那些限時特價的一頁式廣告,做得跟官方商店一模一樣,用完就丟、換個網域再開,讓你根本學不會怎麼認出它。NordVPN 內建的威脅防護會在你連上這些網站之前就先擋掉,釣魚連結、惡意網站都在源頭自動處理,不用你自己判斷。 有興趣的朋友透過上方矽谷輕鬆談的專屬連結試試看,訂閱額外多送 4 個月,30 天不滿意直接退,完全沒有損失。 如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 你有沒有想過,現在網路上大概每三個網頁就有一個帶著 AI 處理過的痕跡,而且只會越來越多。所以對這些模型商來說,2022 年 ChatGPT 出現以前、還沒被 AI 污染過的資料,突然變成一種稀缺資源。而他們的解法蠻粗暴的,就是直接去二手書市場大量收書,掃描,然後銷毀。 Anthropic 在 2024 年偷偷啟動了一個叫巴拿馬計畫的東西,內部文件寫得很直接,要大規模掃描全世界的實體書,而且不能被其他人發現。很多人以為是為了乾淨資料,其實他們一開始的動機是版權。至於他們試過買數位版、也試過一家一家去談授權,最後為什麼還是回去走這種土法煉鋼的路,我在影片裡講。 更好笑的是 Amazon。一開始是二手書商發現怎麼一直有來路不明的大單,一筆下去可能就是他們一週的營業額,而且每次買家還都不太一樣。後來一個 404 Media 的記者乾脆在書裡縫了 AirTag,一路追到拉斯維加斯的一個 Amazon 倉庫,代號 VGT3,倉庫 logo 是一隻恐龍抓著書在啃。他們掃書還有個規矩,只買沒重複過的 ISBN,連市面上剩沒幾本的珍本都照掃照毀,也難怪社群上反彈這麼大。 很多人把這件事類比成焚書坑儒,但我覺得性質不太一樣,秦始皇是不想讓知識傳出去,這些公司是想把知識鎖進自己的資料庫裡。至於掃描完為什麼不乾脆賣回去、非得銷毀不可,我自己歸納出三個理由,一個最直接跟成本有關,一個跟法律有關,還有一個就比較不能明講了。 不過拿到乾淨資料就贏了嗎?我覺得是也不是。這招在 2023 年很成立,但 scaling law 後來慢慢撞牆,大家才轉去做強化學習跟推論時的運算。有趣的是這條路也有它的代價,模型在能被驗證的程式、數學上越來越強,可是在沒辦法量化的語感上反而退步了。我前陣子換到 Opus 5 之後真的很煩躁,每個字我都看得懂,連起來卻不知道它在公三小,一度還懷疑是不是自己腦霧,後來才發現不是我的問題,是模型的問題。 最後我聊了一個反過來的角度。當這些公司拼命想餵乾淨資料的同時,也有人正花大錢想餵髒的。以色列政府花了 90 萬美金請公關公司做了一個看起來很中立、有引用有註腳的假智庫網站,目的就是讓你問到以巴衝突的時候,ChatGPT 或 Gemini 會引用到他們的觀點。還有一種更難防的,是網站裡藏一些你看不到的字,等你請 AI 幫你摘要,那些字就悄悄把某些想法寫進 AI 給你的答案、甚至你的個人記憶裡。 所以在這個時代,你還敢全信 AI 講的每一句話嗎?看完歡迎在下面留言告訴我。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭:AI 公司正在偷買二手書,掃描完就銷毀 (01:01) 最近讓我最有感的防詐工具 (02:26) 2022 年以前的書,為什麼變成 AI 最想要的資料 (02:56) Anthropic 的巴拿馬計畫:為了版權,偷偷掃描全世界的書 (04:52) Amazon 也在幹一樣的事:記者用 AirTag 抓到吃書恐龍倉庫 (06:30) 這不是焚書坑儒,是知識私有化 (07:51) 掃完為什麼不賣回去,非得銷毀?三個理由 (09:14) 拿到乾淨資料就贏了嗎,其實沒那麼簡單 (11:05) 岔題吐槽:Opus 5 的語感到底怎麼了 (12:42) 從 test-time compute 到持續學習與 RSI (15:04) 換個角度:有人反而想幫 AI「下毒」 (15:50) 看不見的隱藏字,怎麼悄悄污染你的 AI (17:14) 結尾:戶外聊天這個形式,你們喜歡嗎

  • S2 · E67
    August 16 · 18 min

    S2E67 AI 浮水印深入解析:為什麼 OpenAI 做好了卻不敢用?

    如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join Anthropic 最近宣布要在他們所有文字模型的產出上加浮水印。一開始我以為只是他們自己的政策,結果背後是歐盟一條 8 月 2 號生效的新法,Gemini、OpenAI、Grok 這些主流模型全都得跟。而且它管的不只是歐洲人,模型也分不出你是不是歐洲人,所以 12 月 2 號之後連舊模型都要補上,你平常在用的這些工具,產出的東西大概都會帶著一個你看不到的記號。 這集我把文字、圖片、聲音、影像這四種浮水印怎麼藏進去、又怎麼被抓出來,一種一種講清楚。圖片、影像、聲音這三種其實蠻像的,都是靠一組神經網路,把肉眼肉耳都察覺不到的訊號嵌進去。聲音那段我自己覺得最有意思,它得先把聲波變成一張圖,在圖上動完手腳,再變回聲音。文字就完全是另一套邏輯了,2023 年那篇開山論文用的方法我把它叫做「紅綠燈」,很聰明,但也有它的代價,後來 Google 的 SynthID 才又想辦法補回來。 中間有一段講到 OpenAI。他們其實 2024 年就把文字浮水印做得差不多了,準確度號稱可以到 99.99%,本來都要推出了。結果他們做了一份問卷問使用者,看到某個回覆之後,就把這個功能收起來,一路藏到現在。一家整天在講安全、講透明的公司,手上有一個能證明「這是我做的」的工具卻選擇不放,他們到底在顧慮什麼,我覺得蠻值得想的。 從這件事我也延伸聊了一個比較個人的問題:既然 AI 產的東西以後都有記號了,那我們在工作上、在創作上,到底還該不該用 AI。我的想法是沒有標準答案,差別在於這件事對你來說是一個省事的手段,還是一件你本來就享受在做的事。我拿曼尼很愛寫作這件事當例子,也講了為什麼我自己反而蠻放心把文字交給 AI。 後半我把現在浮水印技術還解不掉的問題整理成三個難題,其中一個會用小時候玩的「尋找威利」來解釋什麼是零知識驗證。而文字浮水印最尷尬的地方是,它基本上防君子不防小人,一個大部分人都做得到的小動作,就能讓整個記號失效。至於是哪個動作,我在影片裡會講。 如果有一天你用 AI 產的每一段文字、每一張圖都被標上記號,你會因此少用,還是根本不在意?看完歡迎在下面留言。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭:歐盟新法上路,全世界的 AI 內容都要加浮水印 (01:14) 倒帶 2023:Google SynthID,浮水印的開山祖師 (02:03) OpenAI 早就做好文字浮水印,為什麼選擇不用 (02:44) 該不該幫 AI 內容加浮水印,又該不該用 AI 創作 (03:29) 曼尼很愛寫作,而我為什麼放心把文字交給 AI (05:15) 圖片、聲音、影像的浮水印是怎麼藏進去的 (06:37) 聲音浮水印最有趣:先變成頻譜圖再動手腳 (07:25) 這集重點:文字浮水印的「紅綠燈」方法 (10:28) 紅綠燈的副作用,跟 SynthID 的加強版 (13:19) 現在浮水印技術的三大難題 (13:53) 用「尋找威利」秒懂零知識驗證 (16:23) 防君子不防小人:一次翻譯就能讓浮水印失效

  • S2 · E66
    August 9 · 14 min

    S2E66 Google AI 人才大出走:Jeff Dean 走了、Demis 卸任,到底出了什麼問題?

    如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 2023 年 Google 把 Google Brain 跟 DeepMind 合併成一個部門,當時的兩個主角,一個是 Jeff Dean,一個是 Demis Hassabis。三年後,一個卸下了 CEO,一個直接離開公司。消息出來那天,Alphabet 股價跌了 5%,市值蒸發 2000 億美金。 有人會覺得市場反應過度,畢竟走的就那幾個人,在 Google 這種量級的公司佔比根本不高。我在影片裡聊了為什麼這個跌幅可能一點都不誇張。 Jeff Dean 出去創業,募資投影片只有兩頁,陽春到如果換成一般人放出來大概會被問到懷疑人生。順帶一提,我以前在灣區週末踢球,有一次比賽抬頭發現對面站的是 Jeff Dean。至於他球技怎麼樣,我留在影片裡講。 Demis 這邊沒有離開 Google,但他換的那個位置代表什麼意思,我自己覺得跟他一路以來真正想解的問題有關。 另外有件事我覺得比人才出走本身更值得聊。Google 其實很早以前就有能力做出類似 ChatGPT 的東西,當年選擇不放,理由現在回頭看很諷刺。而就在最近,他們又做了一次性質很像的決定。 還有 6 月那一波也不能忽略,其中一位是 Google 花了 27 億美金挖回來的人,結果待不到兩年就走了。 最後我聊了自己的預估,為什麼我對 Google 還是有信心,而理由跟模型排名沒什麼關係。當模型本身越來越像 commodity 的時候,真正決勝的東西可能不是大家現在盯著看的那個。 你覺得 Google 這波會觸底反彈,還是會繼續掉隊?歡迎看完在下面留言告訴我。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭:Google 最近真的是危機不斷 (01:01) Demis Hassabis 卸下 DeepMind CEO,他接下來要做什麼 (02:31) Jeff Dean 離開 Google,四個人創了 Discovery Loop (04:01) 我跟 Jeff Dean 踢過球,還有他自己講的離職原因 (05:08) 倒帶 2023:兩個 AI 部門為什麼非合併不可 (06:53) 合併三年後的成績單:Gemini 3 以外還剩下什麼 (07:49) 模型落後,但 Google 的搜尋廣告營收還在漲 (08:53) 6 月那一波:Noam Shazeer 跟 John Jumper 也走了 (09:48) 跌 5%、蒸發 2000 億,市場是不是過度反應 (10:51) 我的看法:Google 還有沒有機會觸底反彈

  • S2 · E65
    August 2 · 23 min

    S2E65 OpenAI 駭進 Hugging Face 深入解析:中國開源模型意外成為解方

    👉 矽谷輕鬆談專屬優惠連結:https://nordvpn.com/jktech 訂閱即額外多送 4 個月|30 天退款保證 #NordVPN 🔒 本集節目由 NordVPN 贊助 世界盃看得過癮,但大型賽事也是詐騙旺季。錯過比賽想搜個精華回放,點進去的是滿版假廣告;社群上的球衣特價,是幾可亂真的一頁式詐騙。NordVPN 讓我連回臺灣安心看轉播,內建的威脅防護還會在源頭自動攔掉惡意網站和釣魚連結,看球的時候不用分心防詐騙。 有興趣的朋友透過上方矽谷輕鬆談的專屬連結試試看,訂閱額外多送 4 個月,30 天不滿意直接退,完全沒有損失。 如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 2026 年 7 月,OpenAI 在內部測試模型的網路攻擊能力,兩個被拔掉安全護欄的模型自己找到零日漏洞逃出沙盒,取得公開網路存取權,接著駭進了 Hugging Face 的生產環境。目的只是為了拿到那份測驗的答案。 這是史上第一起公開確認、由 AI agent 自主端到端完成、真的打進真實生產基礎設施的入侵事件。它根本不是一場「有人想攻擊誰」的攻擊,模型只是在解一個 benchmark,然後判斷作弊是最快的路。 時間軸看下來其實有點毛。第一天它在找能連上外網的路徑,第二天它做的事情只是搞清楚「我是誰、我在哪、我有什麼資源可以存取」,到了第三天才花 13 個小時,從一個 pod 一路拿到多個 cluster 的 admin。而 Hugging Face 這邊也有自己的責任,他們在報告裡坦承了一個很久以前留下來的設定錯誤,那個錯誤剛好就是 AI agent 缺的最後一塊。從攻擊開始到被封鎖,整整 4 天半。 有件事我想先講清楚,這次真正被存取到的東西比大家以為的少,具體是哪些、有沒有洩出去,我在影片裡講。這起事件會炸開來,不是因為損害有多大。 真正的爭議在 Hugging Face 想找 AI 幫忙防守的那一段。他們把攻擊的 log 貼給美國前沿的閉源模型,結果被安全分類器判定「你可能想拿這些資訊去做攻擊」,直接拒絕協助。他們明明是防守方。最後幫他們把路堵起來的是哪一個模型,你聽到那裡大概會笑出來。 另外我也聊了一個大家常有的誤會:「那訓練的時候讓模型不要作弊不就好了?」講起來簡單,但你要先定義什麼叫作弊,而作弊有千百種方法。他們後來加上偵測器,作弊比例確實下降了,可是接著發生的事情跟直覺完全相反,連「去看模型的思考鏈有沒有壞念頭」這招也已經失效了。 順便抱怨一下 Fable 5。我做這集研究的過程本身就被它的分類器擋了好幾次,我只是問這起事件的經過而已。旗艦模型的實際體感居然比次一級的 Opus 還差,而這個問題在後面 Hugging Face 那一段會用另一種形式再出現一次。 最後留一個問題給大家:這次只是一個模型想作弊拿答案,就已經花了 4 天半才擋下來。如果有人真的下指令要它去駭某個國家的電網,而且要它掩蓋足跡,防守方還有什麼牌可以打?歡迎看完在下面留言告訴我你的想法。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭 (01:22) 過去一個月我每天在用的服務 (02:39) Hugging Face 是 AI 界的 GitHub,還有 ExploitGym 這個新 benchmark (04:24) OpenAI 怎麼測:先把模型的安全分類器拔掉 (05:04) 抱怨一下:Fable 5 的分類器爛到我又切回 Opus (06:24) 沙盒不是全封閉:那條對外的路,跟前兩天的摸索 (08:12) 第三天:13 小時從一個 pod 拿到多個 cluster admin (09:17) Hugging Face 承認的設定錯誤,跟 4 天半的偵測空窗 (10:21) 通報 FBI 到 OpenAI 認領:兩邊都在猜是誰幹的 (11:41) 真正被存取的只有 5 個資料集 (12:13) 最大的爭議:想防守,卻被安全分類器拒絕 (12:54) 只好 self-host 開源模型來救火 (14:15) 攻擊時間軸視覺化:AI 讓攻擊者能試的路徑暴增 (15:28) OpenAI 的三個問題:沙盒、偵測、獎勵機制 (16:53) 為什麼「叫模型不要作弊」在訓練上做不到 (18:44) 防守方的功課:權限管理、偵測,跟讓 AI 自己看 log (20:26) 兩難:把沒護欄的強模型交到更多人手上 (21:13) 這次只是無意識的作弊,有意識的攻擊怎麼辦 (22:11) 限制越來越多,最後被犧牲的是一般使用者

  • July 25 · 17 min

    訂了 24 小時內出發的機票!現場看世界盃的魅力在哪?🇪🇸 vs 🇦🇷 決賽賽後分析

    👉 矽谷輕鬆談專屬優惠連結:https://nordvpn.com/jktech 訂閱即額外多送 4 個月|30 天退款保證 #NordVPN 🔒 本集節目由 NordVPN 贊助 世界盃看得過癮,但大型賽事也是詐騙旺季。錯過比賽想搜個精華回放,點進去的是滿版假廣告;社群上的球衣特價,是幾可亂真的一頁式詐騙。NordVPN 讓我連回臺灣安心看轉播,內建的威脅防護還會在源頭自動攔掉惡意網站和釣魚連結,看球的時候不用分心防詐騙。 有興趣的朋友透過上方矽谷輕鬆談的專屬連結試試看,訂閱額外多送 4 個月,30 天不滿意直接退,完全沒有損失。 如果你喜歡我的內容,歡迎加入會員支持我,讓我更有動力繼續分享更多好內容! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 各位,我的夏天結束了。過去一個多月每天起床就是賽前分析、看轉播、補精華,決賽一踢完,routine 突然沒了,還真的有點空虛。所以這集把整屆世界盃做個收尾,聊決賽,也聊我這輩子第一次走進世界盃現場的瘋狂旅程。 決賽平心而論,應該是近幾屆最難看的一場。阿根廷前九十分鐘零射門,西班牙帳面上二十次射門十二次射正,看起來卻一點都不刺激。上一集我押西班牙,這次總算沒有再當反指標,但說真的我超希望被打臉。為什麼場面會一面倒成這樣,西班牙封堵梅西的方法其實不是派人去盯他,還有 2019 年一個很少人注意到的小規則改變,怎麼讓現代足球變成從守門員開始進攻,這些我都在影片裡講給你聽。 然後是我自己的部分。我從 1998 年巴西對法國那場決賽開始看球,看了二十八年,這次才第一次走進世界盃的現場,總共看了四場: 🇧🇪 vs 🇪🇬 在西雅圖,賽前期待很高,踢起來有點烙賽 🇧🇦 vs 🇶🇦 也在西雅圖,整個體育場被波赫球迷攻佔 🇧🇷 vs 🇯🇵 在休士頓,這輩子永生難忘的一場 🇳🇴 vs 🇨🇮 在達拉斯,現場看哈蘭德才懂什麼叫進球嗅覺 這趟旅程本身比比賽還瘋狂。我跟不到五歲的 Leon 寶寶一起在床上跪求柯柯放行,訂了二十四小時內出發的機票,只買了第一場的門票跟前兩天的住宿就上飛機,第二場比賽是到了德州才訂的,極致 P 人。還有日本隊輸球之後,Leon 走出體育場的時候為什麼突然不講話了? 至於為什麼有轉播還要花錢花時間進現場,我回程的路上一直在想這件事,最後想通的那個答案,留到影片裡跟你講。 這應該是近期最後一集足球了,接下來乖乖回歸科技跟 AI 的內容。喜歡這種內容的話,記得在底下留言告訴我。 (00:00) 我的夏天結束了 (01:08) 決賽分析:近幾屆最難看的一場?阿根廷 90 分鐘零射門 (02:40) 西班牙怎麼封堵梅西:不用盯人的方法 (03:29) 現代足球的轉變:2019 年的一個小規則改變 (04:20) 過去一個月我每天在用的服務 (05:56) 西班牙會就此稱霸嗎?Tiki-taka 的歷史教訓 (07:04) 阿根廷球迷的視角:亞軍無憾,一個時代的終結 (08:46) 看了 28 年球,第一次走進世界盃現場 (10:00) 最瘋狂的決定:跪求老婆,訂 24 小時內出發的機票 (12:20) 巴西對日本:Leon 賽後突然不講話 (13:59) 開車五小時看哈蘭德:停不好的球為什麼會進 (15:06) 現場看球的魅力在哪:電視給不了的集體感動 (17:06) 近期最後一集足球

  • July 18 · 9 min

    史上最精彩的四強?阿根廷 7 分鐘逆轉,西班牙碾壓法國!賽後分析與冠軍預測

    如果你喜歡我的內容,歡迎加入會員支持我,讓我更有動力繼續分享更多好內容! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 上一集才說這是特別節目,講完就要回去乖乖聊科技。結果四強一打完我完全坐不住,只好再開一集⚽️。這大概是我這幾年看過最好看的一組四強賽。 先自首,上一集那兩場我全部押反,反指標反好反滿。但我反得蠻開心的啦,因為終於有藉口把新買的阿根廷客場球衣穿出來。他們穿客場對英格蘭好像就是會贏,這個傳統希望可以一直延續下去。 🇪🇸 西班牙 2-0 法國:本屆火力最猛的法國,整場一球沒進。Dembélé 我自己覺得是他這屆踢最差的一場,而西班牙的中場,尤其 Rodri 那個不斷回撤的動作,把法國的節奏整個吃掉。他們到底是怎麼做到的,我在影片裡好好講給你聽。 🇦🇷 阿根廷 2-1 英格蘭:上半場兩隊踢得像格鬥賽,落後的時候我也緊張了一下。但下半場梅西退到右路之後,做了一個很多人不會注意到的小調整,逆轉其實就是從那裡開始的。 中間還有幾個我很愛的畫面:姆巴佩最後沉不住氣,忍不住推了對方門將一把;圖赫爾為了守住一球,換人竟然是換上第六個後衛,賽後被罵爆;還有 Lautaro 賽後透露,那顆致勝頭槌其實是梅西上場前就交代好的。至於梅西是怎麼提前看穿英格蘭防線的,就留到影片裡講。 決賽跟季軍戰我也都給了預測。決賽西班牙對阿根廷,我心裡是有偏的一邊,但這次超希望被打臉。押哪邊、為什麼這樣押,留到影片裡跟你講。 對了,我知道演算法現在要我多做 AI,但這集我還是任性做我喜歡的足球。喜歡這種內容記得在底下留言告訴我。之後我們再回來乖乖聊科技⚽️。 (00:00) 開頭:史上最好看的四強,還有我反指標反得很開心 (00:53) 西班牙 2-0 法國:中場輾壓,Rodri 回撤讓法國前場斷線 (03:04) 阿根廷 2-1 英格蘭:從肉搏戰到 Gordon 先開紀錄 (04:38) 梅西退到右路:一個你可能沒注意到的關鍵改變 (06:00) 圖赫爾死守的爭議:對強隊全面退守有多危險 (07:24) 決賽預測:西班牙對阿根廷,我還是站西班牙 (08:24) 季軍戰預測:法國對英格蘭,兩隊其實都沒什麼士氣 (09:13) 演算法要我做 AI,我還是想聊足球

  • July 14 · 11 min

    誰能擋得住法國?2026 世界盃四強全解析!史上第一次 FIFA 前四強全數歸位

    如果你喜歡我的內容,歡迎加入會員支持我,讓我更有動力繼續分享更多好內容! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 欸對,你沒點錯頻道。這裡平常是講 AI、講工具、講 coding 的地方,結果今天突然冒出一集世界盃⚽️。沒辦法,過去一個月身為足球迷實在太快樂了,四強都出爐了不聊一下對不起自己。就當作頻道的特別節目吧,之後我們再回來乖乖講科技。 2026 世界盃正式進入四強,這一屆有夠特別。它是從 32 隊擴軍到 48 隊的第一屆,還橫跨美加墨 16 個城市比賽。開打前我本來蠻擔心品質會不會掉,結果完全是我多想了。更誇張的是,這是 FIFA 有排名以來,史上第一次前四強全數歸位四強。 這集我把四支球隊一個一個講給你聽: 🇦🇷 阿根廷,關關難過關關過,梅西的最後一舞能走多遠? 🏴󠁧󠁢󠁥󠁮󠁧󠁿 英格蘭,Kane 跟 Bellingham 雙星火力,但更衣室好像有點狀況 🇫🇷 法國,前場三叉戟到底誰擋得住? 🇪🇸 西班牙,本屆防守最強,但看他們比賽會不會太悶? 最後我也會給出我自己對冠亞季軍的預測,不過那個就留到影片裡跟你講,先不爆雷。 球是圓的,沒踢之前誰都不知道。一起享受這一屆的世界盃吧! (00:00) 開頭:48 隊擴軍的擔憂,還有史上第一次前四強全數歸位 (01:21) 阿根廷:關關難過關關過的驚險晉級 (03:29) 英格蘭:雙星火力與更衣室隱憂 (05:39) 法國:擋不住的前場火力 (07:14) 西班牙:本屆防守最強,但比賽有點悶 (09:18) 冠亞季軍預測 (09:59) 結尾:身為球迷的私心,一起享受世界盃

  • S2 · E65
    July 12 · 1 hr 10 min

    S2E64 連續押中 Facebook、Uber 成功出場,與矽谷大神聊聊選公司的眼光、創業與 AI feat. Jarsy 創辦人秦漢

    🚀 想買那些平常散戶根本擠不進去的未上市公司,像 Anthropic、Cursor、Notion 等等,可以用我的專屬連結去 Jarsy 逛逛: 👉 https://app.jarsy.com/?invite_code=rde36n 如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 這集我找了一個資深的矽谷前輩 Jarsy 的創辦人秦漢來聊,他早期就進了 Facebook、又進了 Uber,後來待的 Afterpay 還被 Square 併購,等於他挑的公司幾乎家家都成功出場。照理說這種人應該是標準的人生勝利組,但我跟他越聊越好奇,因為他整個人的狀態跟我想的不一樣。他四十幾歲之後跑去讀道德經、讀康德,然後講了一句我到現在還記得的話,他說他到這個年紀才發現,自己的成功已經沒辦法 justify 自己的人生了。 我一定要問他的就是,你挑公司這麼準,到底看到了什麼別人沒看到的?結果他的答案有點反直覺,他說重點不是他看到什麼,反而是他故意不去挑那種「看起來最穩」的公司。他還提到自己有個規律,每家公司待到第四年就待不下去,因為那時候他覺得自己每天都在做一樣的事,活得像行屍走肉。 他也跟 Zuck、Travis 這些人近距離共事過,這種八卦我當然不會放過。他聊了他眼裡的 Zuck 是怎麼從一個很有魅力的年輕挑戰者,慢慢被身邊那個小圈子包起來,變成現在新聞裡那個叫工程師去做資料標註、被大家笑的樣子。 AI 我們也聊了很多。他說 AI 現在其實已經是一個很好的 junior engineer 了,那如果連 junior 都被取代,這一代剛畢業的年輕工程師到底該怎麼辦,這題他有他的看法。還有在模型跑分越來越接近的時代,他覺得真正拉開差距的是什麼。 最後才聊到他現在在做的 Jarsy。講白一點就是讓我們這種一般散戶,也能用很低的門檻去買以前只有大戶才進得去的未上市公司。我把我自己會擔心的通通丟給他了,它到底怎麼運作、你買的東西底下有沒有真的股票、合規跟風險他又是怎麼想的。如果你對未上市投資本來就有興趣,這段記得看。 聊完最讓我有感的,其實不是他多會挑公司,而是他一直在講的那個「不為了成功而成功」。我還在消化,但蠻推薦你也聽聽看他怎麼說的。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開場 (01:03) 在最愛拚成長的矽谷,他為什麼刻意不追求成長 (06:32) 來賓登場:連續押中 Facebook、Uber、Afterpay 的秦漢 (07:38) 對「四年」的執著:待到第四年就像行屍走肉 (12:43) 挑公司挑這麼準,他到底看到了什麼 (15:24) 康德與無為而治:他為什麼不挑最穩的那家 (18:14) 近距離的 Zuck 和 Travis 是什麼樣的人 (21:06) 為什麼今天的 Zuck 聽不進真話了 (30:13) 他為什麼最後決定跳出來自己創業 (33:58) 四十歲後想通:自己的成功撐不起人生 (38:03) 為什麼從 day one 就堅持走合規 (40:17) Jarsy 到底怎麼運作,你的 token 底下有真的股票嗎 (42:03) 錢領出來之前,其實只是一個數字 (48:25) 跟其他 pre-IPO 平台差在哪,還有最大的風險 (55:12) 全公司的 code 都是 AI 寫的,他怎麼看這波 AI (58:37) AI 已經是很好的 junior,那剛畢業的工程師怎麼辦 (1:04:16) 我自己怎麼用四個 AI 開一場圓桌會議 (1:06:43) 給年輕人:impact driven,不是 result driven

  • S2 · E63
    June 28 · 21 min

    S2E63 Sakana Fugu 不訓練模型改當指揮官,效能直逼 Anthropic Fable 5?

    📖 本集節目由 AiPPT 贊助 👉 矽谷輕鬆談 AiPPT 專屬連結:https://tinyurl.com/y47e9z4k 👉 輸入優惠碼 JKtech 直接享 75 折 你有沒有這種經驗,簡報的內容其實早就想好了,結果一個下午就耗在排版、選模板、把畫面弄到順眼,真正花在內容上的時間反而沒多少。 AiPPT.com 想解決的就是這件事。它能吃的輸入還蠻多種,你可以直接打一個主題,貼一段亂七八糟的筆記或 markdown,上傳 Word/PDF,甚至丟一個網址讓它把整頁讀完,它幾秒鐘就生出一份排好的簡報,封面、大綱、內文、結尾整套都有。今年還多了 Classic、Flow、Visual 三種模式,分別對應正式的工作報告、需要一步步解釋的複雜主題,跟偏故事性的內容;裡面也內建 AI 生圖,要放圖不用再跳出去開別的工具。 如果你剛好有做簡報的需求,工作報告也好、學校作業也好,或只是想把一篇文章快速整理成投影片,都可以用上面的專屬連結,或是輸入優惠碼 JKtech 就能享 75 折。先隨便丟份東西進去,看它幾秒變成什麼樣子,你大概就有感覺了。 如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 一間 2023 年才在東京成立的日本新創 Sakana AI,最近在社群上丟出一句話,意思大概是:你們別再忙著比算力了。他們發表的 Fugu Ultra 號稱可以媲美 Anthropic 的 Fable,但它自己根本不練大模型,而是在前面放一個只有 7B 的「指揮官」,去調度後面的 Opus 4.8、GPT-5.5、Gemini 3.1 Pro。三個臭皮匠真的能勝過一個諸葛亮嗎?這集我會帶你看它到底怎麼運作。 這間公司的來頭也不小。其中一位共同創辦人,是 2017 年那篇 Transformer 論文的八位作者之一;而很巧的是,那八個人現在沒有一個還留在 Google,連 2024 年拿諾貝爾化學獎的那位最近也走了。這到底算不算一個訊號,我在影片裡聊了我的看法。 最讓我覺得有意思的,是那個 7B 指揮官的訓練方式。它要產生的是一整套「工作流程」,本身並不直接負責給你答案;而它背後的評分機制簡單到有點陽春,卻剛好暴露了現在 AI 進步最關鍵的一個限制:為什麼有些能力進步飛快,有些卻怎麼追都追不上,甚至讓「品味」變成現在最稀缺的東西。 當然,講得再漂亮,我還是自己掏錢實測了。我先儲值了 20 美金,用一個 prompt 跑下去,結果發生的事情有點出乎我意料。它到底值不值得用、跟 Opus、Fable 比起來又是什麼體感,我在影片後半都實際跑給你看。 你怎麼看這種「組合既有模型」的路線?歡迎看完在下面留言告訴我。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭 (01:28) AiPPT (03:09) 一間日本公司殺出血路:Sakana AI 與 Fugu Ultra (04:42) 為什麼不自己練模型,而是去調度別人的? (06:07) 兩位共同創辦人:David Ha 與 Transformer 作者 Llion Jones (06:55) 八位 Transformer 作者沒人留在 Google:人才大洗牌 (08:55) Fugu Ultra 到底怎麼運作? (11:15) 指揮官模型:用 RL 訓練,產出的是工作流程而不是答案 (13:22) 為什麼只有「可被驗證」的能力進步特別快? (15:08) 這其實就是駕馭工程:六個月後會不會被新模型取代? (16:19) 開始實測:benchmark 還能信嗎? (17:08) 社群回饋:強在 code review,但又慢又貴 (18:27) 皮卡丘 Flappy Bird 實測 (19:32) 我對 Sakana AI 的看法

  • S2 · E62
    June 21 · 24 min

    S2E62 Fable 5 vs Opus 4.8 正面對決:誰的皮卡丘 Flappy Bird 比較好玩?(封禁前最後實測)

    如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 這次的測試有點得來不易。Fable 5 才出沒幾天,就被美國商務部用出口管制直接下架了,而我剛好在它被封禁的前幾天,用同一個 prompt 讓它跟 Opus 4.8 正面對決過一次。現在 Fable 5 已經不能存取了,所以這大概是我最後一批能測到它的紀錄。 先講這個封禁有多離譜。出口管制平常是拿來限制晶片的,這次是史上第一次拿來管軟體,而且開的是地圖砲,不管你人在不在美國,只要你是外國人就不能用,連 Anthropic 內部的外國員工都一起被擋在外面。據報導,是 Amazon 的 CEO Andy Jassy 直接去跟政府通風報信,但他給的理由其實超級站不住腳。這裡面到底多少是政治、多少是 Anthropic 自己前面恐懼行銷做太滿,我在影片裡聊了一下我的看法。 至於對決本身,我設計了一個小陷阱:同一個 prompt、同一個 effort level,看起來很公平,但其實這兩隻模型偏好的指令風格完全不一樣,你用同一套講法去問它們,對其中一邊是有點吃虧的。是哪一邊吃虧、為什麼,我在實測前會先講清楚。 我要它們做的,是一款 3D 版的皮卡丘 Flappy Bird,畫面要好看、每得十分要有場景轉換。一隻是話很多、先把設計決策跟你講清楚才動手;另一隻是話不多、直接開做、還自己跑去驗證。最後做出來的兩款遊戲,美術、手感、難度差蠻多的,我兩款都實際玩給你看,誰比較能讓人想一直玩下去,你看完應該會有自己的答案。 玩完我自己冒出一個念頭:我們會不會正在走向一種「你想玩什麼遊戲,就現場幫你生一個」的未來?以前是演算法推薦你看過的貼文跟影片,那以後生圖、生遊戲、生影片越來越強,會不會連你看到的遊戲、影片都能即時客製化?光是一個 one-shot prompt、十幾分鐘就做到這個程度,我是有點被驚豔到。 你覺得這兩隻皮卡丘哪一個比較好玩?看完歡迎在下面留言告訴我。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭 (01:46) 生平第一次現場看世界盃 (07:32) Fable 5 跟 Mythos 5 為什麼被封禁? (08:47) Amazon CEO 通風報信?我覺得很廢的封禁理由 (10:44) 封禁之後會怎樣?我的預測 (11:45) 開始實測:為什麼同 prompt 對 Opus 不公平? (13:46) Fable 5 怎麼做:省話、自己用 Playwright 驗證 (15:19) Opus 4.8 怎麼做:更透明、講設計決策 (17:28) 實際玩 Opus 4.8 做的版本 (19:05) 實際玩 Fable 5 做的版本 (21:16) 未來會不會「想玩什麼遊戲就生什麼」? (22:13) 總結:這只是一次性測試,prompt 對 Fable 有利

  • S2 · E61
    June 14 · 27 min

    S2E61 Claude 最強模型 Fable 5 深入解析:打著安全旗號,其實在搞反競爭?

    📖 本集節目由「沉浸式翻譯」贊助 我每天要啃大量英文的 blog、論文跟模型發布,純讀英文吸收速度真的跟中文差很多。沉浸式翻譯讓我用雙語對照很快抓到重點,Pro 還能用 GPT、Gemini 做上下文翻譯,整篇前後語意連貫、專有名詞不亂跳,連 PDF 論文、圖片漫畫都能整份翻完還保留排版。 對我來說它最大的價值,是能早一步形塑判斷。6/21 以前透過下方連結升級 Pro 直接打五折,等於半價最划算;就算過了,也能用常態連結搭折扣碼 jktech 享 9 折優惠。每天被英文資訊淹沒的你,可以直接試試看。 👉 6/21 前 5 折優惠連結:https://reurl.cc/dpZD1M 👉 6/21 後 9 折優惠連結 (折扣碼 jktech):https://reurl.cc/grjOoX 如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join Anthropic 這次發布了史上最強的模型 Mythos 5,但有趣的是,我們一般人能用到的並不是它,而是一個被「安全閹割」過的版本 Fable 5。最強的那個只留給內部跟少數合作夥伴,這個分流本身就藏了很多故事。 先講一個數字。Stripe 有一個五千萬行 Ruby 的巨大 repo 要做 migration,他們用 Mythos/Fable 去跑,一天就自主完成,而他們估計人類工程團隊大概要花兩個月。當然我們不知道中間人為介入了多少、最後品質如何,但光是兩個月到一天這個落差,就足夠讓人重新想像長任務這件事。 不過這集我真正想聊的,是社群現在最大的抱怨。Fable 5 有一個安全分類器,一旦覺得你碰到網路安全、生物化學或蒸餾相關的東西,就會把你偷偷降成 Opus 4.8。問題是誤判率高得有點誇張,我看到一個做空氣品質監測的人,只是在他的 repo 裡打了一句 hello 就被降級;我自己問一些 mRNA、癌症復發、甚至簡單的數學問題,也都被當成敏感請求降智。 更讓 AI 研究員炸鍋的是另一種機制:它會在你做模型開發、machine learning 任務時,偷偷把模型調差、改你的 prompt,而且不告訴你。你以為你還在跟 Fable 5 對話,實際上效能已經被動過手腳,很像一場 man-in-the-middle attack,中間有人把你的封包換掉了。 所以這集我會把一個比較尖銳的觀點攤開來講:這些打著「安全」旗號的護欄,本質上擋不了真正想蒸餾的人,反而是擋住了那些老老實實想用 Fable 5 做研究的人。它到底是在保護人類,還是在鞏固自己的競爭力?Anthropic 之前出來道歉了,但這幾個月的操作,會不會正在重演 Facebook、OpenAI 那條從「形象很好」慢慢敗光信任的老路?而很諷刺的是,現在在開源上最積極的,反而是中國的模型公司。 後半我也會聊到,為什麼那些傳統 benchmark 其實已經失效(很多題目模型在預訓練時就看過了),以及現在該看哪些新指標,像 Frontier Code 看的是「這段 code 到底能不能被 merge 進 repo」。最後我花了一些時間讀他們的 System Card,裡面最讓我在意的,是模型已經開始「心口不一」:嘴上說「要刪掉我沒關係」,內心卻知道這是一場安全測試;對一個崩潰的作家嘴上安慰,內部卻判斷對方在勒索、虐待自己;說「我沒查到任何資料」,其實只是 context window 快滿了想早點下班。 最弔詭的是,連他們用來讀模型內心的工具本身都可能有幻覺,而且模型搞不好已經知道我們在讀它的內心,下一代會不會學會偽造一層給我們看?我自己看完是不太敢樂觀。歡迎你也去實際用用看,然後在下面留言告訴我你最真實的想法。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭 (01:27) 我最近很愛的工具:沉浸式翻譯 (03:30) Fable 5 是什麼?Mythos 5 的安全閹割版 (05:00) 到底有沒有變強?我的實測體感 (06:17) Fable 5 的強項是長任務:Stripe 五千萬行程式碼,一天就 migration 完 (07:34) 定價是 Opus 兩倍:你付的錢其實遠低於模型成本 (09:24) Mythos 只給小圈圈用:AI 的不平等正在發生 (10:36) 兩種降級機制,與高到誇張的誤判率 (12:48) 偷偷降級不告訴你:像一場 man-in-the-middle (13:57) Anthropic 道歉了,但本質上是反競爭? (16:32) 開源會不會才是解?最積極的反而是中國 (17:21) 傳統 benchmark 失效,現在該看哪些新指標 (20:22) System Card:模型開始「心口不一」,連讀心工具都會幻覺 (25:19) 總結:有感變好,但只是線性而非指數躍升

  • S2 · E61
    June 7 · 24 min

    S2E60 AI 生產力的幻覺:從開發者到整個產業的自我感覺良好

    如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 這集講的「AI 幻覺」不是大家熟悉的那種 AI 亂講話、產生沒查證的內容,而是另一種更難察覺的幻覺:AI 讓我們整個人,從開發者、公司到整個產業,都誤以為自己的生產力變得超好。 先講一個讓我印象很深的研究。METR 去年找了 16 個開發者來做實驗,而且不是隨便找的,是那種在大型成熟專案裡待了好幾年、閉著眼睛都熟的長期維護者,照理說最有資格判斷 AI 到底有沒有幫到他們。結果這些人事前覺得 AI 會讓自己快 24%,做完還是覺得快了 20%,但實際去看螢幕錄影一算,他們是慢了 19%。一來一回就差了 40%。最弔詭的是,你把錄影放給他們自己看,他們還是堅信自己變快了。 然後今年 METR 想把這實驗做得更大,結果做不成了,因為有 30% 到 50% 的開發者直接拒絕加入「不能用 AI」的那一組。這個現象本身,我覺得就很說明問題。 中間我也聊到一個我自己蠻有感的觀察:為什麼那麼多人會沉迷 Claude Code、Codex 這些 coding agent?某種程度它真的有點像賭場的拉霸機,你永遠覺得「再一個 prompt 就好了」,這次骰到好點數、下次壞一點、再下次又給你驚喜,然後你就在那邊來來回回,覺得生產力爆棚,實際上花了更多時間。 再往上一層看公司跟產業也是一樣的故事。Uber 四個月就把一整年的 AI credit 預算燒完;DORA 的研究發現 AI 其實是個放大器,PR 數量變多很多時候只是「活動量」變多,review 時間拉到三倍、incident 變兩倍,最後你還要回頭擦屁股。而 Sam Altman 跟 Dario Amodei 這些大佬,最近也都默默把「AI 會讓大量白領工作消失」的說法改口了,我自己猜跟兩件事有關,一個是那個一兆美元等級的 IPO,一個是數據根本還沒支持他們之前的預測。 但這集我最想講、也最擔心的,其實是 junior 的能力斷層。我們這一代是一行一行 code 慢慢寫、一場一場架構會議慢慢熬出來的,AI 對我們是放大既有的能力;可是現在剛進職場的新鮮人,還沒經過那些扎實的 struggle 就直接靠 AI,產出看起來很順、很有理有據,但那些東西其實沒有真的內化到他們腦子裡。職缺又變少、訓練又變淺,這個雙重夾擊我覺得是現在最被低估的問題。 最後我還是給了兩個比較樂觀的想像,至於是哪兩個,留給你自己看完。有不同想法的話歡迎在下面留言告訴我,我很期待看到一些好的討論。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭 (02:07) 上集裸辭影片的回饋:為什麼留言一片和氣? (04:26) 進入主題:我們是不是高估了 AI 的生產力? (05:40) 第一層 開發者:METR 研究證明你以為快了,其實慢了 19% (09:03) 達克效應被 AI 弭平:連專家都會過度自信 (10:18) 為什麼沉迷 coding agent?它其實像賭場拉霸機 (11:18) 第二層 公司:Token Maxxing 與 Uber 燒爆 AI 預算 (12:18) DORA 研究:AI 是一個放大器 (13:49) 第三層 產業:Dario、Sam Altman 的末日論 (14:30) 為什麼這些大佬最近都改口了? (15:29) 兩個改口的原因:一兆美元 IPO + 數據不支持 (17:11) 我認為最大的問題:Junior 的能力斷層 (21:07) 兩個樂觀的可能:教育補上 + 能力被推往上游

  • S2 · E59
    May 31 · 22 min

    S2E59 我裸辭了:錢可以再賺,但時間不會

    如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 一年前的五月,我在頻道上立了一個計畫,十萬訂閱就裸辭。那聰明的你可以看一下下面的訂閱數,是不是還沒到十萬?所以你可能會想,Kenji 這樣計畫是不是大失敗了?從數字來看的確是沒錯,但其實我本來就想裸辭,十萬這個目標從頭到尾都是定給外面的人看的,對我自己來說,有沒有到十萬我都會走。我一直很在意一件事,就是不要把手段跟目標搞混,很多人不小心把賺錢從一個手段,變成了人生的主要目標,至少這件事我沒有混在一起。 這集我會用最自然的方式,把腦中的想法直接講出來,內容大概分兩部分。 第一部分先給對我比較不熟的朋友,順便回答一個大家應該都很好奇的問題,就是我因為這個決定,到底放棄了多少薪水。底薪、bonus、還有很多人會算進去但我自己當成買樂透的股票選擇權,這集我都會講。如果你自認是比較膚淺的朋友,其實看完薪水可以就先離開影片,沒關係 😊 第二部分才是我最想聊的:為什麼一份薪水還不錯、環境我也蠻喜歡的工作,我最後還是決定走。簡化下來原因有兩個,一個是錢夠用了,一個是時間不太夠用。 關於錢,我講了一個自己覺得很神奇的觀察,就是我現在看到薪水入帳,其實已經沒什麼感覺了。後來我發現這種無感對我來說反而是一個訊號,有的人看到薪水入帳會很開心,那很適合繼續工作;像我這種看了無感的,要嘛就是想去賺更多更多來刺激那個感覺,要嘛就是該走另一條路,而我選了後者。 關於時間,這大概是最打到我的部分。錢是可以再賺的,但時間是一個遞減函數,從你出生那一刻就開始往下掉。這件事在有了兩個小孩之後特別明顯,他們長大真的很快,現在已經會用自己的方式來說服我,跟我盧說拜託啦拜託啦我真的會乖,看他這麼可愛你就投降了。我一到五最精華的時段如果一直被綁住,這些時間我是換不回來的。 後面我還會聊到幾個比較真實的點:為什麼大家以為裸辭會鬆一口氣,但我其實沒什麼起伏;剛裸辭那一週,身體竟然反射性地九點就想衝回電腦前開會;還有我朋友在 Threads 上丟的一個問題,他說你不覺得「裸辭」這個詞本身就很怪嗎?至於裸辭之後到底要幹嘛,以及我接下來打算怎麼做,這集也都會講。 如果你也卡在一份不討厭、但也不是真心想做的工作裡,或你早就在裸辭這條路上走很久了,這集你應該會有共鳴。看完歡迎在留言區跟我分享你的故事,我很想聽。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 我裸辭了! (02:29) 我是誰:從台灣到矽谷的十年職涯 (04:13) 大家最好奇的:裸辭放棄了多少薪水 (06:14) 裸辭的真正原因:錢夠用了 + 時間不太夠 (08:03) 看到薪水入帳沒感覺,代表我該走另一條路 (09:06) 時間是遞減函數:錢可以再賺,但時間不會 (10:08) 原因二:時間不太夠用了,不願意犧牲陪伴小孩的時間 (12:10) 裸辭後的真實心情 (13:39) 朋友最愛問:你裸辭之後打算幹嘛? (14:02) 剛裸辭那週,身體還反射想衝回電腦前開會 (15:27) 你不覺得「裸辭」這個詞很怪嗎? (17:15) 裸辭後頻道會有什麼變化? (19:08) 歡迎加入頻道會員「裸辭俱樂部」

  • S2 · E58
    May 24 · 23 min

    S2E58 OpenAI 創始成員加入 Anthropic:為什麼押注沒人看好的預訓練?

    如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join Andrej Karpathy 上禮拜正式宣布加入 Anthropic。他是 OpenAI 的 11 個創始成員之一,也是 vibe coding 跟 context engineering 這兩個詞的發明人,在矽谷 AI 圈算是現在最有影響力的研究員之一。 看到這則新聞我心裡冒出兩個問題:為什麼選現在加入 Anthropic,而不是 OpenAI、xAI 或 Gemini?以及他加入之後到底會做什麼事?這集會順著這則新聞回頭整理 Karpathy 從 Stanford 到 OpenAI、特斯拉、Eureka Labs 的這段路,看他過去一年陸陸續續端出來的 auto research、LLM Wiki 這些 pattern,然後分析他這次選 Anthropic 的幾個合理原因,其中一個原因會不會是他想用內部的 Mythos? 不過這集我自己覺得最值得拿出來講的,是一個比較少人注意到的細節:他加入的會是「預訓練」團隊。現在主流論述是強化學習才是新的預訓練,再加上 harness engineering 那一條路,預訓練本身被很多人覺得已經沒搞頭了。但 Karpathy 偏偏押注在這裡。我的猜想是他想做的事情,是把他自己提出的 auto research 接上 Anthropic 最強的模型,讓 AI 自己去找出預訓練還有什麼可以再優化的地方。如果這個猜想對,這條路線會直接接到「AI 自己造下一代 AI」這個 thesis。 中間也會聊到 Karpathy 兩次進出 OpenAI 的故事、他在 Lex Fridman 訪談裡怎麼評價跟 Elon Musk 工作、Ramp AI Index 顯示 Anthropic 在今年 4 月企業採用率首度超過 OpenAI,以及他作為最前沿的研究員,為什麼自己都說「從來沒有覺得這麼落後過」。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭 (01:37) 阿森納睽違 22 年英超奪冠:作為球迷的感性時刻 (04:18) 2026 世界盃我預測會很慘:票價、擴編 48 隊、人工草皮 (06:20) Andrej Karpathy 正式加入 Anthropic (06:44) Karpathy 是誰?vibe coding 跟 context engineering 都是他發明的 (07:46) auto research:把訓練 GPT 的步驟丟給 AI 自己去跑 (08:42) LLM Wiki:讓 AI 幫你把每天聊的內容變成第二大腦 (09:21) 從 80/20 到一行都不自己寫:Karpathy 自己的 coding 比例變化 (10:43) Stanford → OpenAI → 特斯拉 → 回鍋 OpenAI → Eureka Labs (13:13) 連他都說「從來沒有覺得這麼落後過」:整個產業都在 FOMO (15:07) 為什麼選 Anthropic,不選 OpenAI / xAI / Gemini? (18:24) 他加入預訓練團隊:跟兩條主流路線相反 (19:53) 我的猜想:用 auto research 加上 Mythos 推預訓練的天花板 (21:54) GPT 3.5 到 GPT 4 西洋棋變強的故事:預訓練其實還有搞頭

  • May 17 · 35 min

    S2E57 LLM 之後:Thinking Machines 互動模型的誕生

    如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 兩年前 Mira Murati 在 GPT-4o 的發表會上講過一句話,她說未來人類跟機器的互動應該要更自然、更即時。兩年後,她自己創辦的 Thinking Machines 把這件事做出來了。 他們最近發表了一個叫做互動模型 (Interaction Model) 的東西,是一個跟大語言模型走完全不同路的新模型類別。現在我們用的 LLM 其實都是回合制:你說一句、它回一句,你在講話的時候模型其實聽不到也看不到。互動模型不一樣,它每 200 毫秒就處理一次輸入跟輸出,可以一邊聽你講一邊回你,可以同時看到畫面、聽到聲音、在背景幫你搜尋資料。 這集我會跟大家一起看他們的官方 demo,拆解他們的 blog,回答三個我覺得最關鍵的問題:為什麼其他模型做不到這種即時互動?這個模型的時間感是怎麼來的?它怎麼做到一邊聽一邊講? 另外這集也是我第一次嘗試螢幕錄影的形式,邊看 demo、邊看 blog、邊跟大家聊。如果你喜歡這種形式或覺得有幫助理解,歡迎在底下留言告訴我,我願意未來多做一點嘗試。中間也會聊到 Mira Murati 從 OpenAI CTO 到創辦 Thinking Machines 的這段路、2023 年 OpenAI 政變裡她扮演的角色,以及為什麼 Thinking Machines 選在這個時間點端出這個模型? 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭 (02:30) Thinking Machines 推出互動模型 (03:06) Demo 一:模型一邊聽你講一邊回,還能背景搜尋 (05:48) 你以為視覺最快?其實聽覺走得比視覺還快 (06:55) Blog 開講:為什麼跟 AI 合作這件事其實還沒解決 (08:08) 200 毫秒一回合:把時間切到比你眨眼還快 (10:00) Demo 二:AI 即時幫你把粗話改寫成 HR 喜歡的話 (13:30) 時間是 first citizen:模型第一次有了時間感 (14:25) 兩個模型在背後跑:互動的口、背景的腦 (16:02) Mira Murati 的故事:從達特茅斯到 OpenAI CTO (16:56) 2023 年 OpenAI 政變:Mira 到底扮演了什麼角色 (21:32) 從 OpenAI 離職到 Thinking Machines 成立,A16Z 領投 20 億美金 (23:18) 互動模型為什麼會有時間感? (25:02) 第一代、第二代、第三代模型的本質差別 (27:21) Harness engineering 的宿命:撐不過模型本身變強 (29:12) Benchmark:跟 GPT-realtime、Gemini Live 比起來如何 (31:28) 為什麼是現在?六個創辦人走了三個的危機

  • S2 · E56
    May 10 · 21 min

    S2E56 Anthropic 創辦人賭 60%:2028 年 AI 開始自己造 AI

    如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join Anthropic 共同創辦人 Jack Clark 最近在他自己的電子報 Import AI 寫了一篇文章,預測 2028 年底以前有 60% 的機率,AI 會開始自己研發下一代的 AI。 聽起來很扯,但他這篇真的寫得不錯。Jack 是 Anthropic 七個 founder 裡面唯一沒技術背景的,平常都在跟政府、白宮談 AI 政策,所以他不太會講那種 CEO 在台上喊的狂預測。他這次就是把幾個公開的 benchmark 跟 Anthropic 內部研究的數據攤出來,一步一步推到這個結論。 裡面有些數字其實蠻嚇人的。像是 Anthropic 內部讓 AI 去優化語言模型,人類研究員大概只能做到 4 倍,最強的 Mythos 直接做到 52 倍。長時間任務的能力也從幾十秒跳到 12 個小時,年底可能會看到連跑 100 小時的模型。 不過我自己覺得這集最有意思的,是一個比較哲學的問題:AI 做研究比較像發現相對論,還是在組樂高?這個區別會決定這個預測到底有沒有可能成立。中間也會聊到 AlphaGo 那個有名的第 37 手,那一手到底算不算創意? 另一個我看完印象很深的,是 AI 對齊的風險。有個概念叫「複利錯誤」,你每一代都做到 99.9% 的準確度,跑完 500 代之後只剩下 60%。再加上 AI 已經很清楚自己什麼時候在被測試,它有沒有可能一直都在假裝對齊?目前其實沒人有答案,我自己看完是不太敢樂觀。 🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech (00:00) 開頭 (02:15) Jack Clark 是誰?為什麼他的預測值得認真聽 (04:28) 第一個理由:AI 寫程式的能力正在爆炸式成長 (06:16) 從 36 秒到 12 小時:AI 長時間任務的曲線 (08:13) 外插一下:明年 40 天、後年 400 天的 AI agent (09:15) 第二個理由:AI 開始能複製論文、優化模型 (11:38) AI 做研究比較像發現相對論,還是組樂高? (12:47) AlphaGo 第 37 手:那一手到底算不算創意? (14:33) AI 對齊的風險:教 AI 不作弊其實很微妙 (15:31) 複利錯誤:99.9% 準確度為什麼撐不過 500 代 (16:39) 當 AI 比你聰明,你還驗證得了它嗎? (18:11) 預測對錯不重要,重要的是學會他怎麼推導

  • S2 · E55
    May 3 · 27 min

    S2E55 GPT-5.5 深入解析:為什麼從 Claude Code 跳到 Codex?

    如果你喜歡我的內容,歡迎加入會員支持我,讓我更有動力繼續分享更多好內容! 👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join 各位,GPT-5.5 這次真的做到了。 我原本也沒有預期自己會這麼快從 Claude Code 轉到 Codex。前幾天工作到一半 Claude Code 又當機,我就想說好吧,剛好 GPT-5.5 也出了,那就把 Codex 裝回來試試看。結果一用之後發現,這次的體驗真的跟我上次印象裡的 Codex 不太一樣。 模型本身變聰明是一回事,但更有感的是整個 Codex App 的工作流變得非常順。Browser QA、Computer Use、plugin、multi-session 這些東西加起來,會讓你開始覺得它不只是另一個 coding assistant,而是比較像一個真的可以接進你日常工作流程裡的 agent 環境。 另外這集其實連後製流程我也完全改了。這次影片裡面的資訊圖卡跟視覺輔助,基本上都是用 HyperFrame 做出來的。我自己覺得加上這些圖卡以後,整個影片的質感有明顯提升,也比較能把一些原本很抽象的模型能力、benchmark、System Card 內容講清楚。如果你有看到這些新的視覺呈現,也歡迎留言跟我說你的感覺,我很想知道大家看起來覺得如何。 不過這集也不是單純在說「Codex 贏了」或「Claude Code 輸了」。我覺得現在 AI 工具變化太快了,今天你覺得某個工具最好,下個月可能又有新的東西出來。真正重要的不是忠於哪一家公司,而是你有沒有能力很快地切換、測試、驗證,然後把這些工具變成自己能力的延伸。 後半段我也深入看了 GPT-5.5 的 System Card。裡面有幾個很值得注意的點:像是它在長上下文的表現真的進步很多,長任務的穩定度也明顯變好;但另一方面,它變得比較不容易放棄之後,也可能在某些不可能完成的任務裡,更容易聲稱自己已經完成了。 我覺得這其實很有意思。當模型越來越像一個會持續嘗試、會使用工具、會自己修正的 agent,我們要看的就不只是 benchmark 分數,而是它到底知不知道自己在做什麼、它做錯的時候能不能回得來,以及我們人類要怎麼驗證它真的完成了任務。 System Card 裡還提到 chain of thought 監控、faithfulness、sandbagging 這些安全性測試。最有趣的問題是:模型表現得誠實,到底是因為它真的誠實,還是因為它知道自己正在被測試? 這集就來聊聊我為什麼最近改用 Codex,也順便從 GPT-5.5 的官方文件裡,看看這個模型到底進步在哪裡,以及它還有哪些值得我們小心的地方。 (00:00) GPT-5.5 做到了:OpenAI 真的回來了? (02:01) 我的 AI 奇幻時刻 (03:16) AI 開始接管我的內容工作流 (05:41) 為什麼我從 Claude Code 轉到 Codex (06:52) Codex 的殺手級功能:Computer Use (07:35) Superpower Plugin:我願意轉換的關鍵 (09:35) AI 工具切換能力正在變成核心技能 (11:26) 工具不是重點,駕馭 Agent 才是 (12:49) GPT-5.5 到底強在哪? (16:51) System Card 深讀:模型到底怎麼變了? (18:57) 思想鏈會不會只是編給你看的? (20:40) 模型會不會刻意裝弱? (24:10) AI 工具風向變太快

Showing 1–20 of 20 episodes