跳至主要內容
ESC
Study Jam:GenAI 開發者實戰 — 第 2/29 篇

大型語言模型導論

大型語言模型導論

課程概述

大型語言模型(Large Language Model, LLM)可以說是生成式 AI 裡最具代表性的技術。這堂課會帶你走過 LLM 從預訓練到部署的整個流程,認識幾種不同的模型調整方式,也看看 Google Cloud 的 LLM 產品線各自適合什麼開發需求。

大型語言模型完整旅程:海量無標註文字先預訓練成基礎模型,再經指令微調與偏好安全對齊後部署推論;Prompt、Prompt Tuning、參數高效微調到全量微調依序增加資料成本與控制力

LLM 的能力來自預訓練,實用性來自指令微調,安全與偏好則在對齊階段補上。應用調整先從低成本 Prompt 開始,只有需要更強行為控制時才往 PEFT 或全量微調前進;推論參數再決定穩定與創意的取捨。

你將學到

  • 說明 LLM 的訓練流程:預訓練、指令微調與 RLHF
  • 區分 Prompt Tuning、Parameter-Efficient Fine-tuning 與 Full Fine-tuning
  • 理解 LLM 的關鍵參數:Temperature、Top-K、Top-P 對輸出的影響
  • 認識 Google Cloud 的 LLM 產品:Gemini、PaLM 2 及 Model Garden 中的開源模型

核心概念

LLM 的訓練三階段

LLM 的訓練通常分三個階段。第一階段是「預訓練」(Pre-training),讓模型從大量文字資料中學會語言模式。第二階段是「指令微調」(Instruction Tuning),餵它整理過的指令與回應配對,讓它比較能照需求完成任務。最後再用人類或 AI 的偏好資料做對齊,校準模型行為,盡量減少有害或有偏誤的輸出。RLHF(Reinforcement Learning from Human Feedback)就是常見做法之一。

大型語言模型三階段訓練流程:預訓練學語言模式、指令微調學任務遵循、偏好與安全對齊校準行為,並說明應用端方法不等於重新訓練

三個階段的目標不同:預訓練建立通用能力,指令微調讓模型能遵循任務,偏好與安全對齊則校準可接受的行為。Prompt、RAG 與推論參數屬於應用端調整,不應和模型訓練混為一談。

模型調整技術的光譜

從最輕量到最重量的調整方式:

調整方式訓練資料量額外訓練成本適用場景
Prompt Engineering不需訓練一般性任務、快速原型
Prompt Tuning數百至數千筆特定任務的輸出風格調整
LoRA / Adapter Tuning數千至數萬筆領域特化,保留通用能力
Full Fine-tuning數萬筆以上全面轉換模型行為

這裡的「無」只代表不用另外訓練模型,實際呼叫模型做推論仍會有用量與費用。

Prompt、RAG 與微調的選擇流程:依指令清楚度、知識新鮮度與可追溯需求、行為穩定性診斷失敗原因,再選擇對應方法並評估

不要看到回答不好就直接微調。任務描述不清先改 Prompt;缺少最新或私有知識、需要引用時用 RAG;只有在輸入已有足夠資訊、卻仍需穩定改變模型行為時,才評估微調。

生成參數的調控

Temperature 管的是輸出有多隨機:調低(像 0.2)通常比較穩定、保守;調高(像 0.8)則比較有變化。Top-K 限制每次取樣時要考慮幾個候選 token,Top-P(Nucleus Sampling)則設定累積機率門檻。要特別注意,低 Temperature 只能讓答案比較穩定,不會把錯誤資訊自動變成正確答案。

模型不是先想好整段答案再一次吐出來,而是反覆預測下一個 token。取樣參數會改變候選分布,但不會替內容做事實查核。

Google Cloud LLM 產品定位

Gemini 是 Google 目前的旗艦多模態基礎模型,文字、圖片、影片、程式碼都能當輸入。PaLM 2 是前一代的旗艦文字模型,已於 2025-04-09 在 Vertex AI 上退役(text-bison/Codey 等版本同步淘汰),請改用 Gemini。Model Garden 則收了第三方和開源模型(像 Llama、Mistral),可以直接在 Vertex AI 上部署。(另註:Google 已於 2026 年 4-5 月將 Vertex AI 整合改名為 Gemini Enterprise Agent Platform,Model Garden 沿用原名、僅併入新主控台架構,本文沿用課程原名撰寫。)

實作重點

  • 在 Vertex AI Studio 中嘗試調整 Temperature、Top-K 與 Top-P 參數,觀察同一個 prompt 在不同設定下的輸出差異
  • 比較 Gemini Pro 與 Gemini Flash 在相同任務下的回應速度與品質(截至 2026 年中,Google 已迭代到 Gemini 3 系列,Pro/Flash 分層邏輯不變)
  • 了解 Token 的概念:模型的輸入輸出通常以 Token 計算用量;實際數量取決於模型使用的 tokenizer,不要直接拿中文字數估算費用
  • 注意模型的 Context Window(上下文視窗)大小,這決定了單次請求能處理的最大內容量

Lab 導讀

Lab 連結Introduction to Large Language Models — Google Cloud Skills Boost

這個 Lab 一樣是影片教學加測驗的格式。重點先掌握 LLM 的幾個定義特徵(大規模訓練資料、海量參數、Transformer 架構),還有不同微調方式各自適合用在哪。測驗常考 Prompt Tuning 跟 Full Fine-tuning 差在哪,以及 Temperature 會把輸出往哪個方向帶。

延伸學習

Study Jam:GenAI 開發者實戰 — 2/29 完成 查看系列全覽 →

留言討論

徽章解鎖!