LLM(大型語言模型)是什麼?
// 一句話回答
LLM(Large Language Model,大型語言模型)是 AI 的一種,用海量文字訓練出來、專門理解與生成人類語言。市面上主流的聊天式 AI 背後就是 LLM。它是靠「預測下一個最合理的字」來回答你,不是真的去查一個資料庫——這一點決定了它所有的強項與弱點。
LLM 是什麼(先拆名字)
LLM 全名 Large Language Model:Large 是「大型」、Language 是「語言」、Model 是「模型」。「模型」在 AI 裡的意思,是「一套從大量資料裡學出規律、能拿來做預測或生成的系統」。
合起來,LLM 就是「用超大量文字訓練出來、專門處理語言的 AI」。它讀過的文字量遠超任何人一生能讀的,所以能寫文章、回問題、翻譯、摘要。
它到底怎麼運作?(白話版)
LLM 的核心其實出乎意料地單純:它一直在做一件事——「預測下一個最合理的字」。你給它一段開頭,它就一個字一個字接下去,接出通順、合理的內容。
你可以想成手機打字的「自動選字」,但強大了千萬倍——強到能接出一整篇有條理的文章、能理解你的問題並回答。它處理文字的最小單位叫 token(詞元),也是計費的單位。
「合理」這兩個字是關鍵:它挑的是統計上最像樣的下一個字,不是事實上最正確的下一個字。多數時候這兩者重疊,所以它看起來很聰明;但當它們不重疊時,問題就來了。
訓練 vs 使用:為什麼它不知道昨天的新聞
LLM 的一生分成兩個階段,分清楚這兩者,很多疑惑會迎刃而解:
訓練階段:用海量文字把模型「教出來」,這個過程極度昂貴、要很久,而且只做少數幾次。教完之後,它的知識就定型了。
使用階段:你每次提問,它是用已經定型的能力來回答,不會因為你跟它聊天就學到新東西。所以有個名詞叫「知識截止日」——訓練資料只到某個時間點,之後的事它原本並不知道。
這也是為什麼「它記得我上次說的話嗎」答案通常是「不記得」:那是靠系統把對話歷史重新送給它做到的,不是它真的學會了你。至於「它為什麼能講最新的事」,那多半是因為工具幫它上網查了,而不是它本來就知道。
最重要的觀念:它不是在「查資料」
因為 LLM 是靠「預測」生成,而不是去一個正確答案的資料庫裡「查」,所以它有時會「一本正經地講錯」——講得很流暢、很有自信,內容卻是錯的。這個現象有個名字叫「幻覺(hallucination)」。
這代表:LLM 很適合處理語言,但涉及精確事實、數字、法規時,一定要自己查證,不能照單全收。這是用 AI 最重要的一條安全底線。
特別危險的是「它錯得很像對的」:捏造的法條編號、不存在的論文出處、看起來很合理的統計數字。這些不會有紅字警告,只會安靜地出現在你的簡報裡。
為什麼同一個問題,答案每次都不一樣
這常讓第一次用的人困惑,甚至懷疑它不可靠。原因是:LLM 在挑「下一個字」時,通常不是永遠挑機率最高的那一個,而是帶一點隨機性去挑。這讓它的文字更自然、更有變化,代價就是不保證每次結果一致。
實務上的意義有兩層。寫作、發想這類工作,這種變化是優點——同一個題目可以多跑幾次挑最好的。但需要穩定一致的工作(例如把資料轉成固定格式、做分類),你就得靠更明確的指令、給範例、規定輸出格式來把它框住,而不是期待它自己每次都一樣。
LLM 做不到的四件事
知道邊界,比知道它多強更重要。以下這些不是「調教一下就好」,而是本質上的限制(除非外接工具補足):
- 它不會可靠地算數:語言模型不是計算機。金額、比例、加總這類事,要嘛給它計算工具,要嘛自己驗算
- 它不知道訓練之後發生的事:除非有連網查詢的工具幫它,否則最新的法規、價格、新聞它並不知道
- 它不會真的記得你:跨對話的記憶是外部機制做的,不是它本身具備的能力
- 它不知道自己不知道:它不會可靠地說「我不確定」,反而傾向補一個聽起來合理的答案。這正是幻覺的來源
常見的 LLM 有哪些
你聽過的主流 AI 助理,背後幾乎都是 LLM:Claude(Anthropic 公司)、ChatGPT(OpenAI 公司)、Gemini(Google)等。它們能力各有差異,但基本原理是同一類。
版本更新非常快,各家的強弱項也在變動,所以任何「某某最強」的說法都有時效性。真正可靠的做法是拿你自己的實際工作場景去實測,而不是看排行榜。
對企業的實際意義
LLM 最擅長「語言類」的工作:寫文案、改稿、把長文濃縮成摘要、分類整理、對話客服、翻譯。這些能立刻替團隊省時間。
但要它做「需要精準」的事(算數字、引用法條、查最新資料),就要搭配查證或外接工具(例如讓它連上你的資料、或用計算工具)。分清楚「它強在哪、弱在哪」,才用得又快又安全。
一鍵複製:判斷一件工作適不適合交給 AI
與其憑感覺,不如讓它自己先評估一次。這段提示詞會逼它把風險講出來,而不是一味說「可以」。
我想評估一件工作適不適合交給 AI 處理。請你客觀分析,包含「不適合」的可能性——不要為了迎合我而說可以。 【這件工作是】:(用白話描述,例如「每天把客服信件分類並標出急件」) 【目前怎麼做】:(誰做、花多久、多常發生) 【做錯的後果】:(例如「只是要重做」或「會影響客戶權益/有法律風險」) 請依序回答: 一、這件工作屬於「語言處理」還是「需要精確事實/計算」?分別佔多少比重 二、直接交給 AI 的話,最可能在哪裡出錯?請具體舉出兩到三個失敗情境 三、以「做錯的後果」來看,需要什麼程度的人工把關?請給明確做法(全部人工複核/抽查幾成/只在特定條件下複核) 四、有沒有辦法把這件工作拆開,讓 AI 只做最安全的那一段? 五、如果要開始試,第一步該做什麼最小的實驗?怎麼判斷成功 最後給我一句結論:現在就適合、需要調整後才適合、還是根本不建議交給 AI。
三個常見的誤會
- 「它答錯是因為我問得不好」:有時是,但不全是。就算問得很好,涉及它不知道的事實時它仍可能編。提問技巧能減少錯誤,不能消除幻覺
- 「我糾正它,它就學會了」:在這次對話裡它會照做,但不會影響下一次的新對話,也不會影響其他使用者。真正要讓它長期照規矩做,得把規則寫進每次都會帶上的指令或文件裡
- 「它說得很肯定,應該就是對的」:語氣的肯定程度和內容的正確程度,在 LLM 身上幾乎沒有關聯。這是最需要建立的一個直覺
常見問題
LLM 跟 AI 是一樣的東西嗎?
不完全一樣。AI(人工智慧)是很大的範疇,LLM 只是其中一種——專門處理語言的那種。你現在用的聊天型 AI,背後多半是 LLM。
為什麼 LLM 有時會講錯(幻覺)?
因為它是靠「預測下一個合理的字」來生成,而不是去查一個正確答案的資料庫。所以它可能生成通順但不正確的內容,涉及事實時務必查證。驗證方法可看「AI 會亂編(幻覺),怎麼驗證與防範?」那篇。
LLM 的中文能力好嗎?
主流 LLM 的中文能力已相當好,能流暢寫作與對話。但不同模型有差異,且中文通常比英文更耗 token(處理單位),成本與細節表現可實測比較。
企業該選哪個 LLM?
沒有絕對答案,取決於任務類型、語言、資料安全需求與預算。各家版本更新很快,建議拿自己真實的工作場景,用一兩個候選實測比較,再決定;並且每隔一段時間重新評估。
同一個問題問兩次,答案不一樣,是它壞了嗎?
不是,這是正常設計。LLM 生成時帶有隨機性,讓文字更自然。需要一致結果時,請用更明確的指令、提供範例、規定輸出格式來收斂,而不是期待它自動穩定。
把公司資料貼給 LLM,它會記住並告訴別人嗎?
模型本身不會因為你貼一次就學起來。真正的風險在於服務方的資料政策——你的內容是否被保存、是否被用於改善模型。企業方案通常有明確不訓練的聲明。請直接看你使用的服務條款,別靠推測。