我們平時用 ChatGPT、Gemini、Claude,背後大多都是一個字、一個字向前生成。
你問一句,AI 就像一邊思考、一邊打字,逐步把答案接出來。
但 Google 最新公布的 DiffusionGemma,正在嘗試另一條路。
它不是傳統「逐字接龍」式寫文,而是更接近 AI 繪圖的邏輯:
先建立一整段文字區塊,
再反覆檢查、修正、補完,
最後逐步收斂成一個合理答案。
換句話說,傳統 LLM 像是在即場寫作文;
DiffusionGemma 則像先交一份草稿,再不斷改到順。
Google 官方表示,DiffusionGemma 是一個實驗性開放模型,採用 text diffusion 技術,並在指定 GPU 場景下,最高可達 4 倍文字生成速度。
但它真正值得留意的,不只是「快」。
更重要是它可以同時看見一整段文字,而不是只盯住下一個字。
這代表它特別適合一些需要「整體檢查」和「局部修正」的任務。
例如文字修改。
傳統 AI 改文時,很多時是順著句子一路改下去;但 DiffusionGemma 的思路更像編輯,可以同時檢視前文、後文、格式與語氣,再重新修正中間某一段。對 email、文章、字幕、產品描述這類需要快速微調的內容,會有很大想像空間。
再例如程式碼補全。
寫 code 很多時不是單純接下一行,而是要看前後變數、括號、函式結構,甚至中間漏了一段邏輯。DiffusionGemma 這種可以同時看整個區塊的方式,理論上更適合做 code infilling,也就是在一段程式中間補回缺失部分。
數學、圖形、邏輯題亦是另一個重點。
有些問題不是由左至右一步步寫就能解好,例如 Sudoku、數學圖形、複雜表格、Markdown 格式,甚至需要前後互相對應的內容。這類任務最麻煩的地方,是後面答案會影響前面判斷。
DiffusionGemma 的優勢,正正在於它不是只看「下一個字」,而是可以反覆檢查整個文字區塊,發現不一致後再修正。
所以它比較像:
不是一個打字員,
而是一個邊寫邊改、邊看全局的編輯助手。
DiffusionGemma 暫時不是要即時取代 Gemini、ChatGPT 或 Claude。
Google 亦將它定位為 experimental open model,重點是讓研究員與開發者探索另一種文字生成架構。
如果你追求最高品質、最穩定的通用 AI 回答,傳統大型語言模型仍然是主流。
但 DiffusionGemma 的意義在於:
AI 的未來,可能不只是一味把模型做得更大。
而是開始出現不同「思考與生成方式」。
有些任務適合逐字生成,
有些任務適合先出草稿再修正,
有些任務則可能混合兩種方法。
DiffusionGemma 最值得留意的地方,並不是它今天已經完美。
而是它提醒我們:
AI 文字生成的玩法,可能才剛開始分叉。
你覺得未來 AI 寫文,會繼續像現在一個字一個字生成,
還是會變成「先寫草稿,再自我修正」?
內容由 Ai Marketer HK 提供