
更新日期:2025年5月2日
學習新語言的過程,往往始於抽象的課本知識和練習,這些內容感覺與實際應用情境脫節,可能令學習者感到枯燥。然而,正如學習程式語言一樣,語言學習的最佳方式其實是透過有意義的語境進行實踐。
人工智能(AI)的發展,特別是 Google (谷歌) 的 Gemini 模型,正為語言學習帶來變革的潛力。AI 能夠適應學習者的具體情境,提供更自然、個人化的練習方式,這正是傳統學習工具難以企及的優勢。
為探索 AI 在語言學習的潛能,Google 內部由 Creative Technologist (創意技術專家) Aaron Wade (艾倫・韋德) 及其同事發起了一個名為「Little Language Lessons」的實驗項目,利用 Gemini API (Gemini 應用程式介面) 開發了三款創新的學習工具原型。
目錄
ToggleAaron Wade (艾倫・韋德) 作為一名工程師,對程式語言和人類語言同樣著迷。他觀察到,學習程式語言通常從構建具體事物開始,能立即將理論付諸實踐。
相比之下,學習口語卻常常在真空中進行,透過教科書或練習,感覺與真正需要使用語言的情境 strangely disconnected (奇怪地脫節)。
他認為,語言學習的最佳途徑是融入 meaningful contexts (有意義的語境) 中——無論是我們進行的對話、周遭的物件,還是我們所處的時刻。
傳統學習工具難以做到這一點,但 AI 卻能根據學習者的環境進行調整,使其 uniquely suited (特別適合) 以更自然、更個人化的方式輔助語言練習。
基於以上觀察,Aaron Wade (艾倫・韋德) 與幾位同事利用 Google 最新的生成式模型 Gemini API (Gemini 應用程式介面),著手進行了「Little Language Lessons」實驗。
這個項目包含三個 bite-sized (小型的) 語言學習實驗原型,旨在探索如何利用 AI 提供更生動、更實用的學習體驗。
學習語言時最令人沮喪的情況之一,莫過於在特定情境下需要某個詞語或句子,卻發現自己從未學過。
「Tiny Lesson」正是為解決此痛點而設計。使用者只需描述一個情境,例如 “asking for directions” (問路) 或 “finding a lost passport” (尋找遺失的護照),系統便會利用 Gemini 生成針對該情境的實用詞彙、短語及相關語法提示。
開發團隊透過精心設計的 Prompt recipe (提示配方) 來實現此功能。提示以設定 persona (角色) 的前言開始:
You are a(n) {target language} tutor who is bilingual in {target language} and {source language} and an expert at crafting educational content that is custom-tailored to students’ language usage goals.
(你是一位精通 {目標語言} 和 {來源語言} 的 {目標語言} 導師,並且是為學生語言使用目標量身定制教育內容的專家。)
團隊利用了 Gemini 提供 structured JSON (結構化 JSON) 輸出的能力,定義了所需的結果格式。例如,詞彙部分要求輸出一個包含 “vocabulary” (詞彙) 和 “phrases” (短語) 兩個鍵的 JSON 物件。
“vocabulary” 的值是一個物件陣列,每個物件包含三個鍵:”term” (詞語)、”transliteration” (音譯) 和 “translation” (翻譯)。如果目標語言使用拉丁字母,音譯則為空字串。
整個學習內容(詞彙、短語和語法主題)是透過兩次獨立的 Gemini API 呼叫生成的:一次處理詞彙和短語,另一次處理相關的語法主題。每次提示的結尾都會插入使用者輸入的情境描述:INPUT (usage context): {user input}。
當語言學習者達到一定程度,能進行基本對話後,常會發現自己的表達方式仍顯得… off (不對勁)。Too formal (太正式)。Stiff (生硬)。
「Slang Hang」旨在幫助學習者克服這一障礙。它的理念很簡單:生成一段 native speakers (母語人士) 之間的 realistic conversation (真實對話),讓使用者從中學習。使用者可以逐句觀看對話展開,並在遇到 unfamiliar terms (不熟悉的詞語) 時獲得解釋。
「Slang Hang」的提示前言設定了不同的角色:
You are a screenwriter who is bilingual in {source language} and {target language} and an expert and crafting captivating dialogues. You are also a linguist and highly attuned to the cultural nuances that shape natural speech.
(你是一位精通 {來源語言} 和 {目標語言} 的編劇,擅長撰寫引人入勝的對話。你同時也是一位語言學家,對塑造自然語言的文化細微差別高度敏感。)
儘管使用者一次只能看到一條訊息,但整個場景——包括 setting (設定)、conversation (對話) 和 highlighted terms (重點詞彙) 的解釋——都是透過 single call to the Gemini API (一次 Gemini API 呼叫) 生成的。
輸出的 JSON 結構包含兩個主要鍵:”context” (情境) 和 “dialogue” (對話)。”context” 提供場景描述,而 “dialogue” 則是一個物件陣列,每個物件代表對話中的一輪,包含 “speaker” (說話者)、”gender” (性別)、”message” (訊息) 和 “notes” (註釋) 等鍵。
對話以使用者的 target language (目標語言) 生成,但使用者也可以利用 Cloud Translation API (雲端翻譯應用程式介面) 將訊息翻譯成他們的 native language (母語)。
此實驗一個更有趣的方面是 emergent storytelling (即時生成的故事性)。每個場景都是 unique (獨一無二) 且 on the fly (即時) 生成的——可能是一個街頭小販與顧客聊天,或兩位同事在地鐵上相遇。
然而,開發團隊也坦誠,此實驗 somewhat susceptible to accuracy errors (有時容易出現準確性錯誤):它 occasionally misuses certain expressions and slang, or even makes them up (偶爾會誤用某些表達和俚語,甚至自創)。大型語言模型 (LLMs) 仍非完美,因此 cross-reference with reliable sources (與可靠來源交叉參考) 非常重要。
有時候,我們只是需要知道眼前 things (事物) 的名稱。可能知道 “window” (窗) 怎麼說,但如何表達 “windowsill” (窗台) 或 “blinds” (百葉簾) 呢?
「Word Cam」將手機鏡頭變成了 instant vocabulary helper (即時詞彙助手)。使用者拍下照片後,Gemini 會利用其 vision capabilities (視覺能力) detect objects (偵測物件),用目標語言 label (標示) 它們,並提供額外的描述性詞彙。
這個實驗向模型發送圖像,並要求提供圖像中不同物件的 bounding box coordinates (邊界框座標)。輸出的 JSON 物件包含一個名為 “objects” 的鍵,其值是一個物件陣列。
每個物件包含 “name” (名稱)、”transliteration” (音譯)、”translation” (翻譯) 和 “coordinates” (座標) 四個鍵。座標以 [ymin, xmin, ymax, xmax] 的整數陣列形式提供。
當使用者選擇一個物件後,應用程式會將 cropped image (裁剪後的圖像) 發送到 Gemini 的另一個獨立提示中,要求生成該物件的 descriptors (描述詞)。
輸出的 JSON 物件包含一個名為 “descriptors” 的鍵,其值是一個物件陣列,每個物件包含五個鍵:”descriptor” (描述詞)、”transliteration” (音譯)、”translation” (翻譯)、”exampleSentence” (例句)、”exampleSentenceTransliteration” (例句音譯) 和 “exampleSentenceTranslation” (例句翻譯)。
這三個實驗都整合了 Cloud Text-to-Speech API (雲端文字轉語音應用程式介面),讓使用者能聽到目標語言的發音。
該 API 為 widely spoken languages (廣泛使用的語言) 提供了 natural-sounding voices (聽起來自然的語音),但對 less common ones (較少見的語言) 的選擇有限。此外,regional accents (地區性口音) 未能得到很好的體現,因此有時會出現使用者選擇的方言與播放口音 mismatched (不匹配) 的情況。
正如「Slang Hang」實驗所揭示的準確性問題,目前的 AI 模型仍需完善。學習者在使用時應保持警惕,並交叉參考可靠來源。
「Little Language Lessons」雖然僅是 Google 在 AI 語言學習領域的 early exploration (早期探索),但這些實驗清晰地展示了像 Gemini 這樣的先進 AI 模型,在徹底改變語言學習方式上的 exciting possibilities (令人興奮的可能性)——使其更加個人化、情境化和互動化。
然而,這項工作也引發了重要的疑問:未來可以如何與 linguists (語言學家) 和 educators (教育工作者) 合作,以 refine (完善) 這些實驗方法?更廣泛地說,AI 如何才能真正使 independent learning (獨立學習) 更加 dynamic (動態) 和 personalized (個人化)?
許多人認同,這種跨領域合作對於克服 AI 在理解文化細微差別(如俚語)方面的局限,以及實現真正有效的個人化語言學習至關重要。
同時我們也需認識到,AI 教學已經成為大方向,但是身邊可能仍有許多人(特別是年長者)對學習 AI 感到猶豫;相對地,也有不少人已經開始積極學習各類 AI 工具,以解決生活日常事務。如果你還未開始,就需要多加努力了!
未來,我們期待看到更多結合 AI 技術與教育專業知識的創新應用。但歸根究底,技術本身並非終點,關鍵在於我們如何有效地運用這些工具。超越你的,或許不是 AI,而是那些懂得駕馭 AI 的人。
根據報導,Operator 是一個通用型工具,主要功能包括:
– 在網頁瀏覽器中執行任務
– 編寫程式碼
– 預訂旅遊行程
– 執行多步驟的電腦操作任務
– 透過 API 為開發者提供服務
根據目前披露的信息,Operator 將以兩種方式推出:
– 研究預覽版本供一般用戶使用
– 通過應用程式介面(API)供開發者使用
(註:由於產品尚未正式發布,具體操作方式尚待 OpenAI 在 2024 年 1 月公布)
市場上主要競爭產品包括:
– Anthropic:提供實時處理用戶電腦操作的功能
– Microsoft:專注於職場應用,如發送電子郵件和管理記錄
– Google:正在開發類似工具
(Operator 作為通用型工具,主打網頁瀏覽器的任務執行功能)
