為亞洲人真實的書寫方式而生。
我們在為一句話裡混用多種語言的人打造隱私工具。這裡是目前可用的功能、存在的差距,以及我們將如何衡量進展。
語言只是第一層。
在東盟各國開展業務,意味著語氣、正式程度、姓名和格式會因市場而異。我們按三個層次來設計。
語言
文字、詞彙和混合語言寫作:馬來語、中文、泰語、越南語、印度尼西亞語、高棉語、寮國語、緬甸語和英語,常常出現在同一條資訊中。
目前:支援 20 種語言的轉寫與翻譯文化
各國不同的正式程度、敬語、禮貌和情感表達,讓回覆或分類貼合受眾。
定製工作:情感分析、分類、對話式 AI語境
本地格式:姓名、地址、日期、貨幣和國民身份證號碼,決定了個人資料能否被發現。
計劃中:MY、SG、TH、ID、VN 證件號碼Apple 的裝置端模型止步之處,就是我們的起點。
我們的裝置端應用建立在 Apple 隨 iOS 提供的語言工具之上。它們對主要語言支援良好,但不包括下面這些語言,而東盟每天都有數百萬人在使用它們。
目前支援的翻譯與轉寫語言
- 英語
- 普通話
- 粵語
- 日語
- 韓語
- 印地語
- 阿拉伯語
- 泰語
- 越南語
- 印度尼西亞語
- 西班牙語
- 法語
- 德語
- 義大利語
- 葡萄牙語
- 俄語
- 荷蘭語
- 波蘭語
- 土耳其語
- 烏克蘭語
我們想要補上的缺口
- 馬來語(Bahasa Melayu)
- 高棉語
- 寮國語
- 緬甸語
- 他加祿語
為什麼“Manglish”會讓大多數隱私工具失靈。
馬來西亞、新加坡乃至整個東盟的人,會在同一條資訊裡把英語與馬來語、華語、泰米爾語、泰語或越南語混在一起。一次只針對一種語言訓練的檢測器,會漏掉出現在句子中間、使用另一種文字或格式出人意料的姓名、證件號碼和地址。
宣稱能“保護個人資料”的工具必須能處理這種情況,否則只會帶來虛假的安全感。因此我們把語碼轉換文字當作一項獨立的測試,並會公佈我們失敗的地方。
Boss, pls email the contract to siti.aminah@example.com lah, her IC is 900101-14-1234, and she stays at No. 12, Jalan Contoh ya.
虛構細節的示意句。地址、電子郵件和馬來西亞格式的身份證號碼出現在同一條 Manglish 資訊裡。目前,AirGap PDF AI 的規則能識別電子郵件,大概也能識別地址,但識別不出身份證號碼。
我們計劃檢測的各地證件格式
| 國家 | 證件 | 格式 | 難點 | 我們目前的應用 |
|---|---|---|---|---|
| 馬來西亞 | NRIC / MyKad | 12 位數字:YYMMDD-PB-###G | 出生日期字首意味著在沒有上下文的情況下容易出現誤報 | 尚未支援 |
| 新加坡 | NRIC / FIN | 一個字母 + 7 位數字 + 校驗字母(例如 S1234567D) | 校驗字母可用於驗證 | 尚未支援 |
| 泰國 | 國民身份證 | 13 位數字,帶校驗位 | 常帶空格或連字元書寫 | 尚未支援 |
| 印度尼西亞 | NIK | 16 位數字 | 容易與其他長數字混淆 | 尚未支援 |
| 越南 | CCCD(公民身份證) | 12 位數字 | 檔案中仍會出現舊的 9 位 CMND 證件 | 尚未支援 |
我們將如何衡量,以及為什麼目前還沒有分數。
我們還沒有執行這些測試,所以不公佈數字。等我們做完之後,這張表會把我們的結果與雲端模型、Apple 自己的工具放在同一組測試集上對比,包括我們落後的地方。
| 測試 | 語言 | 指標 | 測試資料 | 結果 |
|---|---|---|---|---|
| 個人資料檢測 | 英語、馬來語、普通話、泰語、印度尼西亞語、越南語 | 按實體型別計算精確率和召回率 | 每種語言的已標註文件 | 計劃中 |
| 語碼轉換文字 | Manglish、Singlish、Bahasa Rojak、中英混用、泰英混用 | 精確率和召回率;公佈失敗案例 | 帶虛構個人資料的模擬資訊 | 計劃中 |
| 各地證件格式 | MY NRIC, SG NRIC/FIN, TH ID, ID NIK, VN CCCD | 檢測率與誤報率 | 合成的、格式有效的測試證件號碼 | 計劃中 |
| 轉寫 | Apple 語音識別支援的語言 | 詞錯誤率 | 簡短的錄音樣本,包括帶口音的語音 | 計劃中 |
| 政策分析 | 英語、馬來語、中文 | 與律師對同一批政策的審閱結果的一致程度 | 真實的公開隱私政策 | 計劃中 |