为亚洲人真实的书写方式而生。
我们在为一句话里混用多种语言的人打造隐私工具。这里是目前可用的功能、存在的差距,以及我们将如何衡量进展。
语言只是第一层。
在东盟各国开展业务,意味着语气、正式程度、姓名和格式会因市场而异。我们按三个层次来设计。
语言
文字、词汇和混合语言写作:马来语、中文、泰语、越南语、印度尼西亚语、高棉语、老挝语、缅甸语和英语,常常出现在同一条信息中。
目前:支持 20 种语言的转写与翻译文化
各国不同的正式程度、敬语、礼貌和情感表达,让回复或分类贴合受众。
定制工作:情感分析、分类、对话式 AI语境
本地格式:姓名、地址、日期、货币和国民身份证号码,决定了个人数据能否被发现。
计划中:MY、SG、TH、ID、VN 证件号码Apple 的设备端模型止步之处,就是我们的起点。
我们的设备端应用建立在 Apple 随 iOS 提供的语言工具之上。它们对主要语言支持良好,但不包括下面这些语言,而东盟每天都有数百万人在使用它们。
目前支持的翻译与转写语言
- 英语
- 普通话
- 粤语
- 日语
- 韩语
- 印地语
- 阿拉伯语
- 泰语
- 越南语
- 印度尼西亚语
- 西班牙语
- 法语
- 德语
- 意大利语
- 葡萄牙语
- 俄语
- 荷兰语
- 波兰语
- 土耳其语
- 乌克兰语
我们想要补上的缺口
- 马来语(Bahasa Melayu)
- 高棉语
- 老挝语
- 缅甸语
- 他加禄语
为什么“Manglish”会让大多数隐私工具失灵。
马来西亚、新加坡乃至整个东盟的人,会在同一条信息里把英语与马来语、华语、泰米尔语、泰语或越南语混在一起。一次只针对一种语言训练的检测器,会漏掉出现在句子中间、使用另一种文字或格式出人意料的姓名、证件号码和地址。
宣称能“保护个人数据”的工具必须能处理这种情况,否则只会带来虚假的安全感。因此我们把语码转换文本当作一项独立的测试,并会公布我们失败的地方。
Boss, pls email the contract to siti.aminah@example.com lah, her IC is 900101-14-1234, and she stays at No. 12, Jalan Contoh ya.
虚构细节的示意句。地址、电子邮件和马来西亚格式的身份证号码出现在同一条 Manglish 信息里。目前,AirGap PDF AI 的规则能识别电子邮件,大概也能识别地址,但识别不出身份证号码。
我们计划检测的各地证件格式
| 国家 | 证件 | 格式 | 难点 | 我们目前的应用 |
|---|---|---|---|---|
| 马来西亚 | NRIC / MyKad | 12 位数字:YYMMDD-PB-###G | 出生日期前缀意味着在没有上下文的情况下容易出现误报 | 尚未支持 |
| 新加坡 | NRIC / FIN | 一个字母 + 7 位数字 + 校验字母(例如 S1234567D) | 校验字母可用于验证 | 尚未支持 |
| 泰国 | 国民身份证 | 13 位数字,带校验位 | 常带空格或连字符书写 | 尚未支持 |
| 印度尼西亚 | NIK | 16 位数字 | 容易与其他长数字混淆 | 尚未支持 |
| 越南 | CCCD(公民身份证) | 12 位数字 | 文件中仍会出现旧的 9 位 CMND 证件 | 尚未支持 |
我们将如何衡量,以及为什么目前还没有分数。
我们还没有运行这些测试,所以不公布数字。等我们做完之后,这张表会把我们的结果与云端模型、Apple 自己的工具放在同一组测试集上对比,包括我们落后的地方。
| 测试 | 语言 | 指标 | 测试数据 | 结果 |
|---|---|---|---|---|
| 个人数据检测 | 英语、马来语、普通话、泰语、印度尼西亚语、越南语 | 按实体类型计算精确率和召回率 | 每种语言的已标注文档 | 计划中 |
| 语码转换文本 | Manglish、Singlish、Bahasa Rojak、中英混用、泰英混用 | 精确率和召回率;公布失败案例 | 带虚构个人数据的仿真信息 | 计划中 |
| 各地证件格式 | MY NRIC, SG NRIC/FIN, TH ID, ID NIK, VN CCCD | 检测率与误报率 | 合成的、格式有效的测试证件号码 | 计划中 |
| 转写 | Apple 语音识别支持的语言 | 词错误率 | 简短的录音样本,包括带口音的语音 | 计划中 |
| 政策分析 | 英语、马来语、中文 | 与律师对同一批政策的审阅结果的一致程度 | 真实的公开隐私政策 | 计划中 |