多元文化

为亚洲人真实的书写方式而生。

我们在为一句话里混用多种语言的人打造隐私工具。这里是目前可用的功能、存在的差距,以及我们将如何衡量进展。

不止于翻译

语言只是第一层。

在东盟各国开展业务,意味着语气、正式程度、姓名和格式会因市场而异。我们按三个层次来设计。

语言

文字、词汇和混合语言写作:马来语、中文、泰语、越南语、印度尼西亚语、高棉语、老挝语、缅甸语和英语,常常出现在同一条信息中。

目前:支持 20 种语言的转写与翻译

文化

各国不同的正式程度、敬语、礼貌和情感表达,让回复或分类贴合受众。

定制工作:情感分析、分类、对话式 AI

语境

本地格式:姓名、地址、日期、货币和国民身份证号码,决定了个人数据能否被发现。

计划中:MY、SG、TH、ID、VN 证件号码

为你的企业定制多元文化 AI

Apple 的设备端模型止步之处,就是我们的起点。

我们的设备端应用建立在 Apple 随 iOS 提供的语言工具之上。它们对主要语言支持良好,但不包括下面这些语言,而东盟每天都有数百万人在使用它们。

目前支持的翻译与转写语言

  • 英语
  • 普通话
  • 粤语
  • 日语
  • 韩语
  • 印地语
  • 阿拉伯语
  • 泰语
  • 越南语
  • 印度尼西亚语
  • 西班牙语
  • 法语
  • 德语
  • 意大利语
  • 葡萄牙语
  • 俄语
  • 荷兰语
  • 波兰语
  • 土耳其语
  • 乌克兰语

我们想要补上的缺口

  • 马来语(Bahasa Melayu)
  • 高棉语
  • 老挝语
  • 缅甸语
  • 他加禄语
语码转换

为什么“Manglish”会让大多数隐私工具失灵。

马来西亚、新加坡乃至整个东盟的人,会在同一条信息里把英语与马来语、华语、泰米尔语、泰语或越南语混在一起。一次只针对一种语言训练的检测器,会漏掉出现在句子中间、使用另一种文字或格式出人意料的姓名、证件号码和地址。

宣称能“保护个人数据”的工具必须能处理这种情况,否则只会带来虚假的安全感。因此我们把语码转换文本当作一项独立的测试,并会公布我们失败的地方。

Boss, pls email the contract to siti.aminah@example.com lah, her IC is 900101-14-1234, and she stays at No. 12, Jalan Contoh ya.

虚构细节的示意句。地址、电子邮件和马来西亚格式的身份证号码出现在同一条 Manglish 信息里。目前,AirGap PDF AI 的规则能识别电子邮件,大概也能识别地址,但识别不出身份证号码。

我们计划检测的各地证件格式

国家证件格式难点我们目前的应用
马来西亚NRIC / MyKad12 位数字:YYMMDD-PB-###G出生日期前缀意味着在没有上下文的情况下容易出现误报尚未支持
新加坡NRIC / FIN一个字母 + 7 位数字 + 校验字母(例如 S1234567D)校验字母可用于验证尚未支持
泰国国民身份证13 位数字,带校验位常带空格或连字符书写尚未支持
印度尼西亚NIK16 位数字容易与其他长数字混淆尚未支持
越南CCCD(公民身份证)12 位数字文件中仍会出现旧的 9 位 CMND 证件尚未支持
基准测试

我们将如何衡量,以及为什么目前还没有分数。

我们还没有运行这些测试,所以不公布数字。等我们做完之后,这张表会把我们的结果与云端模型、Apple 自己的工具放在同一组测试集上对比,包括我们落后的地方。

测试语言指标测试数据结果
个人数据检测英语、马来语、普通话、泰语、印度尼西亚语、越南语按实体类型计算精确率和召回率每种语言的已标注文档计划中
语码转换文本Manglish、Singlish、Bahasa Rojak、中英混用、泰英混用精确率和召回率;公布失败案例带虚构个人数据的仿真信息计划中
各地证件格式MY NRIC, SG NRIC/FIN, TH ID, ID NIK, VN CCCD检测率与误报率合成的、格式有效的测试证件号码计划中
转写Apple 语音识别支持的语言词错误率简短的录音样本,包括带口音的语音计划中
政策分析英语、马来语、中文与律师对同一批政策的审阅结果的一致程度真实的公开隐私政策计划中
愿意帮忙吗?如果你有这些语言中可以分享的文本(已去除个人信息),或者你想成为某种语言的试点客户,请联系我们。