Dibina untuk cara Asia sebenarnya menulis.
Kami membina alat privasi untuk orang yang mencampur bahasa dalam satu ayat. Inilah yang berfungsi hari ini, di mana jurangnya, dan bagaimana kami akan mengukur kemajuan kami.
Bahasa hanyalah lapisan pertama.
Bekerja merentasi ASEAN bermakna nada, tahap formaliti, nama dan format berubah dari satu pasaran ke pasaran lain. Kami mereka bentuk untuk tiga lapisan.
Bahasa
Tulisan, kosa kata dan penulisan campuran bahasa: Melayu, Cina, Thai, Vietnam, Indonesia, Khmer, Lao, Burma dan Inggeris, selalunya dalam satu mesej.
Hari ini: transkripsi dan terjemahan dalam 20 bahasaBudaya
Formaliti, bahasa hormat, kesantunan dan sentimen yang berbeza mengikut negara, supaya balasan atau pengelasan sesuai dengan khalayak.
Kerja khas: sentimen, pengelasan, AI perbualanKonteks
Format tempatan: nama, alamat, tarikh, mata wang dan nombor kad pengenalan, yang menentukan sama ada data peribadi dikesan atau terlepas.
Dirancang: pengecam MY, SG, TH, ID, VNDi mana model pada peranti Apple berhenti, di situlah kami bermula.
Aplikasi pada peranti kami dibina di atas alat bahasa yang disediakan Apple dalam iOS. Ia merangkumi bahasa utama dengan baik, tetapi tidak bahasa di bawah, yang digunakan berjuta-juta orang di ASEAN setiap hari.
Terjemahan dan transkripsi yang kami sokong hari ini
- Inggeris
- Mandarin
- Kantonis
- Jepun
- Korea
- Hindi
- Arab
- Thai
- Vietnam
- Indonesia
- Sepanyol
- Perancis
- Jerman
- Itali
- Portugis
- Rusia
- Belanda
- Poland
- Turki
- Ukraine
Jurang yang ingin kami tutup
- Melayu (Bahasa Melayu)
- Khmer
- Lao
- Burma
- Tagalog
Mengapa “Manglish” menggagalkan kebanyakan alat privasi.
Orang di Malaysia, Singapura dan seluruh ASEAN mencampur bahasa Inggeris dengan Melayu, Cina, Tamil, Thai atau Vietnam dalam satu mesej. Pengesan yang dilatih satu bahasa pada satu masa terlepas nama, ID dan alamat yang muncul di tengah ayat, dalam tulisan lain, atau dalam format yang tidak dijangka.
Alat yang berjanji untuk “melindungi data peribadi” mesti mengendalikan hal ini, jika tidak ia memberi rasa selamat yang palsu. Jadi kami menganggap teks bercampur kod sebagai ujian tersendiri, dan akan menerbitkan di mana kami gagal.
Boss, pls email the contract to siti.aminah@example.com lah, her IC is 900101-14-1234, and she stays at No. 12, Jalan Contoh ya.
Ayat ilustrasi dengan butiran rekaan. Alamat, e-mel dan nombor IC dalam format Malaysia muncul dalam satu mesej Manglish. Hari ini, peraturan AirGap PDF AI akan menangkap e-mel dan mungkin alamat, tetapi bukan nombor IC.
Format ID serantau yang kami rancang untuk dikesan
| Negara | ID | Format | Mengapa ia sukar | Aplikasi kami hari ini |
|---|---|---|---|---|
| Malaysia | NRIC / MyKad | 12 digit: YYMMDD-PB-###G | awalan tarikh lahir bermakna positif palsu mungkin berlaku tanpa konteks | Belum |
| Singapura | NRIC / FIN | Huruf + 7 digit + huruf semak (cth. S1234567D) | huruf semak membolehkan pengesahan | Belum |
| Thailand | Kad pengenalan negara | 13 digit dengan digit semak | sering ditulis dengan ruang atau sengkang | Belum |
| Indonesia | NIK | 16 digit | mudah dikelirukan dengan nombor panjang lain | Belum |
| Vietnam | CCCD (kad pengenalan warganegara) | 12 digit | kad CMND 9 digit lama masih muncul dalam dokumen | Belum |
Bagaimana kami akan mengukur, dan mengapa belum ada skor.
Kami belum menjalankan ujian ini, jadi kami tidak menerbitkan angka. Apabila kami lakukannya, jadual ini akan menunjukkan keputusan kami di sebelah model awan dan alat Apple sendiri pada set ujian yang sama, termasuk di mana kami kalah.
| Ujian | Bahasa | Metrik | Data ujian | Keputusan |
|---|---|---|---|---|
| Pengesanan data peribadi | Inggeris, Melayu, Mandarin, Thai, Indonesia, Vietnam | Ketepatan dan dapatan semula bagi setiap jenis entiti | Dokumen berlabel dalam setiap bahasa | Dirancang |
| Teks bercampur kod | Manglish, Singlish, Bahasa Rojak, Cina–Inggeris, Thai–Inggeris | Ketepatan dan dapatan semula; kes kegagalan diterbitkan | Mesej bergaya sebenar dengan data peribadi rekaan | Dirancang |
| Format ID serantau | MY NRIC, SG NRIC/FIN, TH ID, ID NIK, VN CCCD | Pengesanan dan kadar positif palsu | ID ujian sintetik dan sah format | Dirancang |
| Transkripsi | Bahasa yang disokong Apple Speech | Kadar ralat perkataan | Sampel rakaman pendek, termasuk pertuturan berloghat | Dirancang |
| Analisis dasar | Inggeris, Melayu, Cina | Persetujuan dengan semakan peguam terhadap dasar yang sama | Dasar privasi awam yang sebenar | Dirancang |