資料處理方式
採購審查一定會問這幾件事,先寫在這裡。
送出去的不是原文
稿件在送到語言模型之前,姓名、身分證號、電話、地址會先換成代稱 —— 「陳美玲」變成「A君」、身分證號變成「【身分證A】」。模型看到的是代稱,產出後系統再還原成真名。
這不是靠承辦記得先按遮罩鈕。呼叫模型的介面在型別上就只接受「已遮罩」的文字, 傳入未遮罩的字串會直接失敗,沒有繞過去的路徑。
去識別化失敗的時候,不送出
遮罩服務不可用時,系統改用本機規則引擎組稿 —— 完全在機關的機器上完成,一個字都不外傳。 產出會標記為降級,讓承辦知道這份的品質與平常不同。
語料批次匯入遇到同樣狀況會整批標記失敗並通知管理者,不會退回用正則表示式充數。 正則抓不到「陳美玲女士」這種沒有格式特徵的姓名,用它充數等於讓未遮罩的真名進入知識庫。
遮罩對照表放哪裡、留多久
代稱與真名的對照表存在該機關自己的資料庫,不集中在共用服務上,並於 24 小時內由系統排程刪除。 去識別化服務本身不保存任何對照表 —— 它處理完就把對照交還呼叫端,自己不留。
機關之間的隔離
每個機關有自己的資料庫檔案與檔案目錄,不是同一張表用欄位區隔。 跨機關存取在檔案路徑層被擋下,不依賴應用層記得加條件。 服務方的營運後台只看得到租戶名冊與用量統計,看不到任何公文內容。
稽核軌跡
登入、產生、檢核、簽核、匯出、語料上架都會留下軌跡,記在該機關自己的資料庫裡。 需要時可以整包匯出,包含資料字典。
還有什麼要問的
採購或資安審查需要更細的說明文件,來信告訴我們, 會依貴機關的檢核表逐項回覆。