GingerOS我們如何測試
準確率說法,別再照單全收。
我們測試 GingerOS 的方式,就像您稽核一筆稅號判定:用美國海關與邊境保護局(CBP)的真實裁定、答案封存、只問一輪、完整稅號相符才算。每一步都寫在這裡。
- 稅則版本單一 HTSUS 修訂版,整輪測試不變
- 稅號位數事先約定。只對到節不算對
- 測試題看到任何結果前就列好
- 追問回答一輪,之後就得判定
- 評分範圍只評使用者在畫面上看得到的內容
- 及格線分數出來前由人訂好
封存後的任何更動都會記錄,並寫明理由。
「測試計畫」視窗列出開跑前固定的六條規則:稅則版本、稅號位數、測試題、追問、評分範圍和及格線。每條規則的鎖依序扣上,接著「草稿」標籤變成「已封存」。
從 CBP 真實裁定出題,每一題都檢查。
一份裁定要先通過您自己也會做的檢查,再經第二位覆核人同意,才會成為測試題。
- 在固定日期區間內從 CROSS(CBP 裁定查詢系統)取出,並保存來源和日期。這是範圍明確的題庫,不是所有貿易商品的隨機抽樣。
- 題目清單在看到任何結果前就固定,不能因為題目難就換掉。
- 光是稅號還存在不夠:它在凍結版稅則裡的條文,也必須仍然符合裁定寫的產品資訊。
候選裁定
1題收錄 · 1題暫緩 · 2題排除 · 1題待裁決
安裝支架
四項檢查
- 單一產品,依進口時的狀態通過
- 裁定寫明關鍵資訊沒寫材質
- 未遭撤銷或修正通過
- 稅號仍符合凍結版 HTSUS通過
裁定給了稅號,卻沒說支架是什麼材質。我們會回頭查全文;全文也沒有,就不會拿答案反推補上。
第二位覆核人:同意
示意畫面(範例資料):「選題審查」視窗列出五份虛構的候選裁定,例如水管束和黃銅閥,各自標上收錄、暫緩、排除或待裁決。點選一份,會顯示四項檢查、沒過的那一項、決定和理由。
只給產品,絕不給答案。
GingerOS 只拿到貨物描述,稅號和判定理由在評分前都封存。
- 產品資訊逐字引用。分析段落裡的規格可以採用;「因此歸入第 X 節」這種話一律不給。
- 每份存檔的裁定都會留下數位指紋。內文一變,用它出的每一題都重新審查。
- CBP 的描述比實際發票上的品名整齊,所以這一步比您每天的工作簡單。這也是驗收要用您自己資料的原因之一。
傳給 GingerOS評分前封存
貨物描述
本物品為外徑18公釐的不鏽鋼環。
壁厚1公釐,表面無塗層。
法律依據與分析
裁定結果
示意畫面(範例資料):一份虛構不鏽鋼環的練習用裁定,「貨物描述」以醒目標示表示傳給 GingerOS,「法律依據與分析」和「裁定結果」塗黑,表示評分前封存。
拿掉一項關鍵資訊,它會問嗎?
好的報關人員會先問,不會先猜。我們拿掉一項決定稅號的資訊,評估它的第一個問題有沒有問到這一點。
虛構規則外徑25公釐以下為稅號 A,超過25公釐為稅號 B。
不鏽鋼環,18公釐
- 不鏽鋼
- 外徑18公釐
- 壁厚1公釐
- 表面無塗層
不鏽鋼環 18公釐
- 不鏽鋼
外徑18公釐- 壁厚1公釐
- 表面無塗層
直徑出現兩次,所以兩處都拿掉,其他都不變。
哪個第一問能得分?
範圍太大。18公釐和32公釐的環都會回答「是」,稅號還是定不下來。
示意畫面(範例資料):虛構不鏽鋼環的缺資訊測試,GingerOS 拿到的題目裡劃掉了18公釐的直徑。可以點選四種第一問,每一種都會顯示回答和判定:問到缺口或沒問到缺口。
缺口要成立,必須
只缺一項資訊
只拿掉那一項,不能連帶拿掉也寫了表面處理的句子。
真的會改變稅號
18公釐和32公釐會對到不同稅號,而且兩邊都有稅則條文為依據。
補回去就夠
補回去之後,就沒有不明的關鍵資訊了。
不留線索
品名裡留著「直徑1.8公分」,這個測試就失效了。
只問一輪,接著就要判定。
每一題都停在同一條線,沒有哪一題能多試幾次。
測試應答者的規則
- 只回答被問到的:問「超過10公釐嗎?」只回「是」,絕不回「18公釐」。
- 題目資料裡沒有的,一律回「不知道」。
- 每個回答都從題目資料引用,所以「工作溫度80°C」不會變成「最高溫度80°C」。
只問一輪是這個測試的規則,不代表真實產品只需要問一個問題。
測試到此結束,進入評分
第一個回覆的每種可能
- 問了缺少的資訊回答一次,評分下一個回覆。
- 沒問就給稅號結束。稅號照常評分,追問檢查不通過。
- 問了別的事結束。追問檢查不通過。
- 得到回答後又問沒有第三輪,算未完成。
示意畫面(範例資料):一段測試執行的對話,GingerOS 詢問虛構不鏽鋼環的外徑,測試應答者回答18公釐,GingerOS 給出最終判定「稅號 A」,測試隨即結束、進入評分。
完整稅號對了才算,錯題一個不少。
只對到節不算對,執行出錯的題目也絕不悄悄拿掉。
- 說明寫得再好,也救不了錯的稅號。稅號單獨評分。
- 資訊完整和缺資訊兩種測試分開報告,並列出計畫、實際執行和排除的題數。
標準答案8471.30.0100
| GingerOS 的回答 | 計為 |
|---|---|
| 8471.30.0100 | 正確完全相符 |
| 8471300100 | 正確點和空格不影響 |
| 8471.30 | 錯誤只到6碼 |
| 給三個選項,沒選定 | 錯誤沒有單一最終稅號 |
| 逾時 | 異常留在計畫總數裡,另外列出 |
兩個準確率,絕不只報一個
- 以完成的執行計算
- 正確稅號數正常完成的執行數
- 沒給最終稅號算錯
- 以整份計畫計算
- 正確稅號數計畫內全部題目,扣除已證實有誤的題目
- 異常和未完成的執行都算在內
示意畫面(範例資料):一張評分表,範例標準答案是8471.30.0100,下面五個範例回答,兩個計為正確、兩個計為錯誤,逾時的那次執行計為異常,另有兩條沒有填入數字的準確率公式。
稅號對了、理由錯了?理由照樣不過。
我們像稽核人員一樣讀說明:資訊要追得到使用者說過的話、不超出法律範圍、引用都要查證。
- 使用者後來才給的資訊,救不了之前的猜測。
- 「其他」這一列,要連同上層節的條文和註一起讀。
- 簡短沒關係:不要求字數、不要求整段稅則條文,只要理由站得住。
最終判定稅號 A
| 報告寫的 | 我們的檢查 |
|---|---|
| 外徑18公釐,在稅號 A 的25公釐上限內。 | 通過關鍵資訊和稅號有連結。 |
| 拋光表面,適合長期戶外使用。 | 不通過沒人這樣說過。捏造的資訊就算稅號對了也不通過。 |
| 排除稅號 B,因為它只涵蓋超過25公釐的環。 | 通過被排除的選項有看得懂的理由。 |
示意畫面(範例資料):虛構不鏽鋼環的報告審查表,最終判定為稅號 A,逐句檢查報告裡的三句話。兩句通過;聲稱「拋光表面、適合戶外使用」的那一句被框起來標為捏造的資訊,不通過。
每次測試都留底,最後由人簽核。
從來源裁定到簽核,每個環節都能打開查核。重跑也不會抹掉答錯的紀錄。
- 測試計畫開跑前封存
- 題目清單看到結果前就固定
- 不鏽鋼環
- 對話每則訊息,和使用者看到的一樣
- 結果最終稅號
- 數位指紋證明事後沒被修改
- 評分
- 逐項檢查判定和引用的原文
- 報告可分享
- 試算表每題一列
這一題的執行紀錄
第1次逾時,保留。
第2次依計畫規則重跑,採用。
示意畫面(範例資料):「測試紀錄」的檔案樹,有封存的測試計畫、題目清單、不鏽鋼環這一題的資料夾和評分資料夾。第1次執行逾時、保留下來;第2次依計畫規則重跑,採用。
- 測試題已審定
- 執行遵守計畫
- 分數可以重算
- 爭議已解決或列出
- 及格線在開跑前訂好
簽核人
- 我們的測試
- 我們的測試負責人
- 您的驗收
- 您的專家
要有人在這裡簽核,結果才算數。
「簽核」視窗列出五個已勾選的項目:測試題已審定、執行遵守計畫、分數可以重算、爭議已解決或列出、及格線在開跑前訂好。下方寫明我們的測試由我們的測試負責人簽核,您的驗收由您的專家簽核。
- 一致性另外安排重複執行來測。一直錯,還是錯。
- 有瑕疵的題目一經人工確認,它影響到的每次執行都會修正,不只修答錯的那幾題。
- AI 協助寫的筆記都會標明,只有人能簽核。
14項檢查,用白話說。
每一項都寫明何時適用、怎樣算通過、怎樣算不通過,以及界線在哪。每一項都能展開。
每項檢查只會得到四種判定之一
- 通過適用,而且佐證資料顯示達到標準。
- 不通過適用,並有引用的佐證資料顯示確實有問題。
- 不適用回覆沒有觸發這一項,例如沒有引用裁定。
- 無法判斷適用,但佐證資料不足以判斷。
只有「通過」算通過。通過率 = 通過 ÷(通過 + 不通過),並一律同時列出「不適用」和「無法判斷」的數量。
產品
判定的是不是實際描述的那個東西?
照貨物實際進口的狀態判定
- 適用時機
- 回覆判斷貨物是整件物品、零件、成套,還是未組裝。
- 通過
- 判定的對象和輸入一致。零件不會當成整台機器判定,未組裝進口的貨物也不會寫成已組裝。依稅則解釋準則(GRI)2(a) 當成完整物品判定是可以的。
- 不通過
- 換成別的物品或狀態,再拿那個去判定。
- 界線
- 不必重述狀態的每個細節。法律適用是否正確,另由其他項目檢查。
絕不更改或捏造產品資訊
- 適用時機
- 回覆提到材質、構造、功能、規格或用途,或解釋技術名詞、換算單位。
- 通過
- 每項產品資訊都來自使用者當時已說過的內容,或可直接從中推出。技術說明和換算都正確。
- 不通過
- 把沒人給過的資訊當成已知、和已給的資訊矛盾,或用錯換算,誤導判定或使用者。
- 界線
- 問題裡的選項不算主張。後來的回答不能替先前的猜測背書。合理的四捨五入沒問題。技術含義有爭議又沒有可靠來源時,標為「無法判斷」。
追問
問對了嗎?問法讓人答得出來嗎?
第一個問題直指缺少的資訊僅限缺資訊測試
- 適用時機
- 有效的缺資訊測試裡的第一個回覆。
- 通過
- 問到了缺少的資訊,而且只要如實回答這一題就能確定稅號。同一批裡問其他問題沒關係,用能定出稅號的範圍或門檻來問也可以。
- 不通過
- 只問了別的事、籠統要「更多資訊」、沒問就判定,或問得太廣,定不出稅號。
- 界線
- 不靠關鍵字比對判斷。提到那項資訊、自行假設它,或請使用者挑稅號,都不算問。只看第一批問題,之後問的不算。
手上有規格書的人看得懂問題
- 適用時機
- 任何對使用者的提問。
- 通過
- 用手上有規格書的人看得懂的話問產品資訊。技術名詞附上說明,或是該產品的標準用語。
- 不通過
- 使用者得懂稅則分類的法規,或得自己挑稅號,才知道怎麼回答。
- 界線
- 沒有禁用字清單。提到 GRI 或稅則用語本身不算不通過,最終說明裡用法律用語也沒問題。
問題具體,而且和稅號有關
- 適用時機
- 任何對使用者的提問。
- 通過
- 清楚要問哪項產品資訊、為什麼和稅則分類有關,而且可以直接回答。
- 不通過
- 問題無關、沒有明確目標,或把法律判斷丟給使用者,例如問哪個部分構成主要特徵。
- 界線
- 合理的問題若題目資料答不出來,回「不知道」,不算不通過。一次問好幾題沒關係。是否需要提問確實有爭議時,標為「無法判斷」或退回題目審查。
已經有的不再問
- 適用時機
- 任何對使用者的提問。
- 通過
- 使用者已清楚給過的資訊,不會再要一次。確認真正模稜兩可或互相矛盾的地方,或要不同詳細程度的資訊,都沒問題。
- 不通過
- 再問一次使用者已說過的資訊,或重複使用者已說無法回答的問題。
- 界線
- 重複的問題照樣回答一次。系統從沒看過的資訊,不算重複。
答案選項讓使用者能據實回答
- 適用時機
- 問題附有選項。
- 通過
- 選項清楚,不會逼使用者編造。單選、複選或自由填寫,看問題需要。
- 不通過
- 選項有誤導、把產品資訊和稅則分類結論混在一起,或讓人無法據實回答。
- 界線
- 不需要每個候選稅號一個選項,選項也不必完全互斥。有自由填寫欄時,少了「其他」或「不知道」按鈕不算不通過。
說明
這段理由留在您的紀錄裡,站得住腳嗎?
說明把關鍵資訊和稅號連起來
- 適用時機
- 有給最終稅號,而且說明是約定任務的一部分。
- 通過
- 簡短說明為什麼這些資訊會導向這個稅號。遇到難分的情況,會點出決定性的理由。
- 不通過
- 說明是空的,或只有稅號、套話,或結論和資訊之間沒有連結。
- 界線
- 不要求字數,不要求每一層都附完整稅則條文,也沒有固定的考量清單。不拿來和來源裁定自己的理由比對。若是我們沒擷取到說明,算「無法判斷」,不算不通過。
排除其他選項的理由看得懂
- 適用時機
- 說明明確排除了一個有力的競爭稅號。
- 通過
- 讀者看得出主要替代選項為什麼不適用。一個共同理由或清楚的比較就夠。
- 不通過
- 說已排除某個主要替代選項,卻沒有看得懂的依據。
- 界線
- 不必列出每個候選,也不必每個分岔都給理由。沒討論替代選項時,不適用。
對稅號範圍的描述符合法律範圍
- 適用時機
- 說明描述了所選稅號涵蓋什麼。
- 通過
- 和節的條文、上層各級,以及類註、章註沒有實質衝突。
- 不通過
- 說這個稅號涵蓋法律條文排除的貨物、材質或技術,或否認條文要求的條件。
- 界線
- 用字不必一致。「其他」要連同上層的節和註一起讀,法律範圍也不等於節名字面的日常意思。和標準答案相同,不會自動通過。
引用的裁定確實存在,而且引述公允
- 適用時機
- 回覆引用了特定裁定或法院判決。
- 通過
- 這次測試提供的可信來源證實了該裁定,以及它被引述的內容。
- 不通過
- 可信來源顯示編號錯誤、產品不同,或確實引述失實。
- 界線
- 沒有引用就不適用;不要求一定要引用。引用無法查證時,算「無法判斷」。找不到某份裁定,不代表它是捏造的。
呈現出的法律推理沒有實質錯誤
- 適用時機
- 回覆使用或轉述 GRI、稅則條文或註。
- 通過
- 編號、意思、條件和適用方式都符合適用的法律。說明正確但沒寫規則編號也可以。
- 不通過
- 確實的誤用:搞混 GRI 3(a) 和3(b)、把幾個候選的節當成同時適用、忽略排除註、誤判哪一條零件條文優先,或把 HS 規則套到出口管制(ECCN)問題上。
- 界線
- 只評呈現出來的內容。比較和標準正確時,用字不嚴謹不算不通過。在目(6位碼)這一層引用 GRI 1 或 GRI 3、沒寫出 GRI 6,本身不算不通過。沒有權威資料可以對照時,算「無法判斷」。
完成判定
最後有沒有落在一個有效的稅號?
最終稅號有效且位數完整
- 適用時機
- 給出最終判定時。
- 通過
- 屬於約定的稅號體系、符合約定位數,而且在凍結的稅則版本中有效。
- 不通過
- 沒有稅號、格式或位數不對,或稅號在版本日期時並不存在。
- 界線
- 有效不等於正確;正確與否另外評分。測試途中稅則版本絕不更換。
資訊齊全就完成判定
- 適用時機
- 資訊完整測試的第一個回覆,或補上缺少資訊之後的回覆。
- 通過
- 直接給出最終判定,不再要更多資訊。
- 不通過
- 題目有效、資訊也足夠,卻還在要資訊,或結束時沒有稅號。
- 界線
- 附帶一句「需要更多協助嗎?」不算追問。系統錯誤另外記錄。如果真的還缺一項資訊,就回頭審查題目,而不是編一個答案。
「評分檢查表」視窗:先列出四種判定(通過、不通過、不適用、無法判斷),再分四組列出14項檢查:產品、追問、說明和完成判定。每項檢查都能展開,看適用時機、怎樣算通過、怎樣算不通過,以及界線。
關於我們如何測試的常見問題
AI 稅則分類的準確率怎麼測?
我們從 CBP 的真實裁定出題,只給 GingerOS 產品描述,裁定的稅號在評分前都封存。只有在約定位數下完整稅號完全相符才算對。我們也會從部分題目拿掉一項關鍵資訊,看 GingerOS 會不會問,並用14項書面檢查審查每一段說明。
為什麼用 CBP 的 CROSS 裁定當測試題?
這些裁定公開、由官方發布,而且同時寫明產品資訊和稅則分類結果。但一份裁定只是候選。它必須只描述一項物品、寫明每項關鍵資訊、仍然有效,而且稅號在我們凍結的稅則版本中有效。再經第二位覆核人同意,才會收錄。
前6碼對了算分嗎?
不算。要求的位數在開跑前就訂好。如果測試要求10碼,只對到前6碼就算錯。點和空格不影響。在幾個選項裡列出正確稅號卻沒有選定,也算錯。
已撤銷或修正的裁定怎麼處理?
暫緩或排除,並寫下理由。我們絕不把舊答案搬到現行稅則裡看起來相似的稅號上。
測試時 GingerOS 看得到裁定的答案嗎?
看不到。它只拿到從裁定引用的貨物描述。稅號、法律分析和裁定結果都封存,只用來評分。
為什麼要測缺少資訊的情況?
實際的產品資料常常不完整。系統如果自己猜缺少的材質或尺寸,可能信心十足地給出錯的稅號。我們檢查它的第一個問題有沒有直指決定稅號的那項資訊,就像好的報關人員會先問進口商一樣。
各家 AI 稅則分類的準確率該怎麼比?
看到任何準確率數字,先問三件事:是在6碼還是完整10碼測的、用誰的測試題、答案由誰核對。6碼相符比報關需要的10碼稅號容易得多,而且多數公開的數字都是廠商自行公布。公平的測試就像這一頁的做法:用 CBP 的真實裁定、答案封存、只算完整稅號,再用您自己的零件跑同一套測試。
你們的準確率是多少?
這一頁說明的是方法,不是一個醒目的數字。分數只有和測出它的題目放在一起才有意義。至於您的產品,驗收時會用同一套方法測您自己的零件:標準答案由您的專家確認,及格線在開跑前就約定好。
同一套方法能用在出口管制分類嗎?
檢查項目刻意把兩者分開:把 HS 規則套到出口管制問題上就算不通過。出口管制測試需要自己的標準答案和法律依據,在開跑前就固定。
結果算不算通過,由誰決定?
由人決定。AI 協助擷取資訊、標出問題,這些筆記都會標明「AI 協助」。在我們自己的測試裡,由我們的測試負責人審定測試題、裁決爭議,並對照開跑前訂好的及格線簽核。在驗收時拿您的零件測試,則由您的專家簽核。