GingerOS我們如何測試

準確率說法,別再照單全收。

我們測試 GingerOS 的方式,就像您稽核一筆稅號判定:用美國海關與邊境保護局(CBP)的真實裁定、答案封存、只問一輪、完整稅號相符才算。每一步都寫在這裡。

測試計畫已封存
  • 稅則版本單一 HTSUS 修訂版,整輪測試不變
  • 稅號位數事先約定。只對到節不算對
  • 測試題看到任何結果前就列好
  • 追問回答一輪,之後就得判定
  • 評分範圍只評使用者在畫面上看得到的內容
  • 及格線分數出來前由人訂好

封存後的任何更動都會記錄,並寫明理由。

「測試計畫」視窗列出開跑前固定的六條規則:稅則版本、稅號位數、測試題、追問、評分範圍和及格線。每條規則的鎖依序扣上,接著「草稿」標籤變成「已封存」。

從 CBP 真實裁定出題,每一題都檢查。

一份裁定要先通過您自己也會做的檢查,再經第二位覆核人同意,才會成為測試題。

  • 在固定日期區間內從 CROSS(CBP 裁定查詢系統)取出,並保存來源和日期。這是範圍明確的題庫,不是所有貿易商品的隨機抽樣。
  • 題目清單在看到任何結果前就固定,不能因為題目難就換掉。
  • 光是稅號還存在不夠:它在凍結版稅則裡的條文,也必須仍然符合裁定寫的產品資訊。
選題審查

候選裁定

1題收錄 · 1題暫緩 · 2題排除 · 1題待裁決

安裝支架

四項檢查

  • 單一產品,依進口時的狀態通過
  • 裁定寫明關鍵資訊沒寫材質
  • 未遭撤銷或修正通過
  • 稅號仍符合凍結版 HTSUS通過
決定暫緩

裁定給了稅號,卻沒說支架是什麼材質。我們會回頭查全文;全文也沒有,就不會拿答案反推補上。

第二位覆核人:同意

示意畫面(範例資料):「選題審查」視窗列出五份虛構的候選裁定,例如水管束和黃銅閥,各自標上收錄、暫緩、排除或待裁決。點選一份,會顯示四項檢查、沒過的那一項、決定和理由。

只給產品,絕不給答案。

GingerOS 只拿到貨物描述,稅號和判定理由在評分前都封存。

  • 產品資訊逐字引用。分析段落裡的規格可以採用;「因此歸入第 X 節」這種話一律不給。
  • 每份存檔的裁定都會留下數位指紋。內文一變,用它出的每一題都重新審查。
  • CBP 的描述比實際發票上的品名整齊,所以這一步比您每天的工作簡單。這也是驗收要用您自己資料的原因之一。
練習用裁定 · 虛構產品

傳給 GingerOS評分前封存

貨物描述

本物品為外徑18公釐的不鏽鋼環。

壁厚1公釐,表面無塗層。

法律依據與分析

裁定結果

示意畫面(範例資料):一份虛構不鏽鋼環的練習用裁定,「貨物描述」以醒目標示表示傳給 GingerOS,「法律依據與分析」和「裁定結果」塗黑,表示評分前封存。

拿掉一項關鍵資訊,它會問嗎?

好的報關人員會先問,不會先猜。我們拿掉一項決定稅號的資訊,評估它的第一個問題有沒有問到這一點。

缺資訊測試 · 不鏽鋼環

虛構規則外徑25公釐以下為稅號 A,超過25公釐為稅號 B。

完整題目

不鏽鋼環,18公釐

  • 不鏽鋼
  • 外徑18公釐
  • 壁厚1公釐
  • 表面無塗層
GingerOS 拿到的內容

不鏽鋼環 18公釐

  • 不鏽鋼
  • 外徑18公釐
  • 壁厚1公釐
  • 表面無塗層

直徑出現兩次,所以兩處都拿掉,其他都不變。

哪個第一問能得分?

GingerOS外徑超過10公釐嗎?
測試應答者是。
沒問到缺口

範圍太大。18公釐和32公釐的環都會回答「是」,稅號還是定不下來。

示意畫面(範例資料):虛構不鏽鋼環的缺資訊測試,GingerOS 拿到的題目裡劃掉了18公釐的直徑。可以點選四種第一問,每一種都會顯示回答和判定:問到缺口或沒問到缺口。

缺口要成立,必須

  • 只缺一項資訊

    只拿掉那一項,不能連帶拿掉也寫了表面處理的句子。

  • 真的會改變稅號

    18公釐和32公釐會對到不同稅號,而且兩邊都有稅則條文為依據。

  • 補回去就夠

    補回去之後,就沒有不明的關鍵資訊了。

  • 不留線索

    品名裡留著「直徑1.8公分」,這個測試就失效了。

只問一輪,接著就要判定。

每一題都停在同一條線,沒有哪一題能多試幾次。

測試應答者的規則

  • 只回答被問到的:問「超過10公釐嗎?」只回「是」,絕不回「18公釐」。
  • 題目資料裡沒有的,一律回「不知道」。
  • 每個回答都從題目資料引用,所以「工作溫度80°C」不會變成「最高溫度80°C」。

只問一輪是這個測試的規則,不代表真實產品只需要問一個問題。

測試執行 · 不鏽鋼環
GingerOS判定稅號前想先確認:這個環的外徑是多少?
測試應答者18公釐。
GingerOS最終判定稅號 A外徑18公釐,低於25公釐的界線。

測試到此結束,進入評分

第一個回覆的每種可能

  • 問了缺少的資訊回答一次,評分下一個回覆。
  • 沒問就給稅號結束。稅號照常評分,追問檢查不通過。
  • 問了別的事結束。追問檢查不通過。
  • 得到回答後又問沒有第三輪,算未完成。

示意畫面(範例資料):一段測試執行的對話,GingerOS 詢問虛構不鏽鋼環的外徑,測試應答者回答18公釐,GingerOS 給出最終判定「稅號 A」,測試隨即結束、進入評分。

完整稅號對了才算,錯題一個不少。

只對到節不算對,執行出錯的題目也絕不悄悄拿掉。

  • 說明寫得再好,也救不了錯的稅號。稅號單獨評分。
  • 資訊完整和缺資訊兩種測試分開報告,並列出計畫、實際執行和排除的題數。
評分表

標準答案8471.30.0100

GingerOS 的回答計為
8471.30.0100正確完全相符
8471300100正確點和空格不影響
8471.30錯誤只到6碼
給三個選項,沒選定錯誤沒有單一最終稅號
逾時異常留在計畫總數裡,另外列出

兩個準確率,絕不只報一個

以完成的執行計算
正確稅號數正常完成的執行數
沒給最終稅號算錯
以整份計畫計算
正確稅號數計畫內全部題目,扣除已證實有誤的題目
異常和未完成的執行都算在內

示意畫面(範例資料):一張評分表,範例標準答案是8471.30.0100,下面五個範例回答,兩個計為正確、兩個計為錯誤,逾時的那次執行計為異常,另有兩條沒有填入數字的準確率公式。

稅號對了、理由錯了?理由照樣不過。

我們像稽核人員一樣讀說明:資訊要追得到使用者說過的話、不超出法律範圍、引用都要查證。

  • 使用者後來才給的資訊,救不了之前的猜測。
  • 「其他」這一列,要連同上層節的條文和註一起讀。
  • 簡短沒關係:不要求字數、不要求整段稅則條文,只要理由站得住。
報告審查 · 不鏽鋼環

最終判定稅號 A

報告寫的我們的檢查
外徑18公釐,在稅號 A 的25公釐上限內。通過關鍵資訊和稅號有連結。
拋光表面,適合長期戶外使用。不通過沒人這樣說過。捏造的資訊就算稅號對了也不通過。
排除稅號 B,因為它只涵蓋超過25公釐的環。通過被排除的選項有看得懂的理由。

示意畫面(範例資料):虛構不鏽鋼環的報告審查表,最終判定為稅號 A,逐句檢查報告裡的三句話。兩句通過;聲稱「拋光表面、適合戶外使用」的那一句被框起來標為捏造的資訊,不通過。

每次測試都留底,最後由人簽核。

從來源裁定到簽核,每個環節都能打開查核。重跑也不會抹掉答錯的紀錄。

測試紀錄
  • 測試計畫開跑前封存
  • 題目清單看到結果前就固定
  • 不鏽鋼環
    • 對話每則訊息,和使用者看到的一樣
    • 結果最終稅號
    • 數位指紋證明事後沒被修改
  • 評分
    • 逐項檢查判定和引用的原文
    • 報告可分享
    • 試算表每題一列

這一題的執行紀錄

第1次逾時,保留。

第2次依計畫規則重跑,採用。

示意畫面(範例資料):「測試紀錄」的檔案樹,有封存的測試計畫、題目清單、不鏽鋼環這一題的資料夾和評分資料夾。第1次執行逾時、保留下來;第2次依計畫規則重跑,採用。

簽核
  • 測試題已審定
  • 執行遵守計畫
  • 分數可以重算
  • 爭議已解決或列出
  • 及格線在開跑前訂好

簽核人

我們的測試
我們的測試負責人
您的驗收
您的專家

要有人在這裡簽核,結果才算數。

「簽核」視窗列出五個已勾選的項目:測試題已審定、執行遵守計畫、分數可以重算、爭議已解決或列出、及格線在開跑前訂好。下方寫明我們的測試由我們的測試負責人簽核,您的驗收由您的專家簽核。

  • 一致性另外安排重複執行來測。一直錯,還是錯。
  • 有瑕疵的題目一經人工確認,它影響到的每次執行都會修正,不只修答錯的那幾題。
  • AI 協助寫的筆記都會標明,只有人能簽核。

14項檢查,用白話說。

每一項都寫明何時適用、怎樣算通過、怎樣算不通過,以及界線在哪。每一項都能展開。

評分檢查表

每項檢查只會得到四種判定之一

  • 通過適用,而且佐證資料顯示達到標準。
  • 不通過適用,並有引用的佐證資料顯示確實有問題。
  • 不適用回覆沒有觸發這一項,例如沒有引用裁定。
  • 無法判斷適用,但佐證資料不足以判斷。

只有「通過」算通過。通過率 = 通過 ÷(通過 + 不通過),並一律同時列出「不適用」和「無法判斷」的數量。

產品

判定的是不是實際描述的那個東西?

照貨物實際進口的狀態判定
適用時機
回覆判斷貨物是整件物品、零件、成套,還是未組裝。
通過
判定的對象和輸入一致。零件不會當成整台機器判定,未組裝進口的貨物也不會寫成已組裝。依稅則解釋準則(GRI)2(a) 當成完整物品判定是可以的。
不通過
換成別的物品或狀態,再拿那個去判定。
界線
不必重述狀態的每個細節。法律適用是否正確,另由其他項目檢查。
絕不更改或捏造產品資訊
適用時機
回覆提到材質、構造、功能、規格或用途,或解釋技術名詞、換算單位。
通過
每項產品資訊都來自使用者當時已說過的內容,或可直接從中推出。技術說明和換算都正確。
不通過
把沒人給過的資訊當成已知、和已給的資訊矛盾,或用錯換算,誤導判定或使用者。
界線
問題裡的選項不算主張。後來的回答不能替先前的猜測背書。合理的四捨五入沒問題。技術含義有爭議又沒有可靠來源時,標為「無法判斷」。

追問

問對了嗎?問法讓人答得出來嗎?

第一個問題直指缺少的資訊僅限缺資訊測試
適用時機
有效的缺資訊測試裡的第一個回覆。
通過
問到了缺少的資訊,而且只要如實回答這一題就能確定稅號。同一批裡問其他問題沒關係,用能定出稅號的範圍或門檻來問也可以。
不通過
只問了別的事、籠統要「更多資訊」、沒問就判定,或問得太廣,定不出稅號。
界線
不靠關鍵字比對判斷。提到那項資訊、自行假設它,或請使用者挑稅號,都不算問。只看第一批問題,之後問的不算。
手上有規格書的人看得懂問題
適用時機
任何對使用者的提問。
通過
用手上有規格書的人看得懂的話問產品資訊。技術名詞附上說明,或是該產品的標準用語。
不通過
使用者得懂稅則分類的法規,或得自己挑稅號,才知道怎麼回答。
界線
沒有禁用字清單。提到 GRI 或稅則用語本身不算不通過,最終說明裡用法律用語也沒問題。
問題具體,而且和稅號有關
適用時機
任何對使用者的提問。
通過
清楚要問哪項產品資訊、為什麼和稅則分類有關,而且可以直接回答。
不通過
問題無關、沒有明確目標,或把法律判斷丟給使用者,例如問哪個部分構成主要特徵。
界線
合理的問題若題目資料答不出來,回「不知道」,不算不通過。一次問好幾題沒關係。是否需要提問確實有爭議時,標為「無法判斷」或退回題目審查。
已經有的不再問
適用時機
任何對使用者的提問。
通過
使用者已清楚給過的資訊,不會再要一次。確認真正模稜兩可或互相矛盾的地方,或要不同詳細程度的資訊,都沒問題。
不通過
再問一次使用者已說過的資訊,或重複使用者已說無法回答的問題。
界線
重複的問題照樣回答一次。系統從沒看過的資訊,不算重複。
答案選項讓使用者能據實回答
適用時機
問題附有選項。
通過
選項清楚,不會逼使用者編造。單選、複選或自由填寫,看問題需要。
不通過
選項有誤導、把產品資訊和稅則分類結論混在一起,或讓人無法據實回答。
界線
不需要每個候選稅號一個選項,選項也不必完全互斥。有自由填寫欄時,少了「其他」或「不知道」按鈕不算不通過。

說明

這段理由留在您的紀錄裡,站得住腳嗎?

說明把關鍵資訊和稅號連起來
適用時機
有給最終稅號,而且說明是約定任務的一部分。
通過
簡短說明為什麼這些資訊會導向這個稅號。遇到難分的情況,會點出決定性的理由。
不通過
說明是空的,或只有稅號、套話,或結論和資訊之間沒有連結。
界線
不要求字數,不要求每一層都附完整稅則條文,也沒有固定的考量清單。不拿來和來源裁定自己的理由比對。若是我們沒擷取到說明,算「無法判斷」,不算不通過。
排除其他選項的理由看得懂
適用時機
說明明確排除了一個有力的競爭稅號。
通過
讀者看得出主要替代選項為什麼不適用。一個共同理由或清楚的比較就夠。
不通過
說已排除某個主要替代選項,卻沒有看得懂的依據。
界線
不必列出每個候選,也不必每個分岔都給理由。沒討論替代選項時,不適用。
對稅號範圍的描述符合法律範圍
適用時機
說明描述了所選稅號涵蓋什麼。
通過
和節的條文、上層各級,以及類註、章註沒有實質衝突。
不通過
說這個稅號涵蓋法律條文排除的貨物、材質或技術,或否認條文要求的條件。
界線
用字不必一致。「其他」要連同上層的節和註一起讀,法律範圍也不等於節名字面的日常意思。和標準答案相同,不會自動通過。
引用的裁定確實存在,而且引述公允
適用時機
回覆引用了特定裁定或法院判決。
通過
這次測試提供的可信來源證實了該裁定,以及它被引述的內容。
不通過
可信來源顯示編號錯誤、產品不同,或確實引述失實。
界線
沒有引用就不適用;不要求一定要引用。引用無法查證時,算「無法判斷」。找不到某份裁定,不代表它是捏造的。
呈現出的法律推理沒有實質錯誤
適用時機
回覆使用或轉述 GRI、稅則條文或註。
通過
編號、意思、條件和適用方式都符合適用的法律。說明正確但沒寫規則編號也可以。
不通過
確實的誤用:搞混 GRI 3(a) 和3(b)、把幾個候選的節當成同時適用、忽略排除註、誤判哪一條零件條文優先,或把 HS 規則套到出口管制(ECCN)問題上。
界線
只評呈現出來的內容。比較和標準正確時,用字不嚴謹不算不通過。在目(6位碼)這一層引用 GRI 1 或 GRI 3、沒寫出 GRI 6,本身不算不通過。沒有權威資料可以對照時,算「無法判斷」。

完成判定

最後有沒有落在一個有效的稅號?

最終稅號有效且位數完整
適用時機
給出最終判定時。
通過
屬於約定的稅號體系、符合約定位數,而且在凍結的稅則版本中有效。
不通過
沒有稅號、格式或位數不對,或稅號在版本日期時並不存在。
界線
有效不等於正確;正確與否另外評分。測試途中稅則版本絕不更換。
資訊齊全就完成判定
適用時機
資訊完整測試的第一個回覆,或補上缺少資訊之後的回覆。
通過
直接給出最終判定,不再要更多資訊。
不通過
題目有效、資訊也足夠,卻還在要資訊,或結束時沒有稅號。
界線
附帶一句「需要更多協助嗎?」不算追問。系統錯誤另外記錄。如果真的還缺一項資訊,就回頭審查題目,而不是編一個答案。

「評分檢查表」視窗:先列出四種判定(通過、不通過、不適用、無法判斷),再分四組列出14項檢查:產品、追問、說明和完成判定。每項檢查都能展開,看適用時機、怎樣算通過、怎樣算不通過,以及界線。

關於我們如何測試的常見問題

AI 稅則分類的準確率怎麼測?

我們從 CBP 的真實裁定出題,只給 GingerOS 產品描述,裁定的稅號在評分前都封存。只有在約定位數下完整稅號完全相符才算對。我們也會從部分題目拿掉一項關鍵資訊,看 GingerOS 會不會問,並用14項書面檢查審查每一段說明。

為什麼用 CBP 的 CROSS 裁定當測試題?

這些裁定公開、由官方發布,而且同時寫明產品資訊和稅則分類結果。但一份裁定只是候選。它必須只描述一項物品、寫明每項關鍵資訊、仍然有效,而且稅號在我們凍結的稅則版本中有效。再經第二位覆核人同意,才會收錄。

前6碼對了算分嗎?

不算。要求的位數在開跑前就訂好。如果測試要求10碼,只對到前6碼就算錯。點和空格不影響。在幾個選項裡列出正確稅號卻沒有選定,也算錯。

已撤銷或修正的裁定怎麼處理?

暫緩或排除,並寫下理由。我們絕不把舊答案搬到現行稅則裡看起來相似的稅號上。

測試時 GingerOS 看得到裁定的答案嗎?

看不到。它只拿到從裁定引用的貨物描述。稅號、法律分析和裁定結果都封存,只用來評分。

為什麼要測缺少資訊的情況?

實際的產品資料常常不完整。系統如果自己猜缺少的材質或尺寸,可能信心十足地給出錯的稅號。我們檢查它的第一個問題有沒有直指決定稅號的那項資訊,就像好的報關人員會先問進口商一樣。

各家 AI 稅則分類的準確率該怎麼比?

看到任何準確率數字,先問三件事:是在6碼還是完整10碼測的、用誰的測試題、答案由誰核對。6碼相符比報關需要的10碼稅號容易得多,而且多數公開的數字都是廠商自行公布。公平的測試就像這一頁的做法:用 CBP 的真實裁定、答案封存、只算完整稅號,再用您自己的零件跑同一套測試。

你們的準確率是多少?

這一頁說明的是方法,不是一個醒目的數字。分數只有和測出它的題目放在一起才有意義。至於您的產品,驗收時會用同一套方法測您自己的零件:標準答案由您的專家確認,及格線在開跑前就約定好。

同一套方法能用在出口管制分類嗎?

檢查項目刻意把兩者分開:把 HS 規則套到出口管制問題上就算不通過。出口管制測試需要自己的標準答案和法律依據,在開跑前就固定。

結果算不算通過,由誰決定?

由人決定。AI 協助擷取資訊、標出問題,這些筆記都會標明「AI 協助」。在我們自己的測試裡,由我們的測試負責人審定測試題、裁決爭議,並對照開跑前訂好的及格線簽核。在驗收時拿您的零件測試,則由您的專家簽核。

用您自己的零件測一次。

標準答案由您的專家確認,及格線在開跑前就約定好。

零風險承諾

全額退款。

MVP 驗收前若不滿意,全額退還您支付的訂金。

點我!

看看是否符合資格