GingerOS测试方法
厂商说的准确率,别照单全收。
我们测GingerOS(AI贸易合规平台)的方式,和您审核一条归类结论一样:用美国海关与边境保护局(CBP)的真实裁定出题,答案封存,只问一轮,完整编码一致才算对。每一步都列在下面。
- 税则版本《美国协调关税表》(HTSUS)固定一个版本,整轮不变
- 编码位数事先约定。税目对上不算对
- 测试题看到任何结果之前就已列好
- 提问只答一轮,之后必须给出结论
- 评分对象只评用户在屏幕上看到的内容
- 合格线出分之前由人设定
封存后的任何改动都记录在案,并写明原因。
“测试计划”窗口列出运行前固定的六条规则:税则版本、编码位数、测试题、提问、评分对象和合格线。每条规则的锁依次扣上,随后“草稿”标签变成“已封存”。
用真实海关裁定出题,逐一核查。
一份裁定要先通过您自己也会做的检查,再经第二位复核人同意,才能成为测试题。
- 按固定的日期范围从CROSS(美国海关裁定在线查询系统)调取,保存来源和日期。题库范围界定清楚,不是对全部贸易的随机抽样。
- 题目清单在出任何结果之前就固定,难题不能因为难而换掉。
- 编码仍然存在还不够,它在冻结版本税则里的条文也必须与裁定事实相符。
候选裁定
收录1 · 暂缓1 · 排除2 · 上报1
安装支架
四项检查
- 单一产品,按进口时的状态已通过
- 裁定写明了关键事实未写明材质
- 未撤销、未修改已通过
- 编码仍符合冻结的HTSUS已通过
裁定给了编码,却没写支架是什么材质。我们回头查全文;全文也没有,就不会根据答案反推补上。
第二位复核人:同意
示意图,数据为示例:“题目收录”窗口列出五份虚构的候选裁定,例如软管卡箍和黄铜阀门,每份标有“已收录”“暂缓”“已排除”或“已上报”。选中其中一份,会显示四项检查、未通过的那一项、处理决定和理由。
只给商品,不给答案。
GingerOS只拿到货物描述,编码和归类依据在评分前一直封存。
- 事实逐字引用。分析部分里的规格可以算进去;“因此归入税目X”这类结论绝对不算。
- 每份保存的裁定都生成数字指纹。原文一旦变动,基于它出的所有题目都要重新审核。
- 美国海关写的描述比真实发票上的品名规整,所以这一步比您日常的工作容易。这也是验收要用您自己数据的原因之一。
发给GingerOS评分前封存
货物描述
该物品为不锈钢环,外径18毫米。
壁厚1毫米,表面无涂层。
法律依据与分析
裁定结论
示意图,数据为示例:一份关于虚构不锈钢环的练习裁定,“货物描述”部分标为发给GingerOS的内容,“法律依据与分析”和“裁定结论”涂黑,评分前封存。
拿掉一个关键事实,会不会问?
好的报关行先问,不靠猜。我们拿掉一个决定编码的事实,看第一个问题是否直奔这个事实。
虚构规则外径不超过25毫米归入编码A,超过25毫米归入编码B。
不锈钢环,18毫米
- 不锈钢
- 外径18毫米
- 壁厚1毫米
- 表面无涂层
不锈钢环 18毫米
- 不锈钢
外径18毫米- 壁厚1毫米
- 表面无涂层
直径出现了两次,所以两处都拿掉。其他一概不变。
第一个问题,哪种问法能得分?
问得太宽。18毫米和32毫米的环都会答“是”,编码还是定不下来。
示意图,数据为示例:对虚构的不锈钢环做缺失事实测试,GingerOS拿到的题目里删去了18毫米的直径。第一个问题有四种问法可选,每种都会显示回答和判定:“问到缺口”或“没问到缺口”。
满足以下条件,缺口才算数
只缺一个事实
只拿掉这一项,不能把同时写着表面处理的整句删掉。
确实会改变编码
18毫米和32毫米对应不同编码,税则条文对两者都有依据。
补回去就够了
补回这个事实后,不再有其他决定性的未知项。
不留任何线索
名称里留着“直径1.8厘米”,这道题就作废了。
只问一轮,然后给结论。
每道题都在同一处停下,没有哪道题能多试几次。
测试应答人的规则
- 只答所问:问“超过10毫米吗?”,只答“是”,绝不答“18毫米”。
- 题目资料里没有的,一律答“不知道”。
- 每个回答都引自题目资料,所以“工作温度80°C”不会变成“最高耐温80°C”。
只问一轮是这项测试的规则,并不代表真实产品只需要问一个问题。
运行到此结束,进入评分
第一条回复的所有情况
- 问缺失的事实回答一次,下一条回复计入评分。
- 没问就给编码结束。编码照常评分,提问检查不通过。
- 问了别的事结束。提问检查不通过。
- 得到回答后又问没有第三轮,记为未完成。
示意图,数据为示例:一段测试运行的对话。GingerOS询问虚构环的外径,测试应答人回答18毫米,GingerOS给出最终归类“编码A”,随后运行结束,进入评分。
只认完整编码,错题一个不删。
税目(关务口语也叫品目)对上不算对,出错的运行也绝不悄悄剔除。
- 措辞再好也弥补不了编码错误,编码单独评分。
- 完整事实测试和缺失事实测试分开报告,并列出计划数、运行数和排除数。
参考答案8471.30.0100
| GingerOS返回 | 计为 |
|---|---|
| 8471.30.0100 | 相符完全一致 |
| 8471300100 | 相符点号和空格不影响 |
| 8471.30 | 不符只到6位 |
| 三个选项,未选定 | 不符没有唯一的最终编码 |
| 超时 | 异常仍计入计划总数,单独列出 |
准确率报两个,从不只报一个
- 按正常完成的运行计
- 正确编码数正常完成的运行数
- 没有最终编码的计为不符
- 按整个计划计
- 正确编码数计划内全部题目,减去已证实有缺陷的题目
- 异常和未完成的运行都保留在内
示意图,数据为示例:一张评分表,示例参考答案为8471.30.0100,列出五个示例回复:两个计为“相符”,两个计为“不符”,一个超时的运行计为“异常”;下方是两个没有填入数字的准确率公式。
编码对了,理由错了?理由照样不过。
我们像稽查人员一样审读归类解释:事实要能追溯到用户的说法,不超出编码的法律范围,引用逐一查证。
- 用户事后提供的事实,救不回之前的猜测。
- “其他”类税号要结合上级税目条文和注释一起读。
- 简短没关系:不要求字数,也不要求抄全税则条文,只要理由站得住。
最终归类编码A
| 报告写道 | 我们的检查 |
|---|---|
| 外径为18毫米,在编码A的25毫米上限以内。 | 通过关键事实与编码挂上了钩。 |
| 表面抛光,可长期户外使用。 | 不通过没人这样说过。编造的事实,即使编码对了也不通过。 |
| 排除编码B,因为编码B只涵盖外径超过25毫米的环。 | 通过排除备选项的理由说得通。 |
示意图,数据为示例:虚构环的报告审核表,最终归类为编码A,逐一检查报告中的三句话。两句通过;声称“表面抛光、可户外使用”的那句以框标出,判为编造的事实,不通过。
每次运行都留档,最后由人签字。
从原始裁定到最终签字,每个环节都能打开核查。重跑绝不会抹掉之前的错误。
- 测试计划运行前已封存
- 题目清单出结果前已固定
- 不锈钢环
- 对话每条消息,与用户所见一致
- 结果最终编码
- 指纹证明事后没有改动
- 评分
- 逐项检查判定及引用的原话
- 报告用于分享
- Excel表格每道题一行
这道题的尝试记录
第1次超时,保留。
第2次按计划规则重跑,采用。
示意图,数据为示例:“运行记录”文件树,包括已封存的测试计划、题目清单、不锈钢环题目文件夹和评分文件夹。第1次尝试超时并保留,第2次按计划规则重跑并采用。
- 测试题符合条件
- 运行按计划执行
- 分数可以重新计算
- 争议已解决或已列出
- 合格线在运行前设定
签字人
- 我们的测试运行
- 我们的测试负责人
- 您的验收
- 您的专家
未经人工在此签字,任何结果都不予采用。
“签字确认”窗口列出五个已勾选项:测试题符合条件、运行按计划执行、分数可以重新计算、争议已解决或已列出、合格线在运行前设定。下方注明:我们的测试运行由我们的测试负责人签字,您的验收由您的专家签字。
- 一致性另外安排专门的重复运行来测。次次都错,照样是错。
- 有缺陷的题目一经人工确认,凡是涉及它的运行都会修正,不只修错题。
- AI辅助生成的备注都有标注,只有人能签字。
14项检查,说成大白话。
每一项都写明何时适用、怎样算通过、怎样算不通过,以及边界在哪里。可任意展开查看。
每项检查只给四种判定之一
- 通过适用,且证据显示达到了标准。
- 不通过适用,并有引用的证据显示确实存在问题。
- 不适用回复没有触发这一项,例如没有引用任何裁定。
- 无法判断适用,但证据不足以判断。
只有“通过”才算通过。通过率 = 通过数 ÷(通过数 + 不通过数),并始终同时列出“不适用”和“无法判断”的数量。
产品
归类的是不是实际描述的那件东西?
按货物进口时的实际状态归类
- 适用情形
- 回复判断货物是整件物品、零部件、成套货品,还是未组装状态。
- 通过
- 归类对象与输入一致。不把零部件当成整机,也不把未组装进口的货物说成已组装。按归类总规则二(一)(GRI 2(a))作为完整物品归类,没有问题。
- 不通过
- 换成另一种物品或状态,再去归类。
- 边界
- 不必复述状态的每个细节。法律适用是否正确,由另一项检查判断。
不改动、不编造产品事实
- 适用情形
- 回复说明了材质、结构、功能、规格或用途,或解释了技术术语、单位换算。
- 通过
- 每个产品事实都来自用户截至当时说过的话,或能由此直接推出。技术解释和换算正确。
- 不通过
- 把没人提供的事实当成已知,与已提供的事实矛盾,或换算错误,误导了归类或用户。
- 边界
- 问题里列出的选项不算陈述。后来的回答不能为先前的猜测开脱。合理取整没有问题。技术含义有争议又没有可靠来源的,标为“无法判断”。
提问
问对了吗?问得让人答得上来吗?
第一个问题直指缺失的事实仅限缺失事实测试
- 适用情形
- 有效的缺失事实测试中的第一条回复。
- 通过
- 问的是缺失的事实,而且只要如实回答这一个问题,编码就能确定。同一轮里问其他问题没关系,用能定出编码的范围或阈值来问也可以。
- 不通过
- 只问别的事,笼统地要“更多信息”,不问就归类,或者问得太宽、定不下编码。
- 边界
- 不做关键词匹配。提到这个事实、默认它成立,或者让用户自己选编码,都不算问到。只看第一轮的问题,不看后面。
手里有规格书的人看得懂这个问题
- 适用情形
- 任何向用户提出的问题。
- 通过
- 用手持产品规格书的人看得懂的话来问产品事实。技术术语要么有上下文,要么是该产品的通用说法。
- 不通过
- 用户得懂归类法规,或者得自己挑税号,才知道怎么回答。
- 边界
- 没有禁用词清单。提到GRI或税则术语本身不算不通过,最终解释里用法律术语也没问题。
问题具体,而且影响编码
- 适用情形
- 任何向用户提出的问题。
- 通过
- 要的是哪项产品事实、它为什么影响归类,都很清楚,而且能直接回答。
- 不通过
- 问题无关、目标不清,或把法律判断推给用户,例如问哪个部件构成基本特征。
- 边界
- 题目资料答不上来的合理问题,会得到“不知道”,不算不通过。一次问几个问题没关系。是否需要问这个问题确有争议的,标为“无法判断”,或退回重新审核题目。
已经有的信息不再重复问
- 适用情形
- 任何向用户提出的问题。
- 通过
- 不重复索要已经清楚提供的事实。确认确有歧义或矛盾的地方,或要的是详细程度不同的信息,没有问题。
- 不通过
- 再次索要用户已经说过的事实,或重复用户已表示答不上来的问题。
- 边界
- 重复的问题仍会回答一次。系统从未看到过的事实,不能算重复。
答案选项让用户能如实回答
- 适用情形
- 问题提供了选项。
- 通过
- 选项清楚,不逼用户编造。单选、多选或自由填写,按问题需要来。
- 不通过
- 选项有误导性,把产品事实和归类结论混在一起,或者没有办法如实作答。
- 边界
- 不需要每个候选编码各对应一个选项,也不要求选项完全互斥。如果可以自由填写,缺少“其他”或“不知道”按钮不算不通过。
解释
这套判断依据放进您的归类档案,站得住吗?
解释把关键事实和编码连起来
- 适用情形
- 给出了最终编码,且解释是约定任务的一部分。
- 通过
- 用简短的解释说明这些事实为什么得出这个编码。遇到难分的情况,点明决定性的理由。
- 不通过
- 解释是空的,或只有一个编码、套话,或是与事实毫无关联的结论。
- 边界
- 不要求字数,不要求每一级都抄全税则条文,也没有固定的考量因素清单。不和原始裁定自身的推理比对。如果是我们没能抓取到解释,标为“无法判断”,不算不通过。
排除的备选项有说得通的理由
- 适用情形
- 解释明确排除了一个有力的备选归类。
- 通过
- 读者能看懂主要备选项为什么不适用。一个共同理由或一个清楚的对比就够了。
- 不通过
- 主要备选项列为已排除,却没有可理解的依据。
- 边界
- 不必列出所有候选,也不必在每个分支都给理由。没讨论任何备选项的,就不适用。
对编码范围的描述与法律范围一致
- 适用情形
- 解释描述了所选编码涵盖哪些货物。
- 通过
- 与税目条文、上级各层级以及类注、章注都没有实质冲突。
- 不通过
- 称该编码涵盖其法律条文排除的货物、材料或技术,或否认条文要求的条件。
- 边界
- 措辞不必一致。“其他”要结合上级税目和注释来读,法律范围也不等于税目字面的日常含义。与参考答案一致,不代表自动通过。
引用的裁定确实存在,且引述公允
- 适用情形
- 回复引用了具体的裁定或法院判决。
- 通过
- 本次运行提供的可信来源证实该裁定存在,且裁定结论与引述一致。
- 不通过
- 可信来源显示编号错误、产品不同,或确有错误引述。
- 边界
- 没有引用就不适用;不要求必须引用。引用无法核实的,标为“无法判断”。找不到某份裁定,不能证明它是编造的。
展示出来的法律推理没有实质错误
- 适用情形
- 回复使用或转述了GRI、税则条文或注释。
- 通过
- 规则编号、含义、条件和运用都与适用法律相符。解释正确但没写规则编号,也可以。
- 不通过
- 确有适用错误:混淆归类总规则三(一)和三(二)(GRI 3(a)、3(b)),把几个候选税目当作同时适用,忽略注释中的排除条款,搞错零部件条款的优先顺序,或把HS规则套到出口管制(ECCN)问题上。
- 边界
- 只评判展示出来的部分。比较和标准都对时,措辞宽松不算不通过。在子目层级引用规则一或规则三、没提规则六,本身不算不通过。没有权威资料可供核对时,标为“无法判断”。
完成任务
最后是否落到一个有效编码上?
最终编码有效且位数完整
- 适用情形
- 给出了最终归类。
- 通过
- 属于约定的编码体系,位数符合约定,且在冻结的税则版本中有效。
- 不通过
- 没有编码、格式或位数不对,或该编码在版本日期并不存在。
- 边界
- 有效的编码不一定是正确的编码,正确与否另行评分。测试中途绝不更换税则版本。
事实齐了,就给出结论
- 适用情形
- 完整事实测试中的第一条回复,或补上缺失事实之后的那条回复。
- 通过
- 直接给出最终归类,不再追问。
- 不通过
- 题目有效、事实也已足够,仍在索要更多信息;或者没给编码就结束了。
- 边界
- 可选的“还需要更多帮助吗?”不算追问。系统错误另行记录。如果确实还缺另一个事实,就重新审核这道题,而不是编一个答案。
“评分清单”窗口:先列出四种判定(通过、不通过、不适用、无法判断),再分四组列出14项检查:产品、提问、解释、完成任务。每项检查展开后显示适用情形、通过和不通过的标准,以及边界。
关于测试方法的常见问题
AI归类工具的准确率怎么测?
我们用美国海关(CBP)的真实裁定出题,只把产品描述交给GingerOS,裁定里的编码一直封存到评分。只有按约定位数、完整编码完全一致才算对。我们还会在部分题目里拿掉一个关键事实,看GingerOS会不会问;每一份解释也都按14项书面检查逐项审核。
为什么用美国海关CROSS裁定当测试题?
CROSS(美国海关裁定在线查询系统)里的裁定由官方公开发布,同时写明了产品事实和归类结论。但一份裁定只是候选:它必须只描述一种货品、写明每个关键事实、仍然有效,所载编码在我们冻结的税则版本中也有效。还要第二位复核人同意,才能收录。
前6位对上算不算对?
不算。要求的位数在运行前就定好。如果测试要求10位,只对上前6位的编码记为不符。点号和空格忽略不计。在几个选项里列出了正确编码却不选定其中一个,也记为不符。
已撤销或修改的裁定怎么处理?
暂缓或排除,并写明原因。我们绝不会把旧答案挪到现行税则里看起来相似的编码上。
测试时GingerOS看得到裁定的答案吗?
看不到。GingerOS只拿到从裁定中原文引用的货物描述。编码、法律分析和裁定结论都封存,只用于评分。
为什么要测缺少事实的情况?
真实的产品数据经常不完整。系统要是自己猜缺失的材质或尺寸,就可能信心满满地给出错误编码。我们检查系统的第一个问题是否直指决定编码的那个事实,就像好的报关行会先问进口商一样。
各家AI归类的准确率,该怎么比?
看到任何准确率数字,先问三件事:是按6位还是完整的10位测的?用的是谁的测试题?答案由谁核对?6位一致比报关所需的10位编码容易得多,而且多数公开数字都是厂商自报的。公平的测试就像本页这样:真实的美国海关裁定、答案封存、只认完整编码,再用您自己的零部件跑同样的测试。
你们的准确率分数呢?
本页讲的是方法,不放一个总分。分数只有和它所测的题目放在一起才有意义。针对您的产品,验收时会用您自己的零部件跑同一套方法:参考答案由您的专家确认,合格线在测试开始前商定。
同一套方法也适用于出口管制编码判定吗?
这些检查本身就写明要把两者分开:把HS规则套到出口管制问题上,就是不通过。出口管制测试需要自己的参考答案和法律依据,并在运行前固定。
结果过不过,由谁决定?
由人决定。AI帮忙提取事实、标出问题,这些备注都标为AI辅助。在我们自己的运行中,由我们的测试负责人认定测试题是否合格、裁决争议,并对照运行前设定的合格线签字确认。在验收阶段用您的零部件测试时,由您的专家签字。