同一個方法,第二份資料,前兩名對調了

上一篇說「螺絲比較常見的問題是鬆掉」,依據是 24 則消費品召回。 這一篇把同一套判準搬到第二份資料上,看它站不站得住。
閱讀約 6 分鐘。

站不住。前兩名對調了。

消費品(CPSC,n=24):鬆脫 45.8%、斷裂 33.3%。
醫療器材(openFDA,n=477):斷裂 49.3%、鬆脫 22.0%
鬆脫比例的差異,Fisher 精確檢定 two-sided p=0.012

為什麼要再跑一次

上一篇的結論是從一份資料來的, 而且那一篇自己在「不能下的結論」那一節寫著:不可套到電子業或工業件, 因為 CPSC 管的是消費品。

那句話當時是一個謹慎的但書,不是一個量過的東西。 這一篇是去量它。

第二份資料,以及完全相同的判準

用的是美國 FDA 的醫療器材召回公開介面(openFDA)。 以扣件詞去查 reason_for_recall 欄位, 命中 1 973 則,分兩次全部取回(單次上限 1 000),是完整母體不是樣本

接著套上跟上一篇一模一樣的判準—— 扣件的詞與失效的動詞要在 60 個字元之內——剩 477 則。 分類的規則也照抄,沒有為了這份資料調整過。

結果

同一套判準,兩份資料
公告怎麼寫消費品 n=24醫療器材 n=477
鬆脫45.8%(11)22.0%(105)
斷裂/失效33.3%(8)49.3%(235)
脫落16.7%(4)14.7%(70)
漏裝/裝錯4.2%(1)14.0%(67)

前兩名對調。而脫落那一格兩邊接近(16.7 對 14.7), 這件事本身值得看一眼:它說明兩份資料不是整體被平移,是特定類別在移動。

換十五種數法,方向都一樣

上面那個對調,會不會只是比對式挑得剛好? 所以把判準拆成五種寫法,各配三種距離窗(30、60、100 字元), 總共十五種組合全部重跑一次

  • 已發表的那一組(窗 60)
  • 去掉詞界(regex 的 word boundary)
  • 去掉 fail(它最寬,可能灌水)
  • 去掉 missingstrip
  • 只留鬆脫與斷裂兩類,其餘全部不算

結果:十五種組合裡,消費品那側鬆脫都排第一(44.8% 到 75.0%), 醫材那側斷裂都排第一(38.8% 到 65.1%)。方向一次都沒有翻過來。

⚠️ 但量級動得很大——醫材側命中數從 218 到 598, 消費品側從 12 到 30。 所以能帶走的是「兩邊的排序不同」,不是任何一個百分比。 這一節的百分比用的是「鬆脫對其餘斷裂類」的兩分法, 跟上面表格的四分法切法不同,所以數字會差一點點(50.3 對 49.3),那不是錯。

這不代表「醫材比較容易斷」

兩份資料的差別不只有領域,至少還有三個:

  • 讀的欄位不同。CPSC 讀的是描述、標題與危害欄; FDA 讀的是召回理由欄。兩邊的寫作慣例不一樣。
  • 年份範圍不同。CPSC 那批是 2023 到 2026; FDA 取回的那 1 000 則落在 2003 到 2025。
  • 通報制度不同。什麼程度要通報、由誰寫、寫多細,兩個體系不一樣。

混淆因子沒有排除,所以這一頁不宣稱原因。 能說的是:同一套判準在兩份資料上給出不同的排序, 因此上一篇那個排序不能當成扣件的普遍性質。

本站沒有把握的部分

更正(同日稍晚):本頁原本只取回 1 973 則裡的前 1 000 則, 並在這裡標明無法確認隨機性。後來把剩下的 973 則也取回了, 現在的數字是完整母體,那個疑慮消失。 補齊之後排序沒有變(斷裂仍在前),鬆脫的差異反而更清楚:p 從 0.028 降到 0.012。

n=24 很小。p=0.012 仍然建立在消費品那側只有 24 則之上, 消費品那一側樣本再大一點,結論可能就會變。 請把這一頁讀成「上一篇的結論不穩」, 不要讀成「已經確定兩個產業不一樣」。

1 000 則裡有一則的日期欄位是 0013-11-26,明顯是壞資料; 沒有剔除,因為它不影響分類。 本頁不寫醫材法規、不寫 FDA 的召回分級、不點名任何廠商。

接下來做的事:這兩篇的分類都是本站用關鍵字判的。 第三篇改用主管機關自己填的根本原因欄位, 紀錄上最常寫的是「設計」—— 扣件組 35.8%,同批對照組 13.8%(完整母體)。

對指定扣件的人,剩下什麼是能用的

兩份資料都同意的只有一件事:鬆脫與斷裂都是前兩名,加起來都佔七成上下。 誰第一則取決於你在看哪一個產業。

所以實務上的用法不是背哪一個排第一,是 在自己的應用裡先問哪一種比較貴會鬆的接頭會斷的接頭 要的對策不一樣,而且擋掉其中一種的做法通常不會順便擋掉另一種。

這一篇不屬於六步中的任何一步。它橫跨各步,或者發生在組裝之後。導致它的那些決定是在哪裡做的,見指定一顆螺絲,那篇寫的是順序,以及為什麼順序做反了是重工。

常見問題

所以上一篇是錯的嗎?

不是錯,是範圍比原本寫的還要窄。上一篇的數字在 CPSC 那份資料上仍然成立,而它自己也標了「不可套到電子業或工業件」。這一篇把那句但書從謹慎變成量過的:換一份資料,前兩名就對調。

為什麼不多抓一些 CPSC 的資料把 n 變大?

CPSC 那一批已經是 2023 到 2026 的全部召回(1 458 則),扣件被寫成原因的就只有 24 則。要把 n 變大得往更早的年份取,而那會讓兩份資料的年份範圍更不一致。這一頁選擇把 n 小這件事寫出來,而不是用擴張樣本去掩蓋它。

醫材的樣本有 236 則,是不是比較可信?

在統計上比較穩,但它有自己的問題:那 236 則是從 1 973 則裡取回的前 1 000 則篩出來的,而本站沒有指定排序,所以不能確認是隨機樣本。兩份資料各有各的弱點,這一頁把兩邊的弱點都寫出來了。

參考資料

兩份資料都用同一套判準:扣件詞與失效動詞相距 60 字元內,再依公告自己的用語分類。✅ FDA 側為完整母體 1 973 則(分兩次取回),非抽樣。⚠️ 兩份資料在欄位、年份範圍與通報制度上都不同,混淆因子未排除,因此本頁不宣稱原因。Fisher 精確檢定為本站自行計算。

詢價

不確定你的接頭比較怕鬆還是比較怕斷? 把使用條件告訴我們——會不會拆、拆幾次、有沒有振動、溫度怎麼走, 那幾件事會決定往哪一邊做。 M6 以下的成型、品檢與包裝在廠內,1994 年做到現在。

詢價

告訴我們品項與數量,我們會回覆可行性、交期與價格。

送出後會開啟您的郵件軟體,內容已經填好。

或直接來信 sales@tigerfasteners.com