抽著抽著,標準自己會漂
7eebe45^..2e07e87 ↗
同一套規範,AI 抽第一章跟抽第二十章,抽出來的密度不一樣。而且這件事讀不出來,每一章單獨看都像模像樣。
AbstractUnder the same spec, the AI extracts chapter one and chapter twenty at different densities. You cannot see it by reading. Every chapter looks fine on its own.
那時候在想什麼
一章一章抽下去,會遇到一個問題:標準會漂。
同一套規範,AI 抽第一章跟抽第二十章,抽出來的密度不一樣。而且這件事讀不出來,每一章單獨看都像模像樣。
我是量出來的。
實際做了什麼
判準是每一百段原文抽出幾條事件。有了那個數字之後,前面幾章的問題就浮出來了。
第一章原本四十二條,回填之後七十六條。第二到第九章補了三百九十條,前後段的密度才拉平。
漂移還有另一個方向。上一章的產出會成為下一章的參照,於是愈抽愈多,密度自己餵養自己。
所以除了錨之外還要有停機條件。待回填的掛帳太多就停下來,不要再往前抽。
抽取這件事到後來變成兩個角色在對打,一邊是抽取者,一邊是批評者,批評者專門去挑抽取者的漏。那個設計不是一開始就有的,是抽到一半發現非有不可。
試過但沒留下
停機門檻按章長正規化。
長的章節本來就會抽出比較多東西,所以我原本想按章長去調那個門檻。量完之後發現不對。
那一條我寫進版控了,標成一個負面的量測。
結論
被後章推翻的關係,我不刪掉。
金庸的書裡這種事很多,一段關係到後面被翻案。我保留舊的那一條,標上 supersededBy,指向推翻它的那一條。
那跟我在奇門遁甲那邊做的是同一件事,異說並列,不代為擇一。
至於為什麼連失敗的嘗試也要寫進版控,理由很簡單。
免得下次又走同一條路。