希臘教父選集 (Patrologia_Graeca)

Patrologiae Cursus Completus, Series Graeca
用語:

00 manual 切割教本

教父學全集(Migne Patrologia Graeca 中譯本)RTF 按作品切割教本 適用於:哈佛神學院教父學全集中譯系列(PG001、PG002……)之 RTF 檔案, 目標:將一整卷(內含多部作品)的 RTF 檔,依「作品」切割成多個獨立 RTF 檔案。

一、前置轉換

1. 先將原始 RTF 轉為純文字以便檢視結構: pandoc -f rtf -t plain 原檔.rtf -o 原檔.txt --wrap=none

2. wc -l 原檔.txt 記下總行數,作為切割後核對總數的基準。

二、找出真正的切割點(作品起始處)

這是全流程中最容易出錯、也最需要人工判讀的一步。 陷阱:直接用關鍵字(例如「序言」)搜尋切割點是不可靠的。這類詞在內文中 大量出現在「引用其他著作的序言」「討論某書序言內容」等語境,並非本文件的 真正分段點。必須先用 grep -n 抓出所有候選出現位置,再逐一檢視上下文, 才能判斷哪一處才是「這一部作品真正開始的地方」。 判斷真正作品起點的特徵: - 該作品的標題單獨成行(例如「聖巴拿巴使徒」),後面緊接「序言」或「古人見證」 等固定體例的段落,而非夾在一段敘述文字中間。 - 常伴隨譯者署名(例如「由 J.-B. 科特勒里翻譯」)、篇章目錄、論題摘要等 該作品獨有的前導材料。 - 卷首目錄(“本卷所含作者與著作目錄”)會列出本卷全部作品名稱,可作為 切割清單的依據,但目錄本身不是切割點,需要往後在正文中找到對應的 真正起始行。 - 每部作品的「考據序言/古人見證」等學術性前言,應與該作品本身歸為 同一檔案(不要切開),因為它是該作品的一部分,而非獨立單元。 注意頁首重複字串:掃描出的 RTF 原稿在每頁常有重複的「頁首」字樣 (例如「羅馬教宗聖革利免一世真跡」在正文中重複出現數十次),這些不是 分段標記,切勿誤判為切割點。真正的切割點通常是「標題+其後接著的 固定體例段落(序言/論題/篇章目錄)」同時出現之處。 書末的「索引」與「目錄」不是作品,應獨立切成最後一個檔案(例如 「10_分析索引與目錄附錄」),不併入任何一部正文作品。

三、確認行號界線

1. 對每個候選切割點,用 sed -n 'START,ENDp' 原檔.txt | head/tail 檢查 起訖是否切在乾淨的位置(不要切斷句子或段落)。

2. 列出全部切割點的行號範圍表,前後相鄰。

四、執行切割

sed -n '起,迄p' 原檔.txt > 作品名.txt 逐一產生各作品的 txt 檔。 核對總數:切割後所有檔案行數加總,必須等於原始檔案的總行數 (cat 切割後所有檔案 | wc -l 應與 wc -l 原檔.txt 相同)。若不相符, 代表切割界線有重疊或遺漏,須重新檢查。

五、轉回 RTF(關鍵易錯點)

pandoc -f markdown -t rtf 作品名.txt -o 作品名.rtf --wrap=none --standalone 務必加上 --standalone。若省略此參數,pandoc 只會輸出內文段落 ({\pard ... \par} 區塊),缺少開頭的 {\rtf1\ansi\deff0{\fonttbl...}} 標頭與結尾的 }。這樣的檔案在多數軟體(Word、TextEdit 等)中會直接 顯示為亂碼或無法開啟,因為它不是一份完整、合法的 RTF 檔案。 轉換後可用以下方式快速驗證: head -c 150 作品名.rtf # 應以 {\rtf1\ansi\deff0{\fonttbl... 開頭 tail -c 50 作品名.rtf # 應以單獨一個 } 結尾

六、輸出與交付

1. 將所有 RTF 檔複製到指定輸出資料夾(例如 PG001、PG002)。

2. 用 present_files 一次性呈現整批檔案給使用者。

3. 簡述切割依據(依作品標題切,而非依關鍵字),並列出各檔案對應的 作品名稱,方便使用者核對。

七、常見錯誤總結

錯誤 原因 對策

切割點誤判

只用關鍵字搜尋,未檢視上下文 逐一核對候選行的前後文

誤把頁首當標題

RTF 掃描稿頁首會重複出現 找「標題+固定體例段落」同時出現處

轉出 RTF 亂碼

pandoc 缺少 --standalone 務必加上該參數並驗證頭尾

切割後總行數不符

界線重疊或遺漏 加總比對原檔行數

索引/目錄誤併入正文

未區分書末附錄與正文作品 索引目錄獨立成檔