01Il rilevamento avviene all’apertura
Un contrassegno di ordine dei byte chiude subito la questione. Senza, il file viene decodificato provando le codifiche plausibili, così un file UTF-8 senza BOM non viene scambiato per Latin-1 per via di un solo byte alto.
02La codifica viaggia con il documento
Non è un’impostazione globale. Due schede possono avere due codifiche, e ciascuna si salva nella propria.
03Reinterpretare rilegge, convertire riscrive
Reinterpretare riprende i byte sul disco e li decodifica di nuovo con la codifica che scegli — il rimedio quando un file si è aperto come qualcos’altro. Convertire cambia ciò che verrà scritto. Solo una delle due modifica il file.
04I fine riga sono un asse a parte
LF, CRLF e CR sono tracciati separatamente dalla codifica e mostrati separatamente, perché i fine riga di un file e il suo insieme di caratteri non hanno nulla a che vedere tra loro.
05Un BOM è una scelta, non un incidente
L’UTF-8 è proposto con e senza contrassegno di ordine dei byte, come due voci distinte, perché per uno script di shell la differenza decide se viene eseguito.
06La sostituzione su cartella eredita tutto questo
Sostituisci nei file decodifica ogni file con la sua codifica e lo riscrive identico, perché una modifica in massa non diventi mai una conversione in massa.