Tekstitiedoston tallentaminen UTF-8-muodossa

Mikäli kieliaineistosi sisältää tekstiä, sen käsitteleminen on tehokkainta, jos aineisto on tallennettu raakatekstinä ja UTF-8-merkistökoodauksella. Tässä neuvotaan, miten se tapahtuu.

 

Word-dokumentin muuntaminen UTF-8-muotoiseksi tekstitiedostoksi

Jos tekstiä sisältävä aineistosi on tallennettu esimerkiksi Word-dokumentteina, voit käsitellä aineistoa vain Wordilla tai sen kanssa yhteensopivilla ohjelmilla. Word-dokumentti ei myöskään ole sellaisenaan arkistointikelpoinen muoto. Kun aineistosi on tallennettu raakatekstitiedostoina (plain text) ja lisäksi UTF-8-merkistökoodauksella, voit avata ja käsitellä tiedostoja tehokkaasti monenlaisilla kätevillä työkaluilla sekä Kielipankissa että sen ulkopuolella.

Raakatekstitiedosto sisältää kuitenkin vain merkkejä. Siihen eivät tallennu esimerkiksi Wordilla tehdyt tekstin asettelut, lihavointi tai kursiivi. Jos tarvitset tekstidokumenteista myös taitetut tai muotoillut versiot ihmisten luettaviksi, tallenna sellaiset erikseen. Pysyvää arkistointia varten taitetuista dokumenteista on syytä tehdä esimerkiksi pdf-muotoisia.

Tarvittaessa myös raakatekstin joukkoon voidaan lisätä erilaisia merkkauksia, joilla osoitetaan, missä kohtaa on vaikkapa kappaleen vaihto tai otsikko. Tällaiset merkkaukset kannattaa tehdä jossakin XML-yhteensopivassa muodossa (esim. TEI/XML), jolloin niitä voidaan ohjelmallisesti hyödyntää.

Jos alkuperäinen tiedosto on tehty Microsoft Word -ohjelmalla tai se on esim. RTF-muotoinen, toimi seuraavasti:

  1. Avaa tiedosto MS Word -ohjelmalla tavalliseen tapaan.
  2. Valitse Save As…
  3. Valitse Format: Plain Text (.txt).
  4. Seuraavassa ikkunassa valitse ylhäältä oikeanpuoleinen pallero Other encoding: ja sen oikealla puolella olevasta listasta ’Unicode 5.0 UTF-8’.
    • Ei rastia kohtaan Insert line breaks
    • End lines with: valitse ’CR only’
    • (Ei rastia kohtaan Allow character substitution)
  5. MS Wordissa avoinna olevaa raakatekstitiedostoa voit toki edelleen jatkokäsitellä esim. Wordin etsi & korvaa-toiminnoilla. Muista tarvittaessa lopuksi varmistaa, että tiedosto on tallennettu (myös) UTF-8-muotoisena. Jos muokattavaa on paljon ja/tai haluat käsitellä vaikkapa hakemistollisen tekstitiedostoja kerrallaan, kannattaa etsi ja korvaa -toiminnot tehdä jollakin paremmin tällaiseen käyttöön suunnitellulla tekstieditorilla.
  6. Eri käyttöjärjestelmiin on tarjolla monia hyviä tekstieditoreja. Ellei koneellasi ole kunnollista tekstieditoria, harkitse sellaisen asentamista mahdollisimman pian.
  7. Windowsissa tallennettua tekstitiedostoa voi hätätilassa tarkastella esim. WordPad-ohjelmalla, mutta WordPadin ominaisuudet eivät ole kummoiset, eivätkä merkitkään välttämättä näy oikein.
    • Windows saattaa oletusarvoisesti avata .txt-päätteisen tiedoston Notepad-ohjelmalla, joka ei osaa käsitellä UTF-8-muotoisia tiedostoja ja näyttää ne yhtenä pötkönä ilman rivinvaihtoja.

 

 

 

Raakatekstitiedoston merkistön muuntaminen iconv-työkalulla (unix)

Miksi tiedostot pitää tallentaa UTF-8-merkistökoodauksella? (Mikä se on? Mikä ihme on Unicode?)

Unicode on kansainvälinen merkistöstandardi, jonka avulla lähes kaikki maailman kielet ja niissä käytetyt erikoismerkit voidaan kuvata yksiselitteisesti ja yhteensopivalla tavalla. Jokaisella Unicode-standardissa määritellyllä merkillä on yksilöllinen koodi. Koodeja on määritelty jopa yli 100 000 erilaiselle merkille. Unicode-standardi on otettu laajasti käyttöön, ja lähes kaikki nykyiset tekstiä prosessoivat sovellusohjelmat tukevat sitä.

UTF-8 on Unicode-standardin 8-bittinen koodaustapa. Se on osittain yhteensopiva niiden vanhempien järjestelmien kanssa, joissa merkkikoodeja käsitellään 8-bittisinä. UTF-8-muotoisen tiedoston sisältämät merkit näyttävät samoilta kaikilla tietokoneilla ja kaikissa käyttöjärjestelmissä, jos tiedostoa käytetään ohjelmalla, joka tukee Unicode-standardia ja UTF-8-tiedostoja. Useimmat nykyiset sovellukset tukevat ainakin UTF-8-merkistökoodausta.

UTF-16 on puolestaan Unicode-merkkien 16-bittinen koodaustapa, jossa jokaista merkkiä kuvataan aina kahden 8 bitin tavun muodostamana parina. UTF-16 on vielä hiukan harvinaisempi kuin UTF-8.

Kaikki Kielipankin tarjoamat työkalut edellyttävät, että käsiteltävät tekstitiedostot ovat UTF-8-muotoisia.

Voit esimerkiksi

UTF-8-muotoisen tiedoston jatkokäsittely: tekstieditorit

  • Niin kielentutkijan kuin ohjelmoijankin tarpeisiin soveltuvia, ilmaisia ja monipuolisia tekstieditoreja ovat esim. Notepad++ (Win), jEdit (Win/Mac/Linux), BBEdit (Mac), monenlaiseen käyttöön mukautuva Emacs (Win/Mac/Linux) tai vielä teknisemmin suuntautuneille Vim (Unix/Linux/Win).
Hae Kielipankki-portaalista:
Kuukauden tutkija: Maija Saviniemi

 

Tulevat tapahtumat

  1. Kurssi: Puheen analyysin perusteet

    28.10.201913.12.2019
  2. Course: Data Clinic 2019-20

    1.11.201917.4.2020

Yhteystiedot

Kielipankin tekninen ylläpito:
kielipankki (ät) csc.fi
p. 09 4572001

Aineistoihin ja muuhun sisältöön liittyvät asiat:
fin-clarin (ät) helsinki.fi
p. 029 4140599 / 029 4129317