CoLFIS is a lexical database of written Italian, with the following features: it is based on a balanced corpus of over 3 millions words, reflecting the reading habits of the Italian population as inferred by ISTAT data; the lexical data are fully lemmatized and part-of-speech annotated; it provides a frequency lexicon/dictionary for both lemmas (“lemmario”) and forms (“formario”). CoLFIS was realized by a research teams including Pier Marco Bertinetto (Scuola Normale Superiore, Pisa), Cristina Burani (Istituto di Scienze e Tecnologie della Cognizione, CNR, Roma), Alessandro Laudanna (Università di Salerno), Lucia Marconi - Daniela Ratti - Claudia Rolando (Istituto di Linguistica Computazionale, Unità Staccata di Genova, CNR, Genova), Anna Maria Thornton (Università de L’Aquila).
CoLFIS è una banca dati lessicale dell’Italiano scritto, con le seguenti caratteristiche salienti: si basa su un corpus bilanciato di oltre 3 milioni di parole, che rispecchia le tendenze di lettura degli italiani desunte da dati ISTAT; i dati lessicali estratti dal corpus sono compiutamente lemmatizzati e annotati rispetto alle parti del discorso; fornisce, a partire da questo corpus, un lessico/dizionario di frequenza sia per i lemmi (lemmario) sia per le forme (formario), anche inversi. CoLFIS è stato realizzato da un gruppo di lavoro coordinato da Pier Marco Bertinetto (Scuola Normale Superiore, Pisa), Cristina Burani (Istituto di Scienze e Tecnologie della Cognizione, CNR, Roma), Alessandro Laudanna (Università di Salerno), Lucia Marconi - Daniela Ratti - Claudia Rolando (Istituto di Linguistica Computazionale, Unità Staccata di Genova, CNR, Genova), Anna Maria Thornton (Università de L’Aquila).
Corpus e Lessico di Frequenza dell'Italiano Scritto (CoLFIS)
BERTINETTO, Pier Marco;
2005
Abstract
CoLFIS is a lexical database of written Italian, with the following features: it is based on a balanced corpus of over 3 millions words, reflecting the reading habits of the Italian population as inferred by ISTAT data; the lexical data are fully lemmatized and part-of-speech annotated; it provides a frequency lexicon/dictionary for both lemmas (“lemmario”) and forms (“formario”). CoLFIS was realized by a research teams including Pier Marco Bertinetto (Scuola Normale Superiore, Pisa), Cristina Burani (Istituto di Scienze e Tecnologie della Cognizione, CNR, Roma), Alessandro Laudanna (Università di Salerno), Lucia Marconi - Daniela Ratti - Claudia Rolando (Istituto di Linguistica Computazionale, Unità Staccata di Genova, CNR, Genova), Anna Maria Thornton (Università de L’Aquila).I documenti in IRIS sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.



