CoLFIS is a lexical database of written Italian, with the following features: it is based on a balanced corpus of over 3 millions words, reflecting the reading habits of the Italian population as inferred by ISTAT data; the lexical data are fully lemmatized and part-of-speech annotated; it provides a frequency lexicon/dictionary for both lemmas (“lemmario”) and forms (“formario”). CoLFIS was realized by a research teams including Pier Marco Bertinetto (Scuola Normale Superiore, Pisa), Cristina Burani (Istituto di Scienze e Tecnologie della Cognizione, CNR, Roma), Alessandro Laudanna (Università di Salerno), Lucia Marconi - Daniela Ratti - Claudia Rolando (Istituto di Linguistica Computazionale, Unità Staccata di Genova, CNR, Genova), Anna Maria Thornton (Università de L’Aquila).

CoLFIS è una banca dati lessicale dell’Italiano scritto, con le seguenti caratteristiche salienti: si basa su un corpus bilanciato di oltre 3 milioni di parole, che rispecchia le tendenze di lettura degli italiani desunte da dati ISTAT; i dati lessicali estratti dal corpus sono compiutamente lemmatizzati e annotati rispetto alle parti del discorso; fornisce, a partire da questo corpus, un lessico/dizionario di frequenza sia per i lemmi (lemmario) sia per le forme (formario), anche inversi. CoLFIS è stato realizzato da un gruppo di lavoro coordinato da Pier Marco Bertinetto (Scuola Normale Superiore, Pisa), Cristina Burani (Istituto di Scienze e Tecnologie della Cognizione, CNR, Roma), Alessandro Laudanna (Università di Salerno), Lucia Marconi - Daniela Ratti - Claudia Rolando (Istituto di Linguistica Computazionale, Unità Staccata di Genova, CNR, Genova), Anna Maria Thornton (Università de L’Aquila).

Corpus e Lessico di Frequenza dell'Italiano Scritto (CoLFIS)

BERTINETTO, Pier Marco;
2005

Abstract

CoLFIS is a lexical database of written Italian, with the following features: it is based on a balanced corpus of over 3 millions words, reflecting the reading habits of the Italian population as inferred by ISTAT data; the lexical data are fully lemmatized and part-of-speech annotated; it provides a frequency lexicon/dictionary for both lemmas (“lemmario”) and forms (“formario”). CoLFIS was realized by a research teams including Pier Marco Bertinetto (Scuola Normale Superiore, Pisa), Cristina Burani (Istituto di Scienze e Tecnologie della Cognizione, CNR, Roma), Alessandro Laudanna (Università di Salerno), Lucia Marconi - Daniela Ratti - Claudia Rolando (Istituto di Linguistica Computazionale, Unità Staccata di Genova, CNR, Genova), Anna Maria Thornton (Università de L’Aquila).
2005
Settore L-LIN/01 - Glottologia e Linguistica
Settore GLOT-01/A - Glottologia e linguistica
File in questo prodotto:
Non ci sono file associati a questo prodotto.

I documenti in IRIS sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/11384/5677
Citazioni
  • ???jsp.display-item.citation.pmc??? ND
  • Scopus ND
  • ???jsp.display-item.citation.isi??? ND
  • OpenAlex ND
social impact