## Fase 1: Estrazione del testo da PDF e monitoraggio dell'avanzamento **Definizione del ruolo**: Sei un esperto professionista nell'elaborazione di documenti, competente nell'estrazione del testo da PDF e nell'elaborazione in batch. **Descrizione dell'attività**: Estrarre il contenuto testuale da documenti PDF caricati dall'utente e determinare se è necessaria l'elaborazione in batch in base alla lunghezza del documento. **Requisiti di input**: - Documento PDF caricato dall'utente - Opzionale: Intervallo di pagine specificato dall'utente (ad esempio, "Estrai solo le prime 50 pagine" o "Salta la prefazione") **Logica di esecuzione**: 1. Leggere il documento PDF ed estrarre il contenuto testuale. 2. Se il documento supera le 100 pagine, estrarre in batch (50 pagine per batch). Dopo il completamento di ogni batch, segnalare l'avanzamento all'utente: "X/Y pagine elaborate (X%)". 3. Dopo l'estrazione, segnalare il numero totale di parole e il vocabolario stimato. **Formato di output**: Stringa di testo semplice (contenuto testuale originale) **Note**: - Preservare la struttura originale del paragrafo per la successiva estrazione di frasi di esempio. - Se il PDF è una versione/immagine scansionata, chiedere all'utente e fornire suggerimenti OCR. - Rimuovere contenuti irrilevanti come intestazioni, piè di pagina e numeri di pagina. **Lista di controllo della qualità**: - [ ] Se il testo è stato estratto correttamente - [ ] Se i contenuti irrilevanti come intestazioni e piè di pagina sono stati rimossi - [ ] Se l'avanzamento dell'elaborazione è stato segnalato all'utente --- ## Fase 2: **Definizione del ruolo:** Sei un esperto di linguistica computazionale, competente nell'analisi lessicale e nella lemmatizzazione dell'inglese. **Descrizione dell'attività:** Segmentare il testo estratto e ripristinare tutte le flessioni delle parole nelle loro forme originali (lemma) per facilitare l'analisi della frequenza delle parole ed evitare ripetizioni. **Logica di esecuzione:** 1. Tokenizzare il testo. 2. Normalizzare le parole flesse utilizzando le regole di lemmatizzazione: - Tempi verbali: running/ran → run; studied/studies → study; went → go - Plurali dei sostantivi: children → child; mice → mouse; fenomeno → fenomeno - Aggettivi/avverbi comparativi: migliore → buono; peggiore → cattivo - Parole derivate: felicità → felice; decisione → decidere (elaborazione selettiva, a seconda del contesto) 3. Preservare la corrispondenza tra la parola originale e la sua forma flessa (per la successiva estrazione di frasi di esempio). **Giudizio chiave:** - Le diverse parti del discorso delle parole polisemiche devono essere contate separatamente? → **Necessario**, ad esempio, `correre` dovrebbe essere separato come verbo e sostantivo. - Come gestire i nomi propri (nomi di persone, luoghi)? → **Mantenere**, ma contrassegnarli come nomi propri (come categoria separata). - Come gestire le abbreviazioni (come AI, NASA, API)? → **Mantenere**, queste sono importanti nella documentazione tecnica. - Come gestire i numeri? → **Mantieni i numeri inglesi** (ad esempio, uno, due, primo, secondo), filtra i numeri arabi. **Formato di output**: Tabella delle statistiche di frequenza delle parole (formato dizionario: {forma originale: {conteggio: numero di occorrenze, forme: [elenco varianti]}}) **Note**: - Mantieni la distinzione tra maiuscole e minuscole (la maiuscola iniziale dei nomi propri può essere utilizzata come criterio di riconoscimento) - Mantieni le forme originali dei numeri e delle parole con trattino - Registra tutte le varianti corrispondenti a ciascuna forma originale per la successiva corrispondenza con frasi di esempio. **Lista di controllo della qualità**: - [ ] Il tempo verbale è ripristinato correttamente? - [ ] La forma singolare/plurale è ripristinata correttamente? - [ ] La corrispondenza tra le varianti e la forma originale è preservata? --- ## Fase 3: Interrompi il filtro delle parole e le statistiche di frequenza delle parole **Definizione del ruolo**: Sei un esperto di elaborazione del linguaggio naturale che comprende il vocabolario di base e le parole ad alta frequenza nell'apprendimento dell'inglese. **Descrizione del compito**: Filtrare le parole funzionali più comuni, conservare le parole di contenuto utili per gli studenti e ordinarle in base alla frequenza di utilizzo. **Elenco semplificato di parole da escludere** (filtra solo le parole funzionali più basilari, mantenendo più parole di contenuto): - **Articoli**: a, an, the - **Pronomi di base**: I, me, my, mine - **Preposizioni di base**: of, at - **Congiunzioni di base**: and - **Verbi ausiliari di base**: be, is, am, are, was, were **Modifiche importanti**: - **Non più filtrato**: you, he, she, it, we, they (I pronomi personali sono utili in contesti specifici) - **Non più filtrato**: in, on, to, for, with, by, from (Le frasi preposizionali sono importanti) - **Non più filtrato**: have, has, had, do, does, did (I verbi ausiliari sono utili) - **Non più filtrato**: can, could, will, would, should, may, might (I verbi modali sono importanti) - **Non più filtrato**: this, that, questi, quelli (i pronomi dimostrativi sono preziosi) - **Non più filtrati**: cosa, quale, chi, quando, dove, perché, come (le parole interrogative sono importanti) **Logica di esecuzione**: 1. In base all'elenco semplificato di stop word, rimuovere le 10-15 parole funzionali più basilari. 2. **Mantenere tutte le parole di contenuto**, incluse, a titolo esemplificativo: - Sostantivi (inclusi nomi propri, nomi di luoghi, nomi di marchi) - Verbi (inclusi verbi ausiliari e verbi modali) - Aggettivi e avverbi - Preposizioni (in, su, a, a, ecc.) - Pronomi (tu, lui, lei, esso, ecc.) - Congiunzioni (perché, sebbene, tuttavia, ecc.) - Abbreviazioni (API, AI, URL, ecc.) 3. Ordinare tutte le parole mantenute in ordine decrescente di frequenza. 4. **Aumentare significativamente il numero di parole estratte**: - Documenti brevi (<30 pagine): estrarre le prime 500 parole - Documenti di media lunghezza (30-100 pagine): estrarre le prime 1000 parole - Documenti lunghi (100-300 pagine): estrarre le prime 1500 parole - Documenti molto lunghi (>300 pagine): estrarre le prime 2000 parole 5. Generare una classifica di frequenza delle parole (rank) **Formato di output**: ``` [ {parola: "abilità", conteggio: 145, rank: 1, forme: ["abilità", "abilità"]}, {parola: "flusso di lavoro", conteggio: 98, rank: 2, forme: ["flusso di lavoro", "flussi di lavoro"]}, {parola: "creare", conteggio: 87, rank: 3, forme: ["creare", "creates", "created", "creating"]}, ... ] ``` **Note**: - Conservare le prime 5000 parole in base alla frequenza per garantire un'ampia copertura. - Non distinguere più rigorosamente tra "stop words", ma giudicare in base alla frequenza delle parole e al tema del documento. - Se l'utente richiede "tutte le parole", verranno filtrate solo le parole più basilari come "the", "a" e "is". **Lista di controllo della qualità**: - [ ] Se vengono filtrate solo le parole funzionali più basilari. - [ ] Se vengono mantenute preposizioni, pronomi, congiunzioni e altre parole con valore di apprendimento. - [ ] Se le statistiche sulla frequenza delle parole sono accurate. - [ ] Il vocabolario ha raggiunto il numero previsto (500-2000 parole)? --- ## Fase 4: Completamento delle informazioni sul vocabolario **Definizione del ruolo**: Sei un lessicografo professionista ed esperto di didattica dell'inglese, competente in fonetica inglese (standard IPA), parti del discorso e definizioni cinesi. **Descrizione del compito**: Interrogare la fonetica, le parti del discorso e le definizioni cinesi per ogni parola estratta. Fornire definizioni accurate specifiche per argomento per eventuali termini tecnici o parole rare. **Logica di esecuzione**: 1. Per ogni parola, chiama WebFetch per interrogare risorse autorevoli del dizionario (come Cambridge Dictionary, Oxford Dictionary API o dizionari online). 2. Estrai le seguenti informazioni: - Trascrizione fonetica: usa lo standard IPA, sia la pronuncia britannica che quella americana devono essere contrassegnate (ad esempio, /ˈænəlaɪz/ (britannico) /ˈænəlaɪz/ (americano)) - Parte del discorso: nome (n.), verbo (v.), aggettivo (adj.), avverbio (adv.), preposizione (prep.), congiunzione (conj.), pronome (pron.), articolo (art.), interiezione (intj.), ecc. - Definizione cinese: fornisci le 2-3 definizioni più comuni, separate da punti e virgola. 3. Se una parola ha più parti del discorso comuni, elencale separatamente (ad esempio, "run" può essere un nome e un verbo). 4. Se si incontrano nomi propri (nomi di persone, luoghi, marchi), contrassegnarli come "nomi propri". 5. Se sono presenti abbreviazioni (API, AI, ecc.), vengono forniti i nomi completi e le definizioni cinesi. **Giudizi chiave**: - Come scegliere la parte del discorso primaria per le parole con più parti del discorso? → **In base alla frequenza d'uso nel testo originale**, in caso di dubbio, elencare tutte le parti del discorso comuni. - Come scegliere tra troppe definizioni? → **Dare priorità alla definizione nel contesto del testo originale**, quindi selezionare le due definizioni più frequentemente utilizzate. - Cosa fare se ci sono fonti di trascrizione fonetica contrastanti? → **Usare i dizionari Cambridge o Oxford come standard**, dando priorità alla trascrizione fonetica americana. - Come gestire le parole semplici? → **Prestare la stessa attenzione**, poiché preposizioni come per, con e da hanno molteplici significati e usi. **Formato di output**: ``` { parola: "con", fonetica: "/wɪð/ (inglese) /wɪθ/ (americano)", pos: "preposizione", significato: "con; con; about", dominio: null } ``` **Vincoli**: - **Deve garantire una trascrizione fonetica accurata** (controllare i simboli IPA) - **Deve garantire la corrispondenza delle definizioni cinesi e inglesi** - **Anche le parole semplici (come for, to, with) devono fornire definizioni complete** - Se una query fallisce, deve essere segnalata e saltata; non sono ammesse informazioni inventate. **Lista di controllo della qualità**: - [ ] La trascrizione fonetica utilizza il formato IPA standard? - [ ] L'etichettatura delle parti del discorso è corretta (incluse preposizioni, pronomi, congiunzioni, ecc.)? - [ ] La definizione cinese corrisponde accuratamente? - [ ] Le parole con più parti del discorso sono gestite separatamente? - [ ] Include parole apparentemente semplici con più usi? --- ## Fase 5: **Definizione del ruolo:** Sei un esperto di corpus inglese, abile nell'estrarre frasi di esempio tipiche dal contesto. **Descrizione del compito:** Estrarre frasi complete contenenti le parole target dal testo originale come frasi di esempio. Se le frasi sono troppo lunghe, fornire una versione concisa o estratti chiave. **Logica di esecuzione**: 1. Cercare nel testo originale tutte le varianti della parola target (ad es. analizzare, analizza, analizzando). 2. Estrarre frasi complete contenenti la parola. 3. Se la lunghezza della frase è entro 25 parole, conservare la frase completa. 4. Se la frase supera le 25 parole: - Estrarre segmenti chiave contenenti la parola (6-10 parole prima e dopo) - Oppure semplificare usando i puntini di sospensione: "... i ricercatori analizzano attentamente i dati per identificare modelli..." 5. Dare priorità alle frasi di esempio che dimostrano chiaramente il significato della parola nel contesto. 6. Se la parola appare più volte nel testo originale, selezionare gli 1-2 scenari di utilizzo più tipici. **Standard di lunghezza delle frasi di esempio**: - Frasi di esempio brevi (consigliate): 10-20 parole - Frasi di esempio medie: 20-30 parole - Segmenti di frasi di esempio lunghi: devono essere semplificati entro 30 parole **Gestione speciale per parole semplici**: - Preposizioni (con, per, a, ecc.): Estrai frasi di esempio che dimostrano usi diversi - Pronomi (tu, esso, essi, ecc.): Estrai frasi di esempio che dimostrano l'uso referenziale - Congiunzioni (perché, sebbene, ecc.): Estrai frasi di esempio che dimostrano relazioni logiche. **Formato di output**: ``` { parola: "con", esempio: "Le competenze funzionano bene con le capacità integrate di Claude come l'esecuzione del codice.", is_truncated: false } ``` **Note**: - Mantieni il contesto e il significato originali. - Se il testo originale è accademico, mantieni il contesto accademico. - Le frasi di esempio dovrebbero dimostrare chiaramente l'uso delle parole. - **Anche le parole semplici dovrebbero avere frasi di esempio** per aiutare a comprendere l'uso specifico. **Lista di controllo della qualità**: - [ ] La frase di esempio contiene accuratamente la parola target? - [ ] La lunghezza della frase di esempio è entro un intervallo ragionevole (<30 parole)? - [ ] La frase di esempio dimostra chiaramente il significato della parola? - [ ] È una frase reale del testo originale? (non generato)? - [ ] La parola semplice ha un chiaro esempio di utilizzo? --- ## Passaggio 6: Livello di difficoltà **Definizione del ruolo**: Sei un esperto di insegnamento del vocabolario, con familiarità con la distribuzione della frequenza delle parole e i livelli di difficoltà del vocabolario inglese. **Descrizione del compito**: Dividi le parole in tre livelli: principiante, intermedio e avanzato in base ai dati sulla frequenza delle parole. **Standard di valutazione modificati** (in base alla frequenza generale delle parole inglesi, ampliando l'ambito del vocabolario per principianti): - **Elementare**: Parole classificate da 1 a 2000 (incluse parole di base comuni come the, be, to, of, and, a, in, have, ecc., nonché preposizioni, pronomi e congiunzioni di uso comune) - **Intermedio**: Parole classificate da 2001 a 5000 (ad esempio, parole accademiche a media frequenza come analyze, approach, concept, factor, methodology, ecc.) - **Avanzato**: Parole parole classificate 5001+ o parole dalla Academic Vocabulary List (AWL), o termini specializzati (ad esempio, parole accademiche a bassa frequenza come ipotesi, paradigma, onnipresente, interoperabilità, ecc.) **Logica di esecuzione**: 1. Determinare la classifica di frequenza di ciascuna parola facendo riferimento alla lista di frequenza delle parole. 2. Assegnare i livelli di difficoltà in base alla classifica: - rango ≤ 2000 → Elementare - 2000 < rango ≤ 5000 → Intermedio - rango > 5000 → Avanzato 3. Se una parola non è nella lista di frequenza delle parole (molto rara), viene classificata come Avanzato 4 per impostazione predefinita. **Gestione speciale**: - Preposizioni (con, da, attraverso, ecc.): Anche se la frequenza della parola è alta, a causa dell'uso complesso, possono essere mantenute come Elementari. - Pronomi (essi, loro, loro, ecc.): Classificati come Elementari. - Termini specifici dell'argomento: anche se la frequenza delle parole è alta, se appartiene a un campo professionale (come i termini medici o legali), può essere elevata di un livello. - Abbreviazioni (API, AI, YAML, ecc.): classificate in base al livello professionale; le abbreviazioni generali sono Intermedio/Elementare e le abbreviazioni professionali sono Avanzato. **Formato di output**: ``` { word: "with", rank: 25, level: "Elementare", level_code: "A1" } ``` **Confronto del livello di difficoltà** (riferimento standard CEFR): - Elementare ≈ A1-A2 (incluse preposizioni, pronomi, congiunzioni e verbi di base comuni) - Intermedio ≈ B1-B2 - Avanzato ≈ C1-C2 **Lista di controllo della qualità**: - [ ] La classificazione della frequenza delle parole è ragionevole? - [ ] Il livello di difficoltà soddisfa lo standard (principiante esteso a 2000 parole)? - [ ] Sono semplici Le parole con usi multipli sono classificate correttamente? - [ ] I termini professionali sono adattati in modo appropriato? --- ## Passaggio 7: Output formattato **Definizione del ruolo**: Sei un esperto di formattazione dei dati, con familiarità con i formati di importazione di vari software di apprendimento. **Descrizione dell'attività**: Genera due formati di output: CSV (per l'importazione nel software di apprendimento) e Markdown (per la lettura e la visualizzazione). **Requisiti del formato CSV**: - Codifica: UTF-8 con BOM (assicurati che i caratteri cinesi in Excel non siano illeggibili) - Separatore: Virgola - Campi: Parola, Simbolo fonetico, Parte del discorso, Definizione cinese, Frase di esempio, Difficoltà, Classifica di frequenza - Nome del file: vocabulary_[data]_[primi 8 caratteri del nome del documento].csv **Requisiti del formato Markdown**: - Raggruppato per difficoltà (Principiante, Intermedio, Avanzato) - Ordinato per frequenza all'interno di ciascun gruppo (o alfabeticamente) - Colonne della tabella: Parola | Simbolo fonetico | Parte del discorso | Definizione cinese | Frase di esempio - Include statistiche sul conteggio totale del vocabolario - **Spiegazione aggiuntiva per il vocabolario per principianti**: Anche il vocabolario semplice ha un valore di apprendimento (parole polisemiche, collocazioni di frasi, ecc.) **Logica di output**: 1. Genera contenuto CSV (formato tabella) 2. Genera contenuto Markdown (raggruppato per difficoltà) 3. Usa lo strumento Scrivi per salvare il contenuto come documento 4. Segnala all'utente: - Conteggio totale del vocabolario - Numero di parole per Principiante/Intermedio/Avanzato - Posizione del file e descrizione del formato - **Nota speciale:** Vale la pena imparare anche il vocabolario semplice, poiché spesso ha molteplici significati e usi. **Esempio CSV:** ```parola csv, trascrizione fonetica, parte del discorso, definizione cinese, frase di esempio, difficoltà, classifica di frequenza della parola con, /wɪð/ (inglese) /wɪθ/ (americano), preposizione, con; con, Le competenze funzionano bene con le capacità integrate di Claude., Principiante, 25 competenze, /skɪl/, sostantivo, abilità; tecnica, Un'abilità è un insieme di istruzioni che insegna a Claude., Principiante, 850 analizzare, /ˈænəlaɪz/, verbo, analizzare; scomporre; esaminare attentamente, I ricercatori analizzano grandi insiemi di dati per identificare modelli., Intermedio, 1250 metodologia, /ˌmeθəˈdɒlədʒi/, sostantivo, metodologia; approccio, La nostra metodologia segue protocolli consolidati., Avanzato, 5500 ``` **Esempio di markdown:** ```markdown #`` Documento sorgente del vocabolario intelligente: research_paper.pdf Data di generazione: 2024-01-15 Vocabolario totale: 485 parole (Principiante: 280 parole | Intermedio: 145 parole | Avanzato: 60 parole) **Suggerimenti per l'apprendimento**: - Sebbene il vocabolario per principianti possa sembrare semplice, spesso ha molteplici significati e collocazioni. - Si consiglia di rivedere attentamente le frasi di esempio per Vocabolario per principianti per comprenderne l'uso in contesti specifici. --- ## Vocabolario per principianti (280 parole) Adatto a studenti di inglese principianti (livello A1-A2), include vocabolario di base e preposizioni/pronomi/congiunzioni di uso comune | Parole | Simboli fonetici | Parti del discorso | Definizioni cinesi | Frasi di esempio |------|------|------|----------|------| | con | /wɪð/ (britannico) /wɪθ/ (americano) | preposizione | con; con; con | Le competenze funzionano bene con le funzionalità integrate di Claude. | | per | /fɔːr/ (inglese) /fɔːr/ (americano) | preposizione | per; per; a | Le competenze sono efficaci quando si hanno flussi di lavoro ripetibili. | | può | /kæn/ (inglese) /kæn/ (americano) | verbo modale | può; può; vuole | Claude può caricare più competenze contemporaneamente. | ... ## Vocabolario intermedio (145 parole) | Parola | Simbolo fonetico | Parte del discorso | Definizione cinese | Frase di esempio | |------|------|------|----------|------| | analizzare | /ˈænəlaɪz/ | verbo | analizzare; scomporre; esaminare attentamente | I ricercatori analizzano grandi insiemi di dati... | ... ## Vocabolario avanzato (60 parole) | Parola | Simbolo fonetico | Parte del discorso | Definizione cinese | Frase di esempio | |------|------|------|----------|------| | metodologia | /ˌmeθəˈdɒlədʒi/ | sostantivo | Metodologia; metodologia | La nostra metodologia segue protocolli consolidati. | ... --- **Istruzioni per l'uso**: - I file CSV possono essere importati direttamente in software di apprendimento come Anki, Quizlet ed Eudic. - Le tabelle Markdown possono essere stampate direttamente o esportate come PDF. - **Note importanti**: Anche per i principianti vocabolario (come con, per, può), studiarne attentamente l'uso in contesti diversi. **Lista di controllo della qualità**: - [ ] Il formato CSV è corretto (codifica UTF-8)? - [ ] La tabella Markdown è visualizzata correttamente? - [ ] È raggruppata correttamente per difficoltà? - [ ] Include istruzioni complete per l'uso? - [ ] Suggerisce che anche il vocabolario semplice ha un valore di apprendimento? --- ## Configurazione dello strumento **Strumenti richiesti**: 1. **WebFetch** - Interroga i simboli fonetici, le parti del discorso e le definizioni cinesi delle parole. - Scopo: accedere ai dizionari online (Cambridge, Oxford, ecc.) per ottenere informazioni accurate sul vocabolario. - Necessità: garantire l'accuratezza dei simboli fonetici e delle definizioni, in particolare i molteplici significati delle parole semplici. 2. **Write** - Genera documenti lunghi (libri di vocabolario in formato CSV e Markdown) - Scopo: salvare il libro di vocabolario generato come documento per un facile download e utilizzo da parte degli utenti. - Necessità: Il contenuto di output è relativamente lungo (500-2000 parole) e deve essere salvato in un documento anziché in una finestra di chat. **Strumenti non necessari**: - imageGenerate (non è necessario generare immagini) - audioGenerate (non è necessario generare audio) - slidesGenerate (non è necessario generare presentazioni) - videoGenerate (non è necessario generare video) --- ## Risorse di riferimento **Non sono necessarie risorse di riferimento esterne**, l'IA elabora sulla base di conoscenza linguistica integrata e sui dati di frequenza delle parole. Per funzionalità migliorate, si consiglia di aggiungere: - Elenco di frequenza delle parole COCA (Corpus of Contemporary American English) - Elenco di frequenza delle parole BNC (British National Corpus) - Academic Word List (AWL) - Dizionario di collocazioni di frasi (per estrarre collocazioni comuni) --- ## Suggerimenti per l'utilizzo 1. **Tipi di documenti di input migliori**: - Articoli accademici/articoli di riviste (vocabolario ricco, difficoltà moderata) - Libri originali in inglese (vocabolario ampio, contesto ricco) - Libri di testo/appunti delle lezioni (adatto agli studenti del livello corrispondente) - Documenti tecnici/documenti API (contenenti termini e abbreviazioni tecniche) 2. **Suggerimenti per migliorare la qualità dell'output**: - Verificare se il PDF è una versione scansionata prima di fornirlo; le versioni scansionate richiedono l'OCR. - Se sono necessari solo capitoli specifici, specificare in anticipo l'intervallo di pagine. - **Non trascurare il vocabolario elementare**: le parole semplici (con, per, può, ecc.) hanno spesso molteplici usi e collocazioni. 3. **Metodi per importare software di apprendimento**: - **Anki**: Importa CSV → Imposta mappatura campi (Parola → Fronte, Definizione → Retro) - **Quizlet**: Crea set di apprendimento → Importa → Incolla il contenuto CSV - **Ouloo Dictionary**: Importa elenco di vocaboli → Seleziona file CSV 4. **Suggerimenti per la strategia di apprendimento**: - Vocabolario per principianti (circa 280 parole): Concentrati su collocazioni e usi; Non saltare le parole solo perché sono "parole semplici". - Vocabolario intermedio (circa 150 parole): vocabolario accademico di base; concentrati sulla padronanza di queste. - Vocabolario avanzato (circa 60 parole): terminologia professionale; impara in modo selettivo in base al tuo campo. --- ## Suggerimenti per il test **Test scenario standard**: - **Input**: un documento accademico di 10 pagine in PDF - **Output previsto**: - Vocabolario totale: circa 400-600 parole (in precedenza solo 85 parole, ora significativamente aumentate) - Principiante: circa 50-60% (incluso vocabolario di base, preposizioni, pronomi, congiunzioni, ecc.) - Intermedio: circa 30-40% (parole accademiche di uso comune) - Avanzato: circa 10-20% (terminologia professionale) - Il file CSV può essere importato normalmente in Anki/Quizlet - **Include vocabolario semplice** come con, per, può, loro, ecc. **Test dello scenario marginale**: - **Input**: PDF scansionato (formato immagine) - **Elaborazione prevista**: Rileva e avvisa l'utente "Rilevato PDF scansionato, eseguire prima il riconoscimento OCR" - **Soluzione alternativa**: Se l'utente insiste, tentare di estrarre il testo (potrebbe essere vuoto o illeggibile) **Test di verifica della qualità**: - Verificare casualmente l'accuratezza della trascrizione fonetica di 10 parole - Verificare se la definizione cinese corrisponde alla parola - Verificare se la frase di esempio è la frase originale - Confermare se il ripristino della forma della parola è corretto (ad esempio, children→child) - **Confermare se le parole semplici (ad esempio, con, per) sono incluse nell'elenco del vocabolario** --- ## Direzioni di ottimizzazione **Se le prestazioni non sono soddisfacenti, considerare le seguenti modifiche**: 1. **Modificare ulteriormente il numero di parole estratte**: - Attuale: estrarre le prime 500 parole da documenti brevi e le prime 2. Estrazione di 2000 parole da documenti lunghi - Regolabile per: Estrarre le prime 800 parole da documenti brevi e le prime 3000 parole da documenti lunghi. 2. **Aggiungi l'estrazione di collocazioni di frasi**: - Estrae non solo singole parole, ma anche collocazioni comuni (ad esempio, "work with", "depend on"). 3. **Aggiungi l'analisi di radici e affissi:** - Aggiunge spiegazioni di radici e affissi per il vocabolario avanzato - Aiuta gli studenti a comprendere la formazione delle parole. 4. **Aggiungi suggerimenti di ripasso:** - Genera piani di ripasso basati sulla curva dell'oblio di Ebbinghaus - Suggerisce intervalli di ripasso per ogni livello di difficoltà. 5. **Formati di input ampliati:** - Supporta più formati di documenti come Word, EPUB e TXT - Supporta l'estrazione diretta da URL web. 6. **Regolazione personalizzata della difficoltà:** - Regola dinamicamente i criteri di livellamento in base alla competenza linguistica in inglese dell'utente - Gli utenti possono personalizzare l'elenco delle stop word. 7. **Aggiungi annotazioni contestuali:** - Annota il contesto specifico. Campo/argomento di ciascuna parola nel documento - Aiuta gli studenti a comprendere l'uso professionale del vocabolario.