Homelab · RAG + NotebookLM locale per documenti voluminosi
→ Decidere se si parte col perimetro ridotto (vault, informatica, libri di studio: circa 15 GB) e installare lo stack scelto il 02/08.
Un motore di ricerca semantica sui documenti di casa, per poterci chattare sopra. Valutazione consegnata il 02/08 con censimento misurato: 11.453 file e 62,3 GB, ma solo circa 20 GB sono testo vero; 7.384 PDF di cui il 32,7% scansionati, cioe senza testo dentro. Sull'archivio…
▸ continua a leggere (320 parole)▾ richiudi il diario
Un motore di ricerca semantica sui documenti di casa, per poterci chattare sopra. Valutazione consegnata il 02/08 con censimento misurato: 11.453 file e 62,3 GB, ma solo circa 20 GB sono testo vero; 7.384 PDF di cui il 32,7% scansionati, cioe senza testo dentro. Sull'archivio intero servono 8-12 ore di calcolo su CPU; col perimetro ridotto si scende a poche ore. --- diario --- [era in «prossima azione»] VALUTAZIONE FATTA il 02-08 (anello 7): scheda VALUTAZIONE_STACK_RAG_2026-08-02.md nel vault, con censimento documenti misurato (11.453 file, 62,3 GB, ma solo ~20 GB sono testo vero: manga, enciclopedie illustrate e 11,4 GB di cestino restano fuori) e sei decisioni motivate. Correggo il piano di giugno su tre punti: embedder multilingue (bge-m3, non nomic-embed-text: il vault e' in italiano e la dimensione del vettore non si cambia senza reindicizzare tutto), primo carico con script Python e non n8n (n8n principale e' in cloud e non vede i dischi), perimetro ridotto a tre collezioni (vault, informatica, libri_studio). Vector store: Qdrant, per l'MCP ufficiale verso gli agenti. Aperta q048 per l'OK a installare i 3 container. PROSSIMA AZIONE: se q048=A, tappa 1 = test A/B cieco fra bge-m3 e embeddinggemma su ~200 documenti e 20 domande di Ettore, poi accendere lo stack e indicizzare il vault per primo. Se q048=C, preparare comunque gli script di estrazione senza installare nulla. ex 'large documents'. 02-08 (anello 7): censimento documenti + valutazione stack consegnati in MD_DB_v1\01_SISTEMA_PERSONALE_homelab\Notebook_LM_Locale\ (censimento_documenti.ps1, misura_corpus.py, VALUTAZIONE_STACK_RAG_2026-08-02.md, out/). MISURATO: 7.384 PDF + 262 EPUB, ~589.000 pagine, il 32,7% dei PDF e' scansionato (niente testo), ~379.000 chunk per l'archivio intero = 8-12 ore di calcolo su CPU, indice 1,1-1,45 GB. Col perimetro ridotto (vault + informatica + libri_studio) si scende a ~150.000 chunk. Macchina: i7-1280P 20 thread, 31,7 GB RAM, Docker 15,5 GB, NESSUNA GPU utile -> LLM di risposta in cloud, embeddings su CPU. Segnalato a parte: 665 documenti per 11,4 GB nel cestino del disco E.
- nessun sottotask — aggiungine uno qui sotto
da definire
Obiettivo: chiedere qualcosa ai propri documenti e ricevere la risposta con la citazione del file. Criterio di fatto: una domanda su un libro o una scheda del vault ottiene un passaggio giusto, con il file da cui viene. Dove:…
▸ continua a leggere (87 parole)▾ richiudi il diario
Obiettivo: chiedere qualcosa ai propri documenti e ricevere la risposta con la citazione del file. Criterio di fatto: una domanda su un libro o una scheda del vault ottiene un passaggio giusto, con il file da cui viene. Dove: MD_DB_v1\01_SISTEMA_PERSONALE_homelab\Notebook_LM_Locale\ (censimento, misura del corpus e VALUTAZIONE_STACK_RAG_2026-08-02.md). Gia provato: censimento e valutazione con sei decisioni motivate; corretto il piano di giugno su tre punti, fra cui l'embedder multilingue (il vault e in italiano, e la dimensione del vettore non si cambia senza rifare tutto l'indice). Nessun componente installato.
da definire
da definire