Specifiche Pipeline AI & RAG
Framework di orchestrazione per agenti generativi e predittivi.
1. Panoramica
La pipeline di Intelligenza Artificiale di WebGravity è interamente autonoma. Utilizza Large Language Models (LLM) locali tramite Ollama su infrastruttura Linux specializzata, potenziati da un sistema RAG (Retrieval-Augmented Generation) in tempo reale per elaborare i dati on-chain.
2. Architettura
La pipeline è containerizzata in Docker ed è isolata dal server web del frontend. Si compone del Motore di Inferenza, del Database Vettoriale per la ricerca semantica e del Valutatore di Policy.
3. Componenti
- Ollama Inference Node: Esegue localmente modelli Llama 3 quantizzati, garantendo privacy dei dati e zero limiti di latenza API.
- ChromaDB Vector Store: Memorizza gli embedding del comportamento storico del mercato e le definizioni logiche degli smart contract.
- Signal Generator: Un microservizio Python che fornisce al LLM lo stato in tempo reale e il contesto vettoriale per decidere i vettori di ribilanciamento.
4. Flussi di Esecuzione
- Context Retrieval: Un evento (es. crollo improvviso dei prezzi) attiva la pipeline. Il sistema interroga ChromaDB per scenari storici simili.
- Prompt Injection: Lo stato attuale del mercato e il contesto storico recuperato vengono iniettati nel prompt del LLM.
- Inference: Il LLM produce un JSON strutturato che rappresenta l'allocazione di portafoglio desiderata.
- Validazione: Uno script deterministico convalida il formato JSON prima di passarlo al Relayer Blockchain.
5. Sicurezza
Le "allucinazioni" dell'AI vengono mitigate a livello di confine. L'output del LLM è rigorosamente tipizzato. Se il LLM produce un'allocazione non valida o matematicamente impossibile (es. allocare il 120% dei fondi), il wrapper Python la respinge istantaneamente, impedendo allo scambio di raggiungere la blockchain.
6. Definizioni e Glossario
- RAG (Retrieval-Augmented Generation)
- Una tecnica che ancora le risposte del LLM recuperando fatti rilevanti da un database esterno prima di generare una risposta.
- Ollama
- Un framework per eseguire LLM open source in locale, fornendo un controllo estremo sull'ambiente di inferenza.
- Quantizzazione
- Compressione dei modelli AI (es. da 16-bit a 4-bit) per farli girare in modo efficiente senza enormi requisiti di memoria VRAM (GPU).
7. FAQ Tecniche
Perché usare modelli locali anziché le API di OpenAI?
I modelli locali garantiscono il 100% di uptime indipendentemente dai limiti API esterni, assicurano la privacy completa degli algoritmi di trading proprietari e riducono drasticamente i costi di inferenza ad alta frequenza.
Come viene aggiornato il database RAG?
Un cron job di indicizzazione gira ogni 10 minuti, analizzando i nuovi blocchi su Base Mainnet, convertendo le tracce degli scambi in embedding in linguaggio naturale e salvandole in ChromaDB.