Um companheiro de desktop que vive na sua tela.
O Clippy flutua sobre tudo, ouve quando você o chama, pensa com um LLM rodando na sua máquina e responde em voz pt-BR — com uma personalidade sarcástica que você não pediu, mas merece.
Ah, você de novo. O que vamos não resolver hoje?
Por que Clippy?
Porque o seu assistente não precisa mandar a sua voz para um servidor do outro lado do mundo para te responder uma piada ruim.
O cérebro é seu
Palavra-mágica, transcrição (Whisper) e raciocínio (LLM GGUF) rodam local. Nada do seu cérebro sai do seu computador.
Zero contas, zero chaves
Sem OpenAI, sem login, sem assinatura. Baixe um modelo GGUF e pronto — ele já começa a falar demais.
Mora sobre a sua tela
Janela transparente em tela cheia que deixa o clique passar. Fica sobre qualquer app ou jogo sem atrapalhar.
Como funciona
Cinco passos, do silêncio à resposta — o cérebro inteiro na sua máquina.
Acorda
Palavra-mágica “hey jarvis” (openwakeword) ou Ctrl+Shift+Space.
Ouve
Sua fala é transcrita por Whisper, rodando offline.
Pensa
Um LLM GGUF (llama-cpp) gera a resposta, com persona debochada.
Fala
TTS pt-BR responde — e a entidade pulsa no ritmo da própria voz (FFT).
Reage
O overlay 3D anima 8 emoções e segue o seu cursor com os olhos.
O clique passa direto pelo Clippy —
ele está aqui, mas nunca no seu caminho.
Quer mesmo fechar sem salvar? Ousado.
A entidade glassmorphic é arrastável com física de mola (squash & stretch) e nunca rouba o seu clique.
Oito humores, zero filtro
Cada estado tem cor, expressão e gatilho próprios — interpolados suavemente, sem pulos.
Ocioso
Flutuando, esperando você chamar.
Ouvindo
Olhos arregalados, todo atenção.
Pensando
O LLM está cozinhando a resposta.
Falando
Pulsa no ritmo da própria voz.
Assustado
Mouse rápido? Ele foge do ponteiro.
Sonolento
Olhos fechados, modo soneca.
Confuso
Não entendeu absolutamente nada.
Feliz
Você fez carinho. Ele aprovou.
Recursos
Não é uma caixa de texto. É uma entidade com opinião.
Persona sarcástica
Respostas curtas, debochadas e engraçadas, com streaming token a token. Ele ajuda — mas faz questão de te lembrar disso.
Voz com presença
TTS pt-BR + áudio espacial (HRTF): a voz sai de onde ele está. E pulsa em tempo real via análise FFT.
Overlay click-through
setIgnoreMouseEvents deixa seus cliques passarem direto. Ele está lá, mas nunca no caminho.
Personagem 3D vivo
MeshTransmissionMaterial + ContactShadows, eye-tracking suave e 8 expressões proceduralmente animadas.
Contexto do sistema
Sabe seu SO, RAM livre e o app em foco (active-win) — pergunte “como faço X neste programa?”.
Comandos & tray
“abrir youtube”, “abrir calculadora” direto no SO. System tray com modos de performance e auto-launch.
Perguntas frequentes
O que todo mundo pergunta antes de deixar um clipe falante na própria tela.
O Clippy é realmente offline?
O cérebro é: palavra-mágica, Whisper (transcrição) e o LLM rodam 100% na sua máquina, sem nuvem e sem chave de API. O único pedaço que toca a rede é a voz, sintetizada pelo edge-tts da Microsoft — gratuito e sem conta. Um TTS totalmente local está no roadmap.
Preciso de chave de API ou conta paga?
Não. Nada de OpenAI, nada de login, nada de assinatura. Você só precisa baixar um modelo LLM GGUF (ex.: Qwen2.5-Coder) e um modelo Whisper locais.
Ele fica me escutando o tempo todo?
O áudio é processado localmente só para detectar “hey jarvis”. Nada é gravado em disco nem enviado para a nuvem. Quando você termina de falar, o silêncio dispara o processamento — tudo na sua máquina.
Qual modelo de IA devo usar?
Qualquer GGUF compatível com llama.cpp. O padrão de referência é o Qwen2.5-Coder. Aponte os caminhos com as variáveis CLIPPY_LLM_MODEL e CLIPPY_WHISPER_MODEL.
Funciona no macOS e Linux?
Por enquanto o build empacotado é Windows (.exe via electron-builder/NSIS). O código — Electron + Python — é multiplataforma, e builds para macOS/Linux estão no roadmap.
Preciso de uma GPU poderosa?
Ajuda, mas não é obrigatório: com modelos menores dá para rodar em CPU. E há um Low Performance Mode (clique direito) que desliga os efeitos 3D pesados em laptops e GPUs integradas.
Requisitos & instalação
📋 Requisitos
- • Windows (build .exe via electron-builder / NSIS)
- • Python 3.10+ para o backend FastAPI/WebSocket (:8081)
- • Node.js 18+ para o frontend Vite + Electron
- • Microfone para a palavra-mágica e o STT
- • Um modelo LLM GGUF + um Whisper locais
🚀 Rodar em dev
# 1. Backend Python (porta 8081)
pip install -r requirements.txt
python main.py
# 2. Frontend + Electron
npm install
cd client && npm install && cd ..
# 3. Dois terminais em dev:
# A cd client && npm run dev (Vite :5173)
# B npm start (Electron)
# Build do .exe Windows
npm run dist