Model reference · open weights

manaca

Available as managed deployment LLMs menezesbruno · community Text gen 1 variants 1k dl/mo

manaca is an open-weight language model from menezesbruno. AxForge deploys and operates it for you on dedicated EU-owned hardware — with the licence handled where one is required.

Available as managed deployment — configured and operated for you on dedicated EU hardware, quoted per deployment.

What it is

Released bymenezesbruno
TypeLanguage models
TaskText gen
Parameters (lead)1.7B
Context4k tokens
Runs withtransformers
Released2026-08-30
Popularity1k downloads / month
LicenceOpen weights

About

What manaca is

🇧🇷 Português · 🇬🇧 English

Manacá-1B é um modelo de linguagem decoder-only de ~1,72 bilhão de parâmetros, treinado do zero para o português do Brasil. Modelo base (pré-treinado, sem ajuste de instrução). Manacá-1B is a ~1.72B-parameter decoder-only language model trained from scratch for Brazilian Portuguese. This is a base (pretrained, non-instruction-tuned) model.

  • Código, logs e pipeline reprodutível | Code, logs, and reproducible pipeline: https://github.com/Instituto-IA-LNCC/manaca-1b-base
  • Cooperação | Cooperation: LNCC (Instituto de IA) × NII/LLM-jp

Read the full model card

Português

Descrição do modelo

Manacá-1B é um transformer decoder-only no estilo Llama-3, treinado do zero para o português do Brasil com um pipeline totalmente containerizado e reprodutível. É um modelo base: aprendeu a modelar a língua por pré-treino, mas não passou por ajuste de instrução (SFT) nem alinhamento (DPO/RLHF). Ele completa e continua texto; não segue instruções nem conversa.

ItemValor
Parâmetros1.722.951.680 (~1,72B)
Camadas / dim / FFN24 / 2048 / 8192 (SwiGLU)
Cabeças / grupos KV / head dim32 / 8 (GQA) / 64
Posição / norma / biasRoPE (θ=500000) / RMSNorm (eps 1e-5) / bias em todas as lineares
Embeddingsdesamarradas (entrada e saída separadas)
Contexto / precisão4096 / bfloat16
Vocabulário64.000 (padded para 64.128)
FrameworkMegatron-LM (fork LLM-jp), otimizador distribuído
Referência de arquiteturaLLM-jp-3.1-1.8B

Tokenizador (leia isto)

O tokenizador é um SentencePiece unigram de 64k com a normalização nmt_nfkc_cf (NFKC + case folding). O modelo é lowercase por construção: o texto de entrada é normalizado para minúsculas antes da segmentação. Os arquivos de tokenizador publicados aqui já incluem a correção que reproduz exatamente a tokenização de treino (normalizador Sequence([NFKC, Lowercase])). Use sempre o AutoTokenizer deste repositório; um tokenizador sem esse normalizador tokeniza maiúsculas por byte-fallback e degrada os resultados de forma invisível.

Dados de treino

Corpus curado, aberto, de ~20,1B tokens únicos (pré-treino de ~2 épocas ⇒ ~41,9B tokens de atualização, ~24 tokens/parâmetro, próximo do compute-optimal de Chinchilla; repetição até ~4 épocas é quase tão boa quanto dados frescos, Muennighoff et al., 2023).

FonteDomínioTokensLicença
GigaVerbo (TucanoBR) — subamostraWeb geral PT-BR~14,7 B (73,1%)Apache-2.0
Ulysses Tesemõ (USP)Jurídico / legislativo~4,8 B (23,9%)Domínio público
Wikipedia-pt (2023-11)Enciclopédico~0,6 B (3,1%)CC BY-SA 4.0

Detalhes de treino

20.000 passos, batch global 512, sequência 4096. Adam (β 0,9/0,999, ε 1e-8), weight decay 0,1, clip de gradiente 1,0, learning rate 3e-4 → 3e-5 (cosseno, warmup de 2.000), z-loss, bf16, recompute full, seed 1234. Treinado em 2 GPUs de 24 GB (sem NVLink) com paralelismo de dados (ZeRO-1). A corrida foi estável: 0 iterações puladas e 0 NaN; loss de treino 11,41 → 2,48; loss de validação 2,07 nats.

Avaliação

Acurácia (%) em quatro benchmarks de português, mesmo harness. CALAME-PT por geração da última palavra; ARC-Challenge-PT (25-shot), HellaSwag-PT (10-shot) e LAMBADA-PT (0-shot) por log-verossimilhança.

BenchmarkManacá-1BMelhor par sub-7BSabiá-7B
CALAME-PT60,6360,39 (GlórIA-1b3)63,23
LAMBADA-PT45,3137,38 (mGPT-1b3)63,67
HellaSwag-PT41,6148,63 (Tucano-2b4)64,55
ARC-Ch-PT27,1830,85 (Tucano-2b4)46,67

O Manacá-1B é o modelo mais forte abaixo de 7B na predição da última palavra (LAMBADA-PT), empata com os melhores modelos de 1 a 2 B no CALAME-PT, e fica na faixa de acaso em ARC-Challenge-PT (como todo modelo base nessa escala). Detalhes, testes pareados de McNemar e validação do harness no repositório e no preprint.

Uso

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model_id = "menezesbruno/manaca-1b-base"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id, torch_dtype=torch.bfloat16, device_map="auto")

# O modelo é lowercase por construção (o tokenizador normaliza a entrada).
prompt = "a capital do brasil é"
inputs = tok(prompt, return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=40, do_sample=False)
print(tok.decode(out[0], skip_special_tokens=True))

Uso pretendido e limitações

Pesquisa e uso como modelo base para português do Brasil: modelagem de língua, continuação de texto, e ponto de partida para ajuste fino/instrução. Não é um modelo de instrução nem de chat; não segue comandos sem ajuste posterior. É um modelo base de ~1,72B: erra fatos, pode gerar conteúdo incorreto ou enviesado refletindo os dados de treino, e tem raciocínio limitado (próximo do acaso em múltipla escolha). Avalie antes de qualquer uso sensível.


English

Model description

Manacá-1B is a Llama-3-style decoder-only transformer trained from scratch for Brazilian Portuguese with a fully containerized, reproducible pipeline. It is a base model: it learned to model the language through pretraining but has not been instruction-tuned (SFT) or aligned (DPO/RLHF). It completes and continues text; it does not follow instructions or chat.

ItemValue
Parameters1,722,951,680 (~1.72B)
Layers / model dim / FFN24 / 2048 / 8192 (SwiGLU)
Heads / KV groups / head dim32 / 8 (GQA) / 64
Position / norm / biasRoPE (θ=500000) / RMSNorm (eps 1e-5) / all linear layers
Embeddingsuntied (separate input and output)
Context length / precision4096 / bfloat

From the published model card. Full card on the HuggingFace links in the sidebar.

Using it via the API

Call it like any OpenAI endpoint

Once AxForge deploys manaca for you, it answers on the OpenAI-compatible API — the same base URL and keys as every other model. (manaca below is illustrative; you get the exact model name on deployment.)

$ curl -sS https://api.axforge.ai/v1/chat/completions \
  -H "Authorization: Bearer $AXFORGE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"manaca","messages":[{"role":"user","content":"Hello"}]}'

Create an account — your API key is available in the console. 3M free tokens every 30 days with every new account.

© 2026 AxForge · EU-hosted AI infrastructure Pricing Docs Trust Privacy Terms