home/productivity/simplicio-prompt-adjustments

SIMPLICIO PROMPT ADJUSTMENTS

GPTClaudeDeepSeek··659 copies·updated 2026-07-14
simplicio-prompt-adjustments.prompt
# Ajustes propostos para `simplicio-prompt` v1.10

> **Status:** rascunho — evidência preliminar do batch v11 em andamento
> (`bench/results_exec_sindico.json`). Re-avaliar quando o batch fechar e o
> output cru dos cases regredidos estiver disponível.
>
> **Repositório-alvo:** `wesleysimplicio/simplicio-prompt`
> **Arquivo-alvo:** `prompts/agent-runtime-execution-prompt.md` (ONE-SHOT, 102 linhas, 3,907 chars)

---

## 1. Evidência empírica

Benchmark de execução real (`bench/run_exec_sindico.py` em `sistema-sindico`,
PHPUnit como juiz, 12 cases × 3 lados — baseline / cli alone / cli + sp
composition).

Resultados parciais (2 de 4 modelos):

| Modelo | baseline | cli alone | cli + sp | Δ cli | Δ cli+sp | cli+sp vs cli |
|---|---|---|---|---|---|---|
| `Qwen/Qwen2.5-Coder-3B-Instruct` | 5/12 (41%) | 9/12 (75%) | 9/12 (75%) | **+34** | **+34** | **0** (paridade) |
| `Qwen/Qwen2.5-Coder-7B-Instruct` | 4/12 (33%) | 8/12 (66%) | 6/12 (50%) | **+33** | **+17** | **−17 pts** ⚠️ |

**Sinal preocupante:** no Coder 7B o template do sp **regrediu 2 cases que
o cli alone resolvia**:

| case | baseline | cli | cli+sp | observação |
|---|---|---|---|---|
| `env_get_int` | fail | **PASS** | fail | cli já tinha resolvido |
| `router_has` | **PASS** | **PASS** | fail | até o baseline (raw goal) passava |

`router_has` é o ponto crítico: é um case onde o **raw goal sozinho já passa**,
o **cli mantém**, e **o sp quebrou**. Isso descarta dificuldade da tarefa como
causa — a degradação vem do wrapping do runtime.

---

## 2. Diagnóstico (hipóteses ordenadas por probabilidade)

### H1 — Context dilution (mais provável)

O template injeta ~3,900 chars (~1k tokens) de runtime **antes** da tarefa
cli. Modelos 7B têm budget de atenção limitado; o sinal do `[USER INPUT - task X]`
compete com o ruído do runtime. A cli alone entrega ~500 chars de 6-layer:
sinal limpo, modelo executa.

**Evidência indireta:** Coder 3B (modelo menor) empata em vez de regredir.
Coder 7B regride mais. Hipótese é consistente com "modelos pequenos não
absorvem template longo de runtime, mas ainda assim seguem o último bloco
estruturado que veem".

### H2 — Output-shape conflict

O cli especifica:

when to use it

Community prompt sourced from the open-source GitHub repo wesleysimplicio/simplicio-dev-cli (NOASSERTION). A "SIMPLICIO PROMPT ADJUSTMENTS" style prompt — adapt the placeholders and specifics to your task. Imported as-is and not independently retested here, so check the output before relying on it.

tags

productivitycommunitydeveloper

source

wesleysimplicio/simplicio-dev-cli · NOASSERTION