Como o teste funciona
O Mensura segue as mesmas bases teóricas dos testes de inteligência modernos: o modelo de habilidades CHC, a Teoria de Resposta ao Item e a aplicação adaptativa. Aqui está o que acontece por trás de cada questão, e também o que ele não é.
O que é medido
O modelo Cattell-Horn-Carroll (CHC) organiza a inteligência em uma capacidade geral (g) e habilidades amplas. O teste tem sete tipos de questão, cada um ligado a uma delas:
| Tipo de questão | Habilidade (CHC) | Paradigma de origem |
|---|---|---|
| Matrizes | Gf, raciocínio indutivo | Matrizes progressivas (Raven) |
| Sequências numéricas | Gf/Gq, indução quantitativa | Séries de números |
| Dedução lógica | Gf, raciocínio sequencial | Silogismos lineares |
| Balanças | Gq, raciocínio quantitativo | Problemas de equilíbrio |
| Rotação mental | Gv, processamento visual | Shepard e Metzler |
| Memória de trabalho | Gwm | Span visuoespacial e dígitos (ordem direta e inversa) |
| Analogias verbais | Gc, conhecimento e raciocínio verbal | Analogias A : B :: C : ? |
Todo teste distribui as questões igualmente entre os sete tipos, então a pontuação final reflete um conjunto amplo de habilidades, e não só um tipo de tarefa.
Por que nenhum teste é igual ao anterior
As questões não vêm de um banco fixo. Cada uma é montada na hora por um gerador (geração automática de itens), a partir de regras cuja dificuldade é conhecida. Numa matriz, por exemplo, a dificuldade cresce com o número de regras atuando ao mesmo tempo e com o tipo de regra: progressões são mais fáceis que distribuições de três valores. Cada questão guarda uma semente aleatória e uma assinatura; o sistema nunca mostra a mesma questão duas vezes para a mesma pessoa.
As alternativas também seguem método. Nas matrizes, as oito opções são combinações de três atributos, cada um com o valor certo ou um valor errado plausível. Assim cada característica aparece em metade das opções, e o truque de "escolher a figura mais parecida com as outras" não funciona.
Como a dificuldade se ajusta a você
O teste é adaptativo. Depois de cada resposta, o sistema reestima sua habilidade e escolhe a próxima questão com a dificuldade que mais informa sobre você naquele ponto. Quem acerta recebe questões mais difíceis; quem erra, mais fáceis. As três primeiras são um pouco mais fáceis, para aquecer. Por isso quase todo mundo acerta entre metade e dois terços das questões, e isso é esperado.
Como a pontuação é calculada
Cada tipo e nível de questão tem parâmetros do modelo logístico de três parâmetros (3PL) da Teoria de Resposta ao Item:
P(acerto | θ) = c + (1 − c) / (1 + e−1,7·a·(θ − b))
- θ é sua habilidade, na escala da população (média 0, desvio 1);
- b é a dificuldade da questão; a, o quanto ela diferencia quem sabe de quem não sabe;
- c é a chance de acertar no chute (1 dividido pelo número de alternativas).
A habilidade é estimada pelo método EAP (esperança a posteriori), que combina todas as respostas com uma distribuição inicial normal. A pontuação mostrada usa a escala tradicional de QI:
pontuação = 100 + 15 · θ
O sistema também calcula o erro padrão da estimativa e mostra o intervalo de 95% de confiança. Ele é mais estreito em testes mais longos.
Precisão
Simulamos milhares de participantes virtuais com habilidade conhecida respondendo segundo o modelo. A diferença típica entre a pontuação estimada e a verdadeira ficou assim:
| Questões | Erro típico (pontos) | Intervalo de 95% |
|---|---|---|
| 20 | 5,2 | ±9 |
| 40 | 3,7 | ±7 |
| 60 | 3,2 | ±5 |
| 100 | 2,3 | ±4 |
Nos extremos (abaixo de 70 ou acima de 130) a estimativa tende levemente para o centro, um efeito conhecido do método EAP.
Calibração com dados reais
No começo, os parâmetros de cada questão vêm do modelo teórico de dificuldade de cada gerador. Conforme as pessoas respondem, uma rotina reestima esses parâmetros com os dados reais e o motor passa a usá-los. Ainda não há dados suficientes para nenhuma recalibração.
O que este teste não é
- Não é um teste psicológico aprovado. No Brasil, testes usados para diagnóstico, laudos, concursos ou seleção precisam de parecer favorável do SATEPSI (Conselho Federal de Psicologia) e são aplicados por psicólogos.
- A população de referência é teórica. Testes clínicos são normatizados com amostras grandes e representativas da população brasileira. Aqui, a escala parte do modelo e é refinada com os próprios participantes, que não são uma amostra representativa.
- As condições não são controladas. Cansaço, distrações, pressa, tela pequena e prática com esse tipo de questão mudam o resultado.
Use o resultado como um retrato divertido e informativo das suas habilidades de raciocínio. Se você precisa de uma avaliação de verdade, procure um psicólogo ou serviço-escola de Psicologia.
Referências
- Carpenter, P. A., Just, M. A. & Shell, P. (1990). What one intelligence test measures: a theoretical account of the processing in the Raven Progressive Matrices Test. Psychological Review, 97(3).
- Embretson, S. E. (1998). A cognitive design system approach to generating valid tests. Psychological Methods, 3(3).
- McGrew, K. S. (2009). CHC theory and the human cognitive abilities project. Intelligence, 37(1).
- Shepard, R. N. & Metzler, J. (1971). Mental rotation of three-dimensional objects. Science, 171.
- Wainer, H. (org.) (2000). Computerized Adaptive Testing: A Primer. Lawrence Erlbaum.
- Pasquali, L. (2003). Psicometria: teoria dos testes na Psicologia e na Educação. Vozes.