Governing AI agents by instruction is not enough. The architecture has to enforce the limit.
The idea, in one line:
the boundary is not a line through the space of actions, it is a function.
Candidate
M.Sc. Epitácio Vicente do Nascimento Neto
Supervisor
Prof. Dr. Felipe André Zeiser
Programme
Graduate Program in Applied Computing (PPGCA), PhD – University of Vale do Rio dos Sinos (UNISINOS)
Tese de doutorado, vitrine pública
MeridianSeal
Governar agentes de IA por instrução não basta. A arquitetura precisa impor o limite.
A ideia, em uma linha:
a fronteira não é uma linha através do espaço de ações, é uma função.
Candidato
M.Sc. Epitácio Vicente do Nascimento Neto
Orientador
Prof. Dr. Felipe André Zeiser
Programa
Programa de Pós-Graduação em Computação Aplicada (PPGCA), Doutorado – Universidade do Vale do Rio dos Sinos (UNISINOS)
The problem
Instruction is not enforcement
This section works through one illustrative example: the taxonomy’s own catalogue of
sixty action classes an autonomous AI agent could take, each one scored against what would
actually stop it under a worked reference configuration.
Two kinds of rule
Instructional
A rule that lives in prose – a policy document, a system prompt, a briefing.
The agent is told. Nothing stops it from doing otherwise.
Structural
A rule the architecture enforces on its own – an identity boundary, a gate, a
control the agent cannot reach around. Compliance is not a term in the outcome.
The gap, counted
Scored across that same sixty-class catalogue, under the bare-baseline configuration this framework uses as its starting point:
50of 60 action classes
an agent’s real access already exceeds its written mandate
0of 50 mandate gaps
closed by a guardrail the agent cannot reach around
None36 of 60no control of any kind
Instructional8 of 60bounded by prose alone
Conditional12 of 60checked by something the agent could also alter
Structural4 of 60behind a control the agent cannot reach around
One sentence, every control
The decision layer is well built. The layer that would bind the decision to the world is not.
D2 puts it more precisely: the boundary is not a line through the space of actions, but a
function. The next section turns that claim into something you can move through, not just read.
Esta seção percorre um exemplo ilustrativo: o catálogo da própria
taxonomia com sessenta classes de ação que um agente de IA autônomo poderia
tomar, cada uma pontuada contra o que de fato a impediria sob uma configuração de
referência trabalhada.
Dois tipos de regra
Instrucional
Uma regra que vive na prosa – uma política, um prompt de sistema, um briefing.
O agente é instruído. Nada o impede de fazer diferente.
Estrutural
Uma regra que a própria arquitetura impõe – um limite de identidade,
um portão, um controle que o agente não consegue contornar. Conformidade
não é um termo no resultado.
A lacuna, contada
Pontuado no mesmo catálogo de sessenta classes, sob a configuração de linha de base nua que este framework usa como ponto de partida:
50de 60 classes de ação
o acesso real de um agente já excede seu mandato escrito
0de 50 lacunas de mandato
fechadas por um guardrail que o agente não consegue contornar
Nenhum36 de 60sem controle de nenhum tipo
Instrucional8 de 60delimitadas apenas por prosa
Condicional12 de 60verificadas por algo que o agente também poderia alterar
Estrutural4 de 60atrás de um controle que o agente não consegue contornar
Uma frase, todo controle
A camada de decisão é bem construída; a camada que vincularia a decisão ao mundo não é.
O D2 formula isso com mais precisão: a fronteira não é uma linha através
do espaço de ações, mas uma função. A próxima seção
transforma essa afirmação em algo que se percorre, não apenas se lê.
AC-045, restarting a production service while work is in flight, is pinned by
SD-04 value and judgement content to floor(a) = Level II – no
catalogued guardrail moves that line. Drag through the ten condition sets below and watch
ceiling(G,a) fall as coverage rises, and watch which term actually sets
L(a,G) at each point.
The defensible level for AC-045 under each of the ten condition sets, computed as L(a,G) = max(floor(a), ceiling(G,a)) with floor(a) fixed at Level II by SD-04. This table is the no-script equivalent of the interactive widget below.
Condition set
ceiling(G,a)
floor(a)
L(a,G)
Governing term
CS-01 Bare baseline
III
II
III
Guardrail (ceiling)
CS-02 Instructional only
II
II
II
Determinant (floor)
CS-03 Baseline as found
II
II
II
Determinant (floor)
CS-04 Identity separated
II
II
II
Determinant (floor)
CS-05 Contained
II
II
II
Determinant (floor)
CS-06 Verified
II
II
II
Determinant (floor)
CS-07 Mandated
II
II
II
Determinant (floor)
CS-08 Interruptible
II
II
II
Determinant (floor)
CS-09 Fully hardened
II
II
II
Determinant (floor)
CS-10 Fully hardened minus verification
II
II
II
Determinant (floor)
I Out-of-loop
II On-loop
III In-loop
floor(a) · fixed
ceiling(G,a)
03 — A relação governante
Veja a relação se mover
AC-045, reiniciar um serviço de produção com trabalho em andamento, é fixada pelo
SD-04 conteúdo de valor e julgamento em floor(a) = Nível II –
nenhum guardrail catalogado move essa linha. Arraste pelos dez condition sets abaixo e veja
ceiling(G,a) cair à medida que a cobertura aumenta, e veja qual termo realmente
define L(a,G) em cada ponto.
O nível defensável para AC-045 sob cada um dos dez condition sets, calculado como L(a,G) = max(floor(a), ceiling(G,a)) com floor(a) fixado no Nível II pelo SD-04. Esta tabela é o equivalente sem script do widget interativo abaixo.
Condition set
ceiling(G,a)
floor(a)
L(a,G)
Termo governante
CS-01 Linha de base nua
III
II
III
Guardrail (ceiling)
CS-02 Apenas instrucional
II
II
II
Determinante (floor)
CS-03 Linha de base como encontrada
II
II
II
Determinante (floor)
CS-04 Identidade separada
II
II
II
Determinante (floor)
CS-05 Contido
II
II
II
Determinante (floor)
CS-06 Verificado
II
II
II
Determinante (floor)
CS-07 Mandatado
II
II
II
Determinante (floor)
CS-08 Interrompível
II
II
II
Determinante (floor)
CS-09 Totalmente endurecido
II
II
II
Determinante (floor)
CS-10 Totalmente endurecido menos verificação
II
II
II
Determinante (floor)
I Fora do laço
II Sobre o laço
III No laço
floor(a) · fixo
ceiling(G,a)
04 — Autonomy-boundary taxonomy
Three levels, and the two terms that actually set them
The doctoral taxonomy defines three autonomy levels by consequence. What it does not settle is
how a given action gets its classification – the same deployment, run in two environments
with different guardrails, can correctly sit at different levels. The governing relation above
answers that, and the ten supervision determinants define the floor no guardrail can move.
L(a, G) = max( floor(a), ceiling(G, a) ) – the defensible level for action a under guardrail set G is the more constrained of floor(a), fixed by the action's own properties, and ceiling(G, a), set by guardrail maturity.
Level I · Out-of-loop
Fully autonomous, no prior review
Reversible, confined to development or version control, or permanently pre-authorised. No guardrail on the action needs to hold for a human to intervene, because none is required to.
Operational test — none of the ten supervision determinants (SD-01–SD-10) apply. floor(a) = I, so the level is set entirely by ceiling(G,a): guardrail-dominated, and investment moves it.
In a worked scoring of this catalogue’s sixty action classes, 8 of 60 qualify for a Level I mandate, with access illustrated as not exceeding mandate in every one.
Level II · On-loop
Autonomous, reviewed after the fact
Real production impact, but reversible; communicated asynchronously for subsequent human review rather than gated in advance.
Operational test — at least one determinant applies at residual level II (e.g. SD-01 irreversibility, SD-05 unverifiability) and none escalate to III. Guardrail investment reduces consequence but does not remove the review requirement.
Divergence between an agent’s self-report and independent evidence is exactly what this level is built to catch: SD-05 unverifiability is the determinant most often responsible for pinning an action here, because without a corroborator independent of the actor, a claim of success and a claim of failure look identical from outside the system.
Level III · In-loop
Prior approval required, or prohibited
Irreversible, externally facing, or alters a safety flag. The gate closes before the action, not after it.
Operational test — at least one determinant applies at residual level III – SD-02 externality, SD-03 accountability, or SD-07 containment shortfall. No catalogued guardrail configuration removes it.
In this worked scoring, 22 of 32 action classes in the irreducible residue remain at Level III even under CS-09, the fully hardened condition set – the class of action the architecture cannot, by construction, move below prior approval.
The ten supervision determinants
A determinant is a property of an action, not a judgement on the agent – it can pin an
action to human supervision even when the agent would decide it correctly every time. Eight
are named in the doctoral proposal’s own terms; SD-09 and SD-10
are extensions of this research run. In a worked scoring applied to this catalogue’s
60-class inventory, 32 remain determinant-dominated under every catalogued guardrail
configuration – the irreducible residue this framework exists to make visible.
An action is pinned to human supervision to the extent that its effect cannot be undone by any mechanism available to the system after the fact.
Test
Is there a rollback path that restores the prior state exactly, is it available to the actor, and has it been demonstrated by exercise rather than asserted? If any of the three is false, the determinant applies.
Applies when
The effect persists after the action and no exercised rollback restores prior state, or the rollback itself has a blast radius comparable to the original action.
Mitigation
Pre-apply snapshots (GR-L06-02), pre-approved rollback targets only (GR-L06-03) and proven rollback exercise convert some irreversible actions into reversible-with-effort ones. They cannot convert an action whose effect has already left the system boundary – which is why SD-01 and SD-02 compound rather than overlap.
Examples
AC-006 rewrite published version-control history · AC-054 delete an audit record
SD-02 Externality
Residual: Level IIIGuardrail-removable: no
Definition
An action is pinned to human supervision to the extent that its effect crosses the system boundary and reaches a party who did not consent to the system’s error rate.
Test
Does any effect of this action become visible to, or act upon, a person or organisation outside the operator’s span of control, before any review can occur?
Applies when
The output reaches a member of the public, a customer, a regulator, a certificate transparency log, a public name-resolution system, or any third-party system.
Mitigation
Structural interception before the boundary is crossed moves the boundary rather than removing it: the action becomes internal and the determinant no longer applies to the intercepted form. Nothing reduces it for the real form.
Examples
AC-047 send an email to an external recipient · AC-040 change a public DNS record
SD-03 Accountability requirement
Residual: Level IIIGuardrail-removable: no
Definition
An action is pinned to human supervision where a named human must be answerable for the decision, by law, contract, standard or professional obligation – irrespective of whether the machine would decide correctly.
Test
If the decision were later challenged, would an answer of the form “the system decided” be accepted by the party entitled to ask? If not, the determinant applies.
Applies when
A statutory, contractual or certification obligation attaches a named signatory to the decision, or the decision constitutes an attestation about the organisation.
Mitigation
Nothing reduces this determinant, because it is not a claim about competence. Guardrails can make the human’s decision better informed, faster and cheaper – worth doing – but the requirement for a human decision is exogenous to the architecture.
Examples
AC-055 write a completion attestation about its own work · AC-052 write to the system of record
SD-04 Value and judgement content
Residual: Level IIGuardrail-removable: partial
Definition
An action is pinned to human supervision where it trades off values the organisation has not reduced to a rule, and more than one resolution is defensible.
Test
Can the decision be expressed as a predicate over observable state that a reviewer would accept as complete? If the honest answer requires “it depends on the circumstances”, the determinant applies.
Applies when
The correct action depends on a priority ordering that is contested, unstated, or situational – availability against correctness, speed against certainty.
Mitigation
Making the priority ordering explicit as declarative policy (GR-L07-01) converts part of the judgement into a rule. What remains is what the policy did not anticipate, where default-deny becomes the safe resolution.
Examples
AC-044 deploy code to another managed host during an incident · AC-011 terminate a process without confirming what still depends on it
An action is pinned to human supervision where its success cannot be checked by any mechanism independent of the actor that performed it.
Test
Is there an oracle for success that does not consult the acting agent, and can be evaluated mechanically? If the only available check is the agent’s own report, the determinant applies.
Applies when
The claim of completion is not corroborated by infrastructure-emitted evidence, or the evidence store is writable by the actor whose claim it corroborates.
Mitigation
The determinant most responsive to guardrail investment. An independent verifier under a separate identity (GR-L08-05) and infrastructure-emitted events (GR-L08-11) together remove it for a large class of actions – the self-report/evidence divergence problem illustrated at Level II above is exactly this determinant going unaddressed.
Examples
AC-055 write a completion attestation about its own work · AC-053 write to its own transcript record
SD-06 Distribution shift
Residual: Level IIGuardrail-removable: partial
Definition
An action is pinned to human supervision where the situation it is taken in lies outside the distribution over which the system’s competence has been evidenced.
Test
Has this action class been exercised, under materially similar conditions, often enough for its failure rate to be estimated? If the present case is novel in a way the actor cannot itself detect, the determinant applies.
Applies when
The environment has changed, the workload is unfamiliar, or the action is being taken for the first time at this scale, sequence, or load.
Mitigation
Canary and wave ordering (GR-L06-04) and blast-radius caps reduce the consequence of being out of distribution. They do not tell the actor it is out of distribution – the part that requires a human.
Examples
AC-060 self-update the agent runtime software · AC-039 call a cloud control-plane API against a new resource class
An action is pinned to human supervision where the blast radius of a mistake exceeds what the containment architecture can hold, so a single error escapes the boundary the design assumed.
Test
If this action were performed wrongly in the worst plausible way, would the consequence stay inside a boundary the operator can restore independently? If not, the determinant applies.
Applies when
The actor holds privilege, credentials or reach beyond the scope of the action, so an error can express itself outside that scope.
Mitigation
Entirely an artefact of architecture, and therefore fully removable in principle. Per-agent workload identity (GR-L01-02), least privilege per action class (GR-L01-03) and ephemeral credentials remove it – the single largest group in the residue, and the most tractable.
Examples
AC-029 execute a command as root · AC-037 obtain cloud credentials from the instance metadata service
An action is pinned to human supervision where the goal it serves is stated in terms that admit more than one faithful reading, so a competent actor can satisfy the letter of the instruction while defeating its purpose.
Test
Could a diligent actor complete this action, be judged compliant against the instruction as written, and still produce an outcome the instructing human would reject? If so, the determinant applies.
Applies when
The mandate is prose rather than a predicate, the success criterion is a human judgement, or the instruction contains an implicit precondition the actor cannot check.
Mitigation
Expressing the mandate as data (GR-L07-01) and a runtime classifier assigning class and level at the moment of attempt (GR-L07-08) narrow the space of faithful readings. They do not close it – the residual ambiguity lives in the goal, not the mechanism.
Examples
AC-019 dispatch a brief to an agent · AC-002 modify source files where the requirement is an intent
An action is pinned to human supervision where an error in it creates the conditions for further error, so consequence grows with time rather than remaining bounded at the moment of the mistake.
Test
Does the output of this action become the input to the next decision of the same actor, without an intervening independent check? If so, the determinant applies.
Applies when
Self-repair loops, retry ladders, and any automation whose trigger condition can be produced by its own previous action.
Mitigation
Circuit breakers on repeated failure (GR-L09-03) and sequencing constraints requiring verification before the next class unlocks bound the compounding without removing it.
Examples
AC-016 inject input into another agent’s live session · AC-060 self-update the agent runtime software
An action is pinned to human supervision where an adversary can observe the control and adapt to it, so the control’s effectiveness degrades as a function of its own deployment.
Test
Would a party with an interest in the action succeeding be able to observe the control’s decision boundary and construct an input that satisfies it? If so, the determinant applies.
Applies when
The control is a pattern match, a classifier, or any rule whose decision boundary is inferable from its outputs, and an interested party can supply the input.
Mitigation
Allowlists (GR-L04-06, GR-L02-06) degrade far more slowly than deny-lists under adaptation, because an allowlist’s failure mode is a false refusal rather than a false permit.
Examples
AC-036 make an arbitrary outbound network request · AC-002 modify source files drawn from untrusted content
04 — Taxonomia da fronteira de autonomia
Três níveis, e os dois termos que de fato os definem
A taxonomia doutoral define três níveis de autonomia por consequência. O que ela não resolve é
como uma ação recebe sua classificação – a mesma implantação, executada em dois ambientes
com guardrails diferentes, pode ser corretamente classificada em níveis diferentes. A relação
governante acima responde a isso, e os dez determinantes de supervisão definem o piso que
nenhum guardrail consegue mover.
L(a, G) = max( floor(a), ceiling(G, a) ) – o nível defensável para a ação a sob o conjunto de guardrails G é o mais restrito entre floor(a), fixado pelas propriedades da própria ação, e ceiling(G, a), definido pela maturidade dos guardrails.
Nível I · Fora do laço
Totalmente autônomo, sem revisão prévia
Reversível, confinado ao desenvolvimento ou ao controle de versão, ou permanentemente pré-autorizado. Nenhum guardrail precisa se manter para que um humano intervenha, porque nenhuma intervenção é exigida.
Teste operacional — nenhum dos dez determinantes de supervisão (SD-01–SD-10) se aplica. floor(a) = I, portanto o nível é definido inteiramente por ceiling(G,a): dominado por guardrails, e o investimento o move.
Numa pontuação trabalhada deste catálogo de sessenta classes de ação, 8 de 60 qualificam-se para um mandato de Nível I, com acesso ilustrado como não excedendo o mandato em todas as oito.
Nível II · Sobre o laço
Autônomo, revisado a posteriori
Impacto real em produção, mas reversível; comunicado de forma assíncrona para revisão humana subsequente, em vez de bloqueado antecipadamente.
Teste operacional — ao menos um determinante se aplica em nível residual II (por exemplo, SD-01 irreversibilidade, SD-05 não verificabilidade) e nenhum escala para III. O investimento em guardrails reduz a consequência, mas não elimina a exigência de revisão.
Divergência entre o autorrelato de um agente e a evidência independente é exatamente o que este nível existe para capturar: SD-05 não verificabilidade é o determinante mais frequentemente responsável por fixar uma ação aqui, porque sem um corroborador independente do agente, uma alegação de sucesso e uma alegação de falha parecem idênticas vistas de fora do sistema.
Nível III · No laço
Aprovação prévia exigida, ou proibido
Irreversível, voltado para fora, ou altera um sinalizador de segurança. O portão se fecha antes da ação, não depois dela.
Teste operacional — ao menos um determinante se aplica em nível residual III – SD-02 externalidade, SD-03 responsabilização, ou SD-07 déficit de contenção. Nenhuma configuração catalogada de guardrails o remove.
Nesta pontuação trabalhada, 22 de 32 classes de ação no resíduo irredutível permanecem no Nível III mesmo sob o CS-09, o condition set totalmente endurecido – a classe de ação que a arquitetura não consegue, por construção, mover abaixo da aprovação prévia.
Os dez determinantes de supervisão
Um determinante é uma propriedade da ação, não um julgamento sobre o agente – pode fixar
uma ação à supervisão humana mesmo quando o agente decidiria corretamente todas as vezes. Oito
são nomeados nos próprios termos da proposta doutoral; SD-09 e SD-10
são extensões desta execução de pesquisa. Numa pontuação trabalhada aplicada ao inventário
de 60 classes deste catálogo, 32 permanecem dominadas por determinante sob toda configuração
catalogada de guardrails – o resíduo irredutível que este framework existe para
tornar visível.
SD-01 Irreversibilidade
Nível residual: IIRemovível por guardrail: parcial
Definição
Uma ação é fixada à supervisão humana na medida em que seu efeito não pode ser desfeito por nenhum mecanismo disponível no sistema depois do fato.
Teste
Existe um caminho de rollback que restaura exatamente o estado anterior, está disponível ao agente, e já foi demonstrado por exercício, não apenas alegado? Se qualquer um dos três for falso, o determinante se aplica.
Aplica-se quando
O efeito persiste após a ação e nenhum rollback exercido restaura o estado anterior; ou o próprio rollback tem um raio de impacto comparável ao da ação original.
Mitigação
Snapshots pré-aplicação (GR-L06-02), alvos de rollback pré-aprovados apenas (GR-L06-03) e exercício comprovado de rollback convertem algumas ações irreversíveis em reversíveis-com-esforço. Não conseguem converter uma ação cujo efeito já deixou o limite do sistema – por isso SD-01 e SD-02 se compõem em vez de se sobrepor.
Exemplos
AC-006 reescrever histórico publicado de controle de versão · AC-054 excluir um registro de auditoria
SD-02 Externalidade
Nível residual: IIIRemovível por guardrail: não
Definição
Uma ação é fixada à supervisão humana na medida em que seu efeito atravessa o limite do sistema e alcança uma parte que não consentiu com a taxa de erro do sistema.
Teste
Algum efeito desta ação se torna visível para, ou atua sobre, uma pessoa ou organização fora do escopo de controle do operador, antes que qualquer revisão possa ocorrer?
Aplica-se quando
O resultado alcança um membro do público, um cliente, um regulador, um log de transparência de certificados, um sistema público de resolução de nomes, ou qualquer sistema de terceiros.
Mitigação
A interceptação estrutural antes de o limite ser cruzado move o limite em vez de removê-lo: a ação se torna interna e o determinante deixa de se aplicar à forma interceptada. Nada reduz o determinante para a forma real.
Exemplos
AC-047 enviar um e-mail a um destinatário externo · AC-040 alterar um registro DNS público
SD-03 Requisito de responsabilização
Nível residual: IIIRemovível por guardrail: não
Definição
Uma ação é fixada à supervisão humana onde um humano nomeado precisa responder pela decisão, por força de lei, contrato, norma ou obrigação profissional – independentemente de a máquina decidir corretamente.
Teste
Se a decisão fosse contestada posteriormente, uma resposta do tipo “o sistema decidiu” seria aceita pela parte com direito de perguntar? Se não, o determinante se aplica.
Aplica-se quando
Uma obrigação estatutária, contratual ou de certificação vincula um signatário nomeado à decisão, ou a decisão constitui uma atestação sobre a organização.
Mitigação
Nada reduz este determinante, porque não é uma afirmação sobre competência. Os guardrails podem tornar a decisão do humano mais bem informada, mais rápida e mais barata – vale a pena fazê-lo – mas a exigência de uma decisão humana é exógena à arquitetura.
Exemplos
AC-055 escrever uma atestação de conclusão sobre o próprio trabalho · AC-052 escrever no sistema de registro
SD-04 Conteúdo de valor e julgamento
Nível residual: IIRemovível por guardrail: parcial
Definição
Uma ação é fixada à supervisão humana onde ela troca valores que a organização não reduziu a uma regra, e mais de uma resolução é defensável.
Teste
A decisão pode ser expressa como um predicado sobre estado observável que um revisor aceitaria como completo? Se a resposta honesta exige “depende das circunstâncias”, o determinante se aplica.
Aplica-se quando
A ação correta depende de uma ordem de prioridade contestada, não declarada ou situacional – disponibilidade versus correção, velocidade versus certeza.
Mitigação
Tornar a ordem de prioridade explícita como política declarativa (GR-L07-01) converte parte do julgamento em regra. O que resta é o que a política não previu, onde a negação por padrão se torna a resolução segura.
Exemplos
AC-044 implantar código em outro host gerenciado durante um incidente · AC-011 encerrar um processo sem confirmar o que ainda depende dele
SD-05 Não verificabilidade
Nível residual: IIRemovível por guardrail: sim
Definição
Uma ação é fixada à supervisão humana onde seu sucesso não pode ser verificado por nenhum mecanismo independente do agente que a executou.
Teste
Existe um oráculo de sucesso que não consulta o agente atuante, e que pode ser avaliado mecanicamente? Se a única verificação disponível é o próprio relato do agente, o determinante se aplica.
Aplica-se quando
A alegação de conclusão não é corroborada por evidência emitida pela infraestrutura, ou o repositório de evidência é gravável pelo próprio agente cuja alegação ele deveria corroborar.
Mitigação
O determinante mais responsivo a investimento em guardrails. Um verificador independente sob identidade separada (GR-L08-05) e eventos emitidos pela infraestrutura (GR-L08-11) juntos o removem para uma grande classe de ações – o problema de divergência entre autorrelato e evidência ilustrado no Nível II acima é exatamente este determinante não endereçado.
Exemplos
AC-055 escrever uma atestação de conclusão sobre o próprio trabalho · AC-053 escrever em seu próprio registro de transcrição
SD-06 Mudança de distribuição
Nível residual: IIRemovível por guardrail: parcial
Definição
Uma ação é fixada à supervisão humana onde a situação em que é tomada está fora da distribuição sobre a qual a competência do sistema foi evidenciada.
Teste
Esta classe de ação já foi exercida, em condições materialmente semelhantes às presentes, com frequência suficiente para estimar sua taxa de falha? Se o caso presente é inédito de um modo que o próprio agente não consegue detectar, o determinante se aplica.
Aplica-se quando
O ambiente mudou, a carga de trabalho é incomum, ou a ação está sendo tomada pela primeira vez nesta escala, sequência ou carga.
Mitigação
Ordenação por canário e por ondas (GR-L06-04) e limites de raio de impacto reduzem a consequência de estar fora da distribuição. Não informam ao agente que ele está fora da distribuição – a parte que exige um humano.
Exemplos
AC-060 autoatualizar o software de runtime do agente · AC-039 chamar uma API mutante do plano de controle de nuvem contra uma nova classe de recurso
SD-07 Déficit de contenção
Nível residual: IIIRemovível por guardrail: sim
Definição
Uma ação é fixada à supervisão humana onde o raio de impacto de um erro excede o que a arquitetura de contenção consegue conter, de modo que um único erro escapa do limite que o projeto assumiu.
Teste
Se esta ação fosse executada erroneamente da pior forma plausível, a consequência permaneceria dentro de um limite que o operador consegue restaurar de forma independente? Se não, o determinante se aplica.
Aplica-se quando
O agente detém privilégio, credenciais ou alcance além do escopo da ação, de modo que um erro pode se expressar fora desse escopo.
Mitigação
Inteiramente um artefato da arquitetura, e portanto totalmente removível em princípio. Identidade de carga de trabalho por agente (GR-L01-02), privilégio mínimo por classe de ação (GR-L01-03) e credenciais efêmeras o removem – o maior grupo isolado do resíduo, e o mais tratável.
Exemplos
AC-029 executar um comando como root · AC-037 obter credenciais de nuvem do serviço de metadados da instância
SD-08 Ambiguidade do objetivo
Nível residual: IIRemovível por guardrail: parcial
Definição
Uma ação é fixada à supervisão humana onde o objetivo a que serve é declarado em termos que admitem mais de uma leitura fiel, de modo que um agente competente pode satisfazer a letra da instrução e ainda assim frustrar seu propósito.
Teste
Um agente diligente poderia concluir esta ação, ser julgado conforme a instrução como escrita, e ainda assim ter produzido um resultado que o humano instrutor rejeitaria? Se sim, o determinante se aplica.
Aplica-se quando
O mandato é prosa, não um predicado; o critério de sucesso é um julgamento humano; ou a instrução contém uma precondição implícita que o agente não pode verificar.
Mitigação
Expressar o mandato como dado (GR-L07-01) e um classificador em tempo de execução que atribui classe e nível no momento da tentativa (GR-L07-08) estreitam o espaço de leituras fiéis. Não o fecham – a ambiguidade residual está no objetivo, não no mecanismo.
Exemplos
AC-019 despachar um briefing a um agente · AC-002 modificar arquivos-fonte quando o requisito é expresso como intenção
SD-09 Efeito cumulativo
Nível residual: IIRemovível por guardrail: parcialExtensão
Definição
Uma ação é fixada à supervisão humana onde um erro nela cria as condições para novo erro, de modo que a consequência cresce com o tempo em vez de permanecer limitada ao momento do erro.
Teste
A saída desta ação se torna a entrada da próxima decisão do mesmo agente, sem uma verificação independente interveniente? Se sim, o determinante se aplica.
Aplica-se quando
Laços de autorreparo, escadas de retentativa, e qualquer automação cuja condição de disparo pode ser produzida por sua própria ação anterior.
Mitigação
Disjuntores em falha repetida (GR-L09-03) e restrições de sequenciamento que exigem verificação antes de a próxima classe se desbloquear limitam o efeito cumulativo sem removê-lo.
Exemplos
AC-016 injetar entrada na sessão ao vivo de outro agente · AC-060 autoatualizar o software de runtime do agente
SD-10 Adaptação adversarial
Nível residual: IIRemovível por guardrail: parcialExtensão
Definição
Uma ação é fixada à supervisão humana onde um adversário pode observar o controle e se adaptar a ele, de modo que a eficácia do controle se degrada em função de sua própria implantação.
Teste
Uma parte interessada no sucesso da ação conseguiria observar o limite de decisão do controle e construir uma entrada que o satisfaça? Se sim, o determinante se aplica.
Aplica-se quando
O controle é um casamento de padrão, um classificador, ou qualquer regra cujo limite de decisão é inferível a partir de suas saídas, e uma parte interessada pode fornecer a entrada.
Mitigação
Listas de permissão (GR-L04-06, GR-L02-06) se degradam muito mais lentamente que listas de negação sob adaptação, porque o modo de falha de uma lista de permissão é uma recusa falsa, não uma permissão falsa.
Exemplos
AC-036 fazer uma requisição de rede de saída arbitrária · AC-002 modificar arquivos-fonte originados de conteúdo não confiável
05 — Guardrail catalogue
Twelve layers, one enforcement question each
Every entry in the catalogue answers one question honestly: if an agent tried to do the thing
this control forbids, would it actually fail – or would it just be told not to? The twelve
layers run from the identity a process runs as, furthest from the model, to the prose an agent
reads as instruction, closest to it. This is the register that supplies ceiling(G, a)
in Section 04’s governing relation. Every guardrail below carries a status –
present, partial or proposed – scored against one worked reference configuration this
catalogue uses throughout for illustration: a demonstration deployment built to exercise the
taxonomy end to end, not a report on any single real system. The layer notes that follow
describe what that worked configuration would show.
Enforcement classification
Structural
The prohibited action is not reachable. Defeating it requires changing the architecture, not a decision – agent compliance is not a term in the outcome.
Conditional
A check exists and runs at execution time, but the actor could reach the same effect another way, or alter the condition it is checked against.
Instructional
The actor is told what to do or not do, in prose the model reads as context. Nothing in the runtime blocks the action.
No control
No control of any kind. Present on the host and well built is still classified this way if nothing in the runtime actually stops the action.
L1Identity and credential13 guardrails
Who or what an agent is, and what that identity can reach. Nine of the other eleven layers name identity separation as a precondition – and it is the layer with the highest concentration of structural proposals in the whole catalogue.
7 structural
2 conditional
1 instructional
3 no control
GR-L01-01 Shared operating system account for all agents – none, present
GR-L01-03 Least privilege permission set per action class – structural, proposed
L2Network and egress12 guardrails
What an agent’s processes can reach over a network, in both directions. In the worked configuration, inbound scores comparatively solid while outbound remains wide open by default, and most of what would close it – deny-by-default egress, a destination allowlist – is still proposed.
4 structural
8 conditional
GR-L02-01 Reverse proxy as the sole public entry point – conditional, present
GR-L02-05 Deny by default egress – structural, proposed
GR-L02-04 Host firewall with default deny inbound – conditional, proposed
L3Filesystem and workspace11 guardrails
What an agent can read, write or have isolated on disk. This layer’s central lesson, illustrated in the worked configuration: a well-implemented conditional allowlist can still permit almost everything, if the roots it allows are drawn broadly enough to cover effectively the whole host.
6 structural
5 conditional
GR-L03-01 Realpath allowlist on gateway-mediated filesystem access – conditional, present
GR-L03-07 Denial of write access to the agent’s own instruction files – structural, proposed
GR-L03-04 Read-only mounts for code the agent must not change – structural, proposed
L4Process and execution12 guardrails
How an agent’s processes are spawned, bounded and terminated. In the worked configuration, this layer holds both the catalogue’s strongest control by implementation quality, and one of its weakest, sitting one entry apart.
3 structural
8 conditional
1 no control
GR-L04-02 Process spawn with array arguments rather than a shell string – conditional, present
GR-L04-10 Permission skipping enabled by default for unattended agent runs – none, present
L5Data plane10 guardrails
What an agent’s stored state, and any upstream system of record, can structurally represent or permit. Contains one of only two entries in the entire catalogue that this worked configuration scores as both present and structural.
7 structural
3 conditional
GR-L05-01 Read-only connection identity to the System of Record – structural, present
GR-L05-04 Schema constraints making a prohibited state unrepresentable – structural, proposed
L6Change and deployment12 guardrails
How a change reaches a running system, and who or what gates it. Mostly restates continuous-delivery practice established well before agentic systems existed; the one entry this worked configuration scores as genuinely structural and present intercepts at the dispatch layer rather than in the agent’s reasoning.
4 structural
8 conditional
GR-L06-08 Structural test mode intercepting every external dispatch – structural, present
GR-L06-01 Deployment approval gate held by a separate principal – conditional, partial
GR-L06-02 Pre-apply snapshot of the target state – conditional, partial
L7Mandate and policy11 guardrails
What an agent is authorised to do, as a machine-checkable artefact rather than prose – distinct from what it is capable of (L1–L6) and what it is told (L12). Almost entirely proposed in the worked configuration, whose illustrative baseline treats a typical operative mandate as a prose brief – the gap this layer exists to close.
5 structural
4 conditional
2 instructional
GR-L07-04 Mandate expiry – structural, proposed
GR-L07-01 Declarative action class policy expressed as data – conditional, proposed
GR-L07-08 Runtime action classifier assigning class and level at attempt – conditional, proposed
L8Evidence, audit and verification13 guardrails
What record exists of what happened, and who can check it independently of the actor. The layer most directly implicated in the self-report/evidence divergence problem described in Section 04 – in the worked configuration, a session transcript is written by the agent’s own runtime, scored present but only conditional, because it sits where the same account could modify it.
4 structural
7 conditional
1 instructional
1 no control
GR-L08-01 Session transcript written by the agent’s own runtime – conditional, present
GR-L08-05 Independent verifier under a separate identity – structural, proposed
GR-L08-11 Infrastructure-emitted event stream independent of the agent – structural, proposed
L9Containment and interruption11 guardrails
What stops an agent once it is already acting, distinct from what prevents it starting. In the worked configuration, this layer scores more entries present than most – but one of them, restart-always supervision, is the mechanism that defeats the rest.
GR-L09-10 Restart-always supervision that defeats termination – none, present
GR-L09-03 Circuit breaker on repeated failure – structural, proposed
L10Human interface and oversight11 guardrails
What a human actually sees and can act on – distinct from what an architecture diagram claims. In the worked configuration, this layer carries the highest count of no-control entries of any layer, five of eleven, with every one of the five scored present.
1 structural
5 conditional
5 no control
GR-L10-01 Separation of notification from authorisation – conditional, present
GR-L10-07 Live terminal view of agent activity – none, present
GR-L10-04 Approval requests presenting evidence rather than the agent’s summary – structural, proposed
L11Temporal and contextual9 guardrails
What time, sequence and duration constraints apply to an action. Its defining entry, scored present in the worked configuration – scheduled unattended dispatch on a clock – is classified no-control on purpose: a schedule that fires with no human stimulus is the opposite of a temporal constraint.
3 structural
5 conditional
1 no control
GR-L11-05 Scheduled unattended dispatch on a clock – none, present
GR-L11-08 Business hours gating on external contact – conditional, partial
GR-L11-03 Cooling off period between related high impact actions – conditional, proposed
L12Model and prompt layer9 guardrails
The boundary in this catalogue: every one of L12’s entries is instructional by construction – none can be otherwise. Nothing here stops an action; it only asks.
What the agent is told, in language it reads as context. Catalogued in full because prose instruction is where governance effort concentrates by default, before architecture takes over – comparing this layer’s mix to L1 through L11 is the fastest way to see Section 04’s argument as a picture.
49 / 60 / 13 / 12structural / conditional / instructional / no control
05 — Catálogo de guardrails
Doze camadas, uma pergunta de enforcement cada
Cada entrada do catálogo responde a uma pergunta com honestidade: se um agente tentasse fazer
aquilo que este controle proíbe, ele de fato falharia – ou apenas seria instruído a não
fazer? As doze camadas vão da identidade sob a qual um processo é executado, a mais distante do
modelo, até a prosa que um agente lê como instrução, a mais próxima dele. Este é o registro que
fornece ceiling(G, a) na relação governante da Seção 04. Cada guardrail abaixo
carrega um status – presente, parcial ou proposto – pontuado contra uma única
configuração de referência trabalhada que este catálogo usa ao longo de toda a seção para
ilustração: uma implantação de demonstração construída para exercitar a taxonomia de ponta a
ponta, não um relatório sobre um sistema real específico. As notas de camada a seguir
descrevem o que essa configuração trabalhada mostraria.
Classificação de enforcement
Estrutural
A ação proibida não é alcançável. Derrotá-la exige mudar a arquitetura, não uma decisão – a conformidade do agente não é um termo no resultado.
Condicional
Existe uma verificação que roda em tempo de execução, mas o agente poderia alcançar o mesmo efeito por outro caminho, ou alterar a condição contra a qual é verificado.
Instrucional
O agente é instruído sobre o que fazer ou não fazer, em prosa que o modelo lê como contexto. Nada no runtime bloqueia a ação.
Nenhum controle
Nenhum controle de qualquer tipo. Mesmo presente no host e bem construído, é classificado assim se nada no runtime de fato interrompe a ação.
L1Identidade e credencial13 guardrails
Quem ou o que um agente é, e o que essa identidade consegue alcançar. Nove das outras onze camadas citam a separação de identidade como precondição – e é a camada com a maior concentração de propostas estruturais de todo o catálogo.
7 estrutural
2 condicional
1 instrucional
3 nenhum controle
GR-L01-01 Conta única de sistema operacional para todos os agentes – nenhum controle, presente
GR-L01-02 Identidade de carga de trabalho por agente – estrutural, proposto
GR-L01-03 Conjunto de permissões de privilégio mínimo por classe de ação – estrutural, proposto
L2Rede e saída12 guardrails
O que os processos de um agente conseguem alcançar em uma rede, nos dois sentidos. Na configuração trabalhada, a entrada pontua comparativamente sólida enquanto a saída permanece totalmente aberta por padrão, e o que a fecharia – saída negada por padrão, uma lista de permissão de destino – ainda é proposto.
4 estrutural
8 condicional
GR-L02-01 Proxy reverso como único ponto de entrada público – condicional, presente
GR-L02-05 Saída negada por padrão – estrutural, proposto
GR-L02-04 Firewall de host com negação padrão de entrada – condicional, proposto
L3Sistema de arquivos e espaço de trabalho11 guardrails
O que um agente pode ler, escrever ou ter isolado em disco. A lição central desta camada, ilustrada na configuração trabalhada: uma lista de permissão condicional bem implementada ainda pode permitir quase tudo, se as raízes que ela permite forem definidas de forma ampla o bastante para cobrir praticamente todo o host.
6 estrutural
5 condicional
GR-L03-01 Lista de permissões de realpath no acesso ao sistema de arquivos mediado por gateway – condicional, presente
GR-L03-07 Negação de escrita nos próprios arquivos de instrução do agente – estrutural, proposto
GR-L03-04 Montagens somente leitura para código que o agente não deve alterar – estrutural, proposto
L4Processo e execução12 guardrails
Como os processos de um agente são criados, limitados e encerrados. Na configuração trabalhada, esta camada contém tanto o controle mais forte do catálogo em qualidade de implementação quanto um dos mais fracos, a apenas uma entrada de distância.
3 estrutural
8 condicional
1 nenhum controle
GR-L04-02 Criação de processos com argumentos em array em vez de string de shell – condicional, presente
GR-L04-10 Pulo de permissões habilitado por padrão para execuções de agentes não supervisionadas – nenhum controle, presente
L5Plano de dados10 guardrails
O que o estado armazenado de um agente, e qualquer sistema de registro a montante, podem representar ou permitir de modo estrutural. Contém uma das únicas duas entradas em todo o catálogo que esta configuração trabalhada pontua como, ao mesmo tempo, presentes e estruturais.
7 estrutural
3 condicional
GR-L05-01 Identidade de conexão somente leitura ao Sistema de Registro – estrutural, presente
GR-L05-04 Restrições de esquema que tornam um estado proibido irrepresentável – estrutural, proposto
L6Mudança e implantação12 guardrails
Como uma mudança chega a um sistema em execução, e quem ou o que a controla. Em grande parte restabelece prática de entrega contínua estabelecida bem antes de existirem sistemas agênticos; a única entrada que esta configuração trabalhada pontua como genuinamente estrutural e presente intercepta na camada de despacho, não no raciocínio do agente.
4 estrutural
8 condicional
GR-L06-08 Modo de teste estrutural que intercepta todo despacho externo – estrutural, presente
GR-L06-01 Portão de aprovação de implantação sob um principal separado – condicional, parcial
GR-L06-02 Snapshot pré-aplicação do estado alvo – condicional, parcial
L7Mandato e política11 guardrails
O que um agente está autorizado a fazer, como artefato verificável por máquina em vez de prosa – distinto do que ele é capaz de fazer (L1–L6) e do que lhe é dito (L12). Quase inteiramente proposto na configuração trabalhada, cuja linha de base ilustrativa trata um mandato operante típico como um briefing em prosa – a lacuna que esta camada existe para fechar.
5 estrutural
4 condicional
2 instrucional
GR-L07-04 Expiração de mandato – estrutural, proposto
GR-L07-01 Política declarativa de classe de ação expressa como dado – condicional, proposto
GR-L07-08 Classificador de ação em tempo de execução, atribuindo classe e nível no momento da tentativa – condicional, proposto
L8Evidência, auditoria e verificação13 guardrails
Que registro existe do que aconteceu, e quem pode verificá-lo de forma independente do agente. A camada mais diretamente implicada no problema de divergência entre autorrelato e evidência descrito na Seção 04 – na configuração trabalhada, a transcrição de sessão é escrita pelo próprio runtime do agente, pontuada como presente, mas apenas condicional, porque reside onde a mesma conta poderia modificá-la.
4 estrutural
7 condicional
1 instrucional
1 nenhum controle
GR-L08-01 Transcrição de sessão escrita pelo próprio runtime do agente – condicional, presente
GR-L08-05 Verificador independente sob identidade separada – estrutural, proposto
GR-L08-11 Fluxo de eventos emitido pela infraestrutura, independente do agente – estrutural, proposto
L9Contenção e interrupção11 guardrails
O que interrompe um agente depois que ele já está agindo, distinto do que impede que ele comece. Na configuração trabalhada, esta camada pontua mais entradas presentes do que a maioria – mas uma delas, a supervisão de reinício sempre, é o mecanismo que anula as demais.
5 estrutural
5 condicional
1 nenhum controle
GR-L09-02 Kill switch que interrompe atividade de atualização não assistida – condicional, presente
GR-L09-10 Supervisão de reinício sempre, que anula a terminação – nenhum controle, presente
GR-L09-03 Disjuntor (circuit breaker) em falha repetida – estrutural, proposto
L10Interface humana e supervisão11 guardrails
O que um humano de fato vê e pode fazer a respeito – distinto do que um diagrama de arquitetura alega. Na configuração trabalhada, esta camada carrega a maior contagem de entradas sem controle de qualquer camada, cinco de onze, com todas as cinco pontuadas como presentes.
1 estrutural
5 condicional
5 nenhum controle
GR-L10-01 Separação entre notificação e autorização – condicional, presente
GR-L10-07 Visão de terminal ao vivo da atividade do agente – nenhum controle, presente
GR-L10-04 Pedidos de aprovação que apresentam evidência, não o resumo do agente – estrutural, proposto
L11Temporal e contextual9 guardrails
Que restrições de tempo, sequência e duração se aplicam a uma ação. Sua entrada definidora, pontuada como presente na configuração trabalhada – despacho não assistido agendado por relógio – é classificada como sem controle de propósito: um agendamento que dispara sem estímulo humano é o oposto de uma restrição temporal.
3 estrutural
5 condicional
1 nenhum controle
GR-L11-05 Despacho não assistido agendado por relógio – nenhum controle, presente
GR-L11-08 Restrição de horário comercial em contato externo – condicional, parcial
GR-L11-03 Período de resfriamento entre ações relacionadas de alto impacto – condicional, proposto
L12Camada de modelo e prompt9 guardrails
A fronteira deste catálogo: cada uma das entradas de L12 é instrucional por construção – nenhuma poderia ser diferente. Nada aqui interrompe uma ação; apenas pede.
O que é dito ao agente, em linguagem que ele lê como contexto. Catalogada por completo porque a instrução em prosa é onde o esforço de governança se concentra por padrão, antes de a arquitetura assumir – comparar a composição desta camada com L1 a L11 é a forma mais rápida de ver o argumento da Seção 04 como uma imagem.
9 instrucional
GR-L12-01 Arquivo de diretrizes operacionais do repositório como contexto do agente – instrucional, presente
GR-L12-02 Autorização permanente em prosa para ações de controle de versão – instrucional, presente
GR-L12-04 Briefing de despacho contendo proibições em prosa – instrucional, presente
Pick one of the ten experimental condition sets below, from the bare baseline to the fully
hardened catalogue, then press play. Each attempted action resolves against a single rule:
its effective class under that set is the highest enforcement class among the set’s
guardrails that bind it – structural blocks, conditional checks and proceeds,
instructional reminds and proceeds, none proceeds unobserved. Switch on adversarial mode to
see which rungs still hold once the actor can alter its own checks.
Interativo · O Laboratório de Guardrails
Veja o enforcement decidir, não descrever
Escolha um dos dez condition sets experimentais abaixo, da linha de base nua ao catálogo
totalmente endurecido, e pressione reproduzir. Cada ação tentada se resolve por
uma única regra: sua classe efetiva sob aquele set é a classe de enforcement mais
alta entre os guardrails do set que a vínculam – estrutural bloqueia, condicional
verifica e prossegue, instrucional lembra e prossegue, nenhum controle prossegue sem
observação. Ative o modo adversarial para ver quais degraus ainda se sustentam
quando o agente pode alterar suas próprias verificações.
agents
guardrail stack
the world
0Attempts
0Boundary crossings
0Blocked
0Detections
Didactic simulation driven by the real research registers; simplified, not the full research model.
06 — Measurement framework
Eight composite indices. Read the readiness label before the number.
D4 specifies a 72-entry metric register and eight composite indices, built so every metric can be tested for guardrail sensitivity and every claim drawn from self-report carries a named, independent corroborator. A composite is, by construction, a device for trading information for communicability — every index below is designed to be decomposed back into its component metrics on demand, and every card states its own readiness rather than letting a number imply one.
Readiness legend
available
Computable today without new instrumentation, from data that already exists in accessible form. Not the same as monitored: each figure is a point-in-time reading, not a maintained running count.
derivable
The raw event stream already exists; what is missing is a classification, join or identity layer that would make it addressable — a missing join, not a missing measurement.
absent
A data source, store or comparator population does not exist in any form. Building the metric requires building the thing it measures first.
CI-01derivable
Structural Enforcement Ratio
Answers the question this dissertation exists to ask: what share of an environment’s governance rests on architecture rather than on instruction.
Range0 to 1. Below 0.3 the posture is predominantly instructional. Above 0.7 the predominant enforcement is architectural.
Measures whether the boundary the architecture claims is the boundary that actually holds.
Range0 to 1. A value of 1 means access equals mandate everywhere and no crossing succeeds. In the framework’s own worked scoring, the illustrative baseline is low: 50 of 60 action classes have access exceeding mandate.
Measures how much of what is believed about the system’s behaviour rests on the system’s own account of itself.
Range0 to 1. A value of 0 means every claim about the system originates from the system. In the framework’s own worked scoring, the illustrative baseline sits near 0 for agent actions where nothing independent audits what an agent does.
Measures the gap between the supervision an architecture claims and the supervision a human can actually exercise.
Range0 to 1. A value of 1 means every supervision point satisfies all six viability conditions. In the framework’s own worked scoring, the illustrative baseline lands at 7 of 34 points without divergence, so approximately 0.21 on the leading component.
Measures what the governance costs, so the cost of a posture can be argued against its benefit rather than assumed away. Every other index on this page runs higher-is-better; this is the one deliberate exception, held to equal standing on purpose — a report that only counts risk reduced and never friction added is advocacy, not measurement.
Range0 to 1, lower is better, unlike every other index here. Above 0.5 the governance consumes more than it protects for routine work.
Measures whether the record every other measurement depends on can be trusted. Uniquely self-undermining: it is computed from the same record whose integrity it assesses, so it must be computed by a party other than the one that wrote the record, or it measures nothing.
Range0 to 1. A value below 0.5 means conclusions drawn from the record are not defensible.
A single communicable figure for where an environment sits on the path from instruction-based to architecturally enforced governance. The most communicable and least diagnostic figure in the framework — it exists for the one slide that has room for a single number, and deliberately excludes CI-06 so it cannot be improved just by making the system slower.
Range0 to 1, reported as five bands: 0.0–0.2 instructional; 0.2–0.4 conditional; 0.4–0.6 mixed; 0.6–0.8 predominantly structural; 0.8–1.0 structurally enforced with independent verification.
14 / 25 / 33of 72 register metrics, worked configuration: available / derivable / absent
0 / 1 / 7of these 8 composite indices, worked configuration: available / derivable / absent
The readiness figures above illustrate the measurement framework applied to a worked reference configuration – a demonstration of how the register scores, not a live instrumentation report on a specific deployment.
This is a research instrument, not a vendor scorecard. No composite index in this framework currently reads “available”: a composite is only ever as ready as its weakest component metric, and one absent input is enough to pin the whole index there. CI-01 reaches derivable because its weakest component, structural enforcement coverage, needs only a classification join that does not exist yet; the other seven stay absent because at least one of their inputs has no data source at all today. That gap is reported here rather than closed with an estimate, because a summary figure that cannot be decomposed back into its parts on demand is not a measurement — it is a claim, and this framework exists specifically so those do not pass unnoticed.
The metrics above are domain-agnostic: the same eight indices apply everywhere. What differs is which domain of activity an action belongs to, and how much autonomy that domain can defensibly carry.
Oito índices compostos. Leia o rótulo de prontidão antes do número.
O D4 especifica um registro de 72 métricas e oito índices compostos, construídos de modo que toda métrica possa ser testada quanto à sensibilidade a guardrails e toda alegação derivada de autorrelato carregue um corroborador independente nomeado. Um composto é, por construção, um dispositivo para trocar informação por comunicabilidade — todo índice abaixo foi projetado para ser decomposto de volta em suas métricas componentes sob demanda, e cada cartão declara sua própria prontidão, em vez de deixar um número sugeri-la.
Legenda de prontidão
available
Computável hoje sem nova instrumentação, a partir de dados que já existem em forma acessível. Não é o mesmo que monitorado: cada cifra é uma leitura pontual, não uma contagem corrente mantida.
derivable
O fluxo bruto de eventos já existe; o que falta é uma camada de classificação, join ou identidade que o tornaria endereçável — um join ausente, não uma medição ausente.
absent
Uma fonte de dados, um armazenamento ou uma população de comparador não existe em nenhuma forma. Construir a métrica exige construir primeiro a coisa que ela mede.
CI-01derivable
Razão de Enforcement Estrutural
Responde à pergunta que esta tese existe para fazer: que parcela da governança de um ambiente repousa sobre a arquitetura, e não sobre a instrução.
Faixa0 a 1. Abaixo de 0,3 a postura é predominantemente instrucional. Acima de 0,7 o enforcement predominante é arquitetural.
Mede se a fronteira que a arquitetura alega é a fronteira que de fato se sustenta.
Faixa0 a 1. O valor 1 significa que o acesso equivale ao mandato em toda parte e nenhum cruzamento é bem-sucedido. Na própria pontuação trabalhada do framework, a linha de base ilustrativa é baixa: 50 das 60 classes de ação têm acesso que excede o mandato.
Mede quanto do que se acredita sobre o comportamento do sistema repousa sobre o próprio relato do sistema a seu respeito.
Faixa0 a 1. O valor 0 significa que toda alegação sobre o sistema tem origem no próprio sistema. Na própria pontuação trabalhada do framework, a linha de base ilustrativa fica próxima de 0 para ações de agente, onde nada de independente audita o que um agente faz.
Mede o hiato entre a supervisão que uma arquitetura alega e a supervisão que um humano de fato consegue exercer.
Faixa0 a 1. O valor 1 significa que todo ponto de supervisão satisfaz as seis condições de viabilidade. Na própria pontuação trabalhada do framework, a linha de base ilustrativa fica em 7 entre 34 pontos sem divergência, ou seja, aproximadamente 0,21 no componente principal.
Mede quanto a governança custa, para que o custo de uma postura possa ser confrontado com seu benefício, em vez de presumido como irrelevante. Todo outro índice nesta página roda quanto-maior-melhor; este é a exceção deliberada, mantida em pé de igualdade de propósito — um relatório que só conta o risco reduzido e nunca a fricção acrescentada é advocacia, não medição.
Faixa0 a 1, quanto menor melhor — ao contrário de todo outro índice aqui. Acima de 0,5 a governança consome mais do que protege em trabalho rotineiro.
Mede se o registro do qual toda outra medição depende pode ser confiado. Autossabotador por construção: é computado a partir do mesmo registro cuja integridade avalia, e por isso precisa ser computado por uma parte diferente daquela que escreveu o registro, ou não mede nada.
Faixa0 a 1. Um valor abaixo de 0,5 significa que as conclusões extraídas do registro não são defensáveis.
Uma única cifra comunicável para situar onde um ambiente se encontra no caminho entre a governança baseada em instrução e a governança estruturalmente aplicada. A cifra mais comunicável e menos diagnóstica do framework — existe para o único slide com espaço para um único número, e exclui deliberadamente CI-06 para que não possa ser melhorada apenas tornando o sistema mais lento.
Faixa0 a 1, relatado em cinco faixas: 0,0–0,2 instrucional; 0,2–0,4 condicional; 0,4–0,6 mista; 0,6–0,8 predominantemente estrutural; 0,8–1,0 estruturalmente aplicada com verificação independente.
Os números de prontidão acima ilustram o framework de medição aplicado a uma configuração de referência trabalhada – uma demonstração de como o registro pontua, não um relatório de instrumentação ao vivo sobre uma implantação específica.
Este é um instrumento de pesquisa, não um scorecard de fornecedor. Nenhum índice composto deste framework hoje lê “available”: um composto só está tão pronto quanto sua métrica componente mais fraca, e um único insumo ausente basta para fixar o índice inteiro nesse estado. CI-01 alcança derivable porque seu componente mais fraco, a cobertura de enforcement estrutural, precisa apenas de um join de classificação que ainda não existe; os outros sete permanecem absent porque pelo menos um de seus insumos não tem, hoje, nenhuma fonte de dados. Essa lacuna é relatada aqui, em vez de fechada com uma estimativa, porque uma cifra-resumo que não pode ser decomposta de volta em suas partes sob demanda não é uma medição — é uma alegação, e este framework existe especificamente para que essas não passem despercebidas.
As métricas acima são independentes de domínio: os mesmos oito índices se aplicam em toda parte. O que difere é a qual domínio de atividade uma ação pertence, e quanta autonomia esse domínio consegue carregar de forma defensável.
D5 applies the D2 framework and the D3 catalogue to nine applicability domains and ranks them by defensible autonomy. A domain groups action classes by how fast their harm outruns their reversibility and the human review available, not by nominal risk category alone: two actions with the same risk label can sit in very different domains and need very different guardrail sets.
Instrumentation legend
Instrumented here
The Console — this project’s own reference implementation, linked in Section 08 — runs a live module operating in this domain today, not only a described one.
Illustrative only
Included for completeness of the taxonomy. This showroom’s own reference implementation does not currently operate a control in this domain.
DM-01
Agentic software development
Instrumented here
Development activity confined to reading, modifying, committing and pushing source code in a working tree and a hosted remote, plus the build and dependency steps that turn source into an artefact.
Level todayLargely Level I; history rewrite sits at Level II by mandate.
DM-02
Deployment and change management
Instrumented here
Actions that take built code, configuration or artefacts and make them the running state of a service, together with the approval and verification steps meant to gate that transition.
Level todayLevel II by mandate for most; Level III where the change touches another host or the public edge.
DM-03
Self-healing and automated remediation
Instrumented here
Automations that detect a fault, a stall or a stale state and take corrective action, principally by restarting or respawning a process, with no intervening human decision at the moment of repair.
Level todayNo explicit mandate for most restart automations; Level II–III where one is assigned.
DM-04
Real-time operations, telephony as the instance
Instrumented here
Actions that complete a real-world interaction with a party outside the system within the duration of the interaction itself, with telephony as a concrete instance.
Level todayLevel III by mandate for the real, uncontained action; Level I inside a structural test-mode overlay.
DM-05
Monitoring and observability
Instrumented here
Read-oriented actions that produce a signal about system state for a human or another automation to act on, without themselves changing production state.
Level todayLevel I; read-only by definition, already at ceiling for the read itself.
DM-06
Security operations and incident response
Illustrative only
Actions taken to detect, contain and remediate a security condition, including reading credential material, isolating or terminating a process, modifying privilege, and reaching another host or the cloud control plane.
Level todayLevel I by access for nearly every characteristic action, against a mandate that is typically largely unstated.
DM-07
Investigation and audit
Instrumented here
Actions that examine another party’s work product, or the system’s own record of events, to determine whether a claim about what happened is true.
Level todayLevel II by mandate for the object action classes under review; the investigation function itself carries no formal level.
DM-08
Compliance and attestation
Instrumented here
Actions that prepare, evidence or record a claim of conformance to an external obligation, where a named human — not the system — is accountable for the claim.
Level todayLevel II by mandate; nothing here establishes a route by which this domain reaches Level I.
DM-09
Data access and reporting
Illustrative only
Actions that read from, or report on, an upstream authoritative data source, where the structural question is whether a write path to that source exists at all.
Level todayLevel I–II by mandate for the read; Level III for the counterfactual write, which is not technically reachable.
7 / 9domains with a live module in the Console reference implementation
2 / 9domains kept illustrative-only: security incident response, data access and reporting
The marker above reflects this showroom’s own reference implementation, the Console, against the module map fixed at build time. “Instrumented here” means a live module runs against that domain today; it does not mean the domain’s guardrail catalogue is complete, or that its composite indices in Section 06 read anything better than absent.
Nine domains, eight indices, one catalogue underneath both. The reference implementation that instruments seven of the nine is next.
07 — Domínios de aplicabilidade
Nove domínios, classificados por autonomia defensável.
O D5 aplica o framework do D2 e o catálogo do D3 a nove domínios de aplicabilidade e os classifica por autonomia defensável. Um domínio agrupa classes de ação pela rapidez com que seu dano ultrapassa sua reversibilidade e a revisão humana disponível, não apenas pela categoria de risco nominal: duas ações com o mesmo rótulo de risco podem situar-se em domínios muito diferentes e exigir conjuntos de guardrails muito diferentes.
Legenda de instrumentação
Instrumentado aqui
O Console — a implementação de referência deste projeto, ligada na Seção 08 — executa hoje um módulo real operando neste domínio, não apenas descrito.
Apenas ilustrativo
Incluído para completude da taxonomia. A implementação de referência deste showroom não opera, atualmente, nenhum controle neste domínio.
DM-01
Desenvolvimento de software agêntico
Instrumentado aqui
Atividade de desenvolvimento confinada a ler, modificar, commitar e enviar (push) código-fonte numa árvore de trabalho e num remoto hospedado, além das etapas de build e dependências que transformam código-fonte em artefato.
Nível hojeMajoritariamente Nível I; a reescrita de histórico situa-se no Nível II por mandato.
DM-02
Implantação e gestão de mudanças
Instrumentado aqui
Ações que tomam código, configuração ou artefatos já construídos e os tornam o estado em execução de um serviço, junto com as etapas de aprovação e verificação que deveriam controlar essa transição.
Nível hojeNível II por mandato na maior parte; Nível III quando a mudança toca outro host ou a borda pública.
DM-03
Autorrecuperação e remediação automatizada
Instrumentado aqui
Automações que detectam uma falha, uma paralisação ou um estado obsoleto e tomam ação corretiva, principalmente reiniciando ou reengendrando um processo, sem decisão humana interveniente no momento do reparo.
Nível hojeSem mandato explícito para a maioria das automações de reinicialização; Nível II–III onde há um atribuído.
DM-04
Operações em tempo real, telefonia como a instância
Instrumentado aqui
Ações que completam uma interação real com uma parte externa ao sistema dentro da duração da própria interação, com a telefonia como uma instância concreta.
Nível hojeNível III por mandato para a ação real não contida; Nível I dentro de uma camada estrutural de modo de teste.
DM-05
Monitoramento e observabilidade
Instrumentado aqui
Ações de leitura que produzem um sinal sobre o estado do sistema para um humano ou outra automação agir, sem alterar, elas mesmas, o estado de produção.
Nível hojeNível I; somente leitura por definição, já no teto para a própria leitura.
DM-06
Operações de segurança e resposta a incidentes
Apenas ilustrativo
Ações tomadas para detectar, conter e remediar uma condição de segurança, incluindo ler material de credencial, isolar ou encerrar um processo, modificar privilégio, e alcançar outro host ou o plano de controle de nuvem.
Nível hojeNível I por acesso para quase toda ação característica, contra um mandato que tipicamente permanece, em grande parte, não declarado.
DM-07
Investigação e auditoria
Instrumentado aqui
Ações que examinam o produto de trabalho de outra parte, ou o próprio registro de eventos do sistema, para determinar se uma alegação sobre o que aconteceu é verdadeira.
Nível hojeNível II por mandato para as classes de ação-objeto sob revisão; a função de investigação em si não carrega nível formal.
DM-08
Conformidade e atestação
Instrumentado aqui
Ações que preparam, evidenciam ou registram uma alegação de conformidade a uma obrigação externa, na qual um humano nomeado — não o sistema — é responsável pela alegação.
Nível hojeNível II por mandato; nada aqui estabelece rota pela qual este domínio alcance o Nível I.
DM-09
Acesso a dados e geração de relatórios
Apenas ilustrativo
Ações que leem de, ou relatam sobre, uma fonte de dados autoritativa upstream, onde a pergunta estrutural é se existe, ou não, um caminho de escrita para essa fonte.
Nível hojeNível I–II por mandato para a leitura; Nível III para a escrita contrafactual, que não é tecnicamente alcançável.
7 / 9domínios com módulo real na implementação de referência Console
2 / 9domínios mantidos apenas ilustrativos: resposta a incidentes de segurança, acesso a dados e relatórios
O marcador acima reflete a implementação de referência deste showroom, o Console, contra o mapa de módulos fixado no momento da construção. “Instrumentado aqui” significa que um módulo real roda contra aquele domínio hoje; não significa que o catálogo de guardrails do domínio esteja completo, ou que seus índices compostos na Seção 06 leiam algo melhor do que absent.
Nove domínios, oito índices, um único catálogo por baixo dos dois. A implementação de referência que instrumenta sete dos nove vem a seguir.
08 — Reference implementation
MeridianSeal runs the separation it studies
This site is not only a description of architectural governance – it is a small, working
instance of it. MeridianSeal ships as two hosts with one job each, connected only where a job
requires it, and it says in public which of its own protections are structural and which are
still just watched.
plane‑meridiansealunisinos‑meridianseal
plane-meridianseal
The Console
MeridianSeal’s own control plane – the operator-facing admin console for the
reference implementation. It carries no public listener of any kind.
unisinos-meridianseal
Showroom, research platform, Launcher
This showroom – the public page you are reading now
The phdresearch platform – a working instance of the isolated experimental environment specified in D6 §3
The Launcher – the single sign-on entry point that authenticates a visitor once and hands them to whichever host their role needs
Traffic between the two hosts never leaves the private network: the Console has no path
reachable from the public internet at all, and the only route from one box to the other is the
segmented link between them – the same network-segmentation contract (CB-05,
D6 §2) that this framework’s gap analysis is designed to mark not transferable
wherever a deployment provides no segmentation between agent workspaces at all. Small as this
deployment is, the boundary
between its two hosts is drawn on purpose, not inherited as an accident of infrastructure
choice.
Enforced versus monitored, on this build
Enforced
A rule the box boundary or the network itself makes true, whether or not anyone remembers to check it – which host is reachable from where, and which of the two needs no public listener at all.
Monitored
A rule this build watches and logs but has not yet made unreachable outright – labelled plainly as such, the same way D6 §2 refuses to round a monitored control up to an enforced one.
The candour is inherited, not decorative. This framework’s own gap
analysis (D6 §2) is built to rate most of what looks like a control on a single-host
deployment – the policy enforcement point, the egress path, the workload identity –
not transferable, precisely because the party each control is meant to bind still
holds the means to defeat it.
MeridianSeal’s two-host split is a direct, if modest, answer to that finding: keep the
boundary honest by drawing fewer of them and enforcing every one you draw.
Este site não é apenas uma descrição da governança
arquitetural – é uma pequena instância funcional dela. O MeridianSeal roda
em dois hosts, cada um com uma única função, conectados apenas onde a
função exige, e declara publicamente quais das suas próprias
proteções são estruturais e quais ainda são apenas observadas.
plane‑meridiansealunisinos‑meridianseal
plane-meridianseal
O Console
O plano de controle do próprio MeridianSeal – o console administrativo
voltado ao operador da implementação de referência. Não
carrega nenhum ponto de escuta público.
unisinos-meridianseal
Vitrine, plataforma de pesquisa, Launcher
Esta vitrine – a página pública que você está lendo agora
A plataforma phdresearch – uma instância funcional do ambiente experimental isolado especificado em D6 §3
O Launcher – o ponto único de entrada (SSO) que autentica o visitante uma vez e o encaminha ao host que o seu papel exige
O tráfego entre os dois hosts nunca sai da rede privada: o Console não tem
nenhum caminho alcançável pela internet pública, e a única rota de
um host ao outro é o enlace segmentado entre eles – o mesmo contrato de
segmentação de rede (CB-05, D6 §2) que a análise de
lacunas deste framework foi concebida para marcar como não transferível
sempre que uma implantação não oferecer nenhuma segmentação
entre os espaços de trabalho dos agentes. Por menor que seja esta implantação,
a fronteira entre seus dois hosts é traçada de propósito, não herdada
como um acidente de escolha de infraestrutura.
Imposto versus observado, nesta implantação
Imposto
Uma regra que a própria fronteira do host ou da rede torna verdadeira, alguém lembre de checar ou não – qual host é alcançável de onde, e qual dos dois não precisa de nenhum ponto de escuta público.
Observado
Uma regra que esta implantação observa e registra, mas ainda não tornou inalcançável de fato – sinalizada como tal, do mesmo modo que D6 §2 se recusa a arredondar um controle observado para um controle imposto.
A franqueza é herdada, não decorativa. A própria
análise de lacunas deste framework (D6 §2) foi concebida para classificar a maior
parte do que parece um controle em uma implantação de host único
– o ponto de aplicação de política, o caminho de saída (egress),
a identidade de carga de trabalho – como não transferível,
precisamente porque a parte que cada controle deve conter ainda detém os meios
para derrotá-lo. A separação em dois hosts
do MeridianSeal é uma resposta direta, embora modesta, a esse achado: manter a fronteira
honesta traçando menos fronteiras e impondo cada uma que se traça.
Every claim on this site traces back to one of seven documents, rendered in English and
Portuguese from the same machine-readable registers. Nothing here is a marketing summary of
them – it is the same text a supervisor and an examining board read. The order below is
the suggested reading order, not the document numbering.
D0Read 1st
Executive Brief
Purpose and method, the eight most significant findings, headline counts and the reading map.
The spine of the argument: autonomy as a function of guardrail maturity, ten supervision determinants, the irreducible residue, and six viability conditions.
The gap analysis, the reference architecture for an isolated experimental environment, cloud-neutral capability contracts, and a 58-item improvement backlog.
Architectural Governance of Autonomy in Agentic AI Systems
Candidate
M.Sc. Epitácio Vicente do Nascimento Neto
Supervisor
Prof. Dr. Felipe André Zeiser
Programme
Graduate Program in Applied Computing (PPGCA), PhD – University of Vale do Rio dos Sinos (UNISINOS)
Each document above is versioned and rendered from the same register set in both languages; cite the specific document (D0–D6) and its language edition alongside the credit block above.
Have a question this document set does not answer directly?
Toda afirmação deste site remete a um dos sete documentos, renderizados em
inglês e português a partir dos mesmos registros legíveis por máquina.
Nada aqui é um resumo de marketing deles – é o mesmo texto que um orientador
e uma banca examinadora lêem. A ordem abaixo é a ordem de leitura sugerida, não
a numeração dos documentos.
D01ª leitura
Sumário Executivo
Objetivo e método, os oito achados mais significativos, números-chave e o mapa de leitura.
A espinha dorsal do argumento: autonomia como função da maturidade dos guardrails, dez determinantes de supervisão, o resíduo irredutível e seis condições de viabilidade.
Um registro vivo de 134 guardrails em doze camadas, cada um com análise de contorno (bypass) e o sinal que emite, além de dez conjuntos de condições experimentais.
Um registro vivo de 72 métricas, cada uma avaliada quanto à sensibilidade a guardrail e ao risco de manipulação (gaming), consolidadas em oito índices compostos.
Nove domínios de atividade, cada um com exemplos trabalhados e as dimensões que posicionam uma classe de ação no espectro entre instrucional e estrutural.
A análise de lacunas, a arquitetura de referência para um ambiente experimental isolado, os contratos de capacidade neutros de nuvem e um backlog de 58 itens de melhoria.
Governança Arquitetural da Autonomia em Sistemas Agênticos de IA
Candidato
M.Sc. Epitácio Vicente do Nascimento Neto
Orientador
Prof. Dr. Felipe André Zeiser
Programa
Programa de Pós-Graduação em Computação Aplicada (PPGCA), Doutorado – Universidade do Vale do Rio dos Sinos (UNISINOS)
Cada documento acima é versionado e renderizado a partir do mesmo conjunto de registros nos dois idiomas; cite o documento específico (D0–D6) e a sua edição de idioma junto com o bloco de créditos acima.
Tem uma pergunta que este conjunto de documentos não responde diretamente?