fix: устойчивость Redis-кластера под нагрузкой и код-ревью замечания
Redis timeout 200ms давал ложные срабатывания под пиковой нагрузкой на общем хосте — подняли до 800ms и добавили cpu/mem лимиты сервисам в compose, чтобы соседи не выедали CPU у Redis. Добавили метрику и WARN на случай, когда демаскирование не находит соответствие ни по id, ни по отпечатку маски (раньше тихо превращалось в повторное маскирование без единого следа в логах). Кластерные узлы (node-a/node-b) получили обе NER-модели (WikiNEuRal для имён, ruBERT для адресов) — раньше конфиг ссылался на несуществующие свойства и вторая ступень молча не работала. lb (nginx) и volume для prometheus/grafana данных зафиксированы в compose. Плюс код-ревью фиксы: утечка нативных ONNX-ресурсов при ошибке загрузки модели (BLOCKER), неверный HTTP-статус при сбое обработки, generic Exception в LlmClient заменён на конкретные, лишние same-package импорты убраны.
This commit is contained in:
@@ -0,0 +1,68 @@
|
||||
package ru.pdguard;
|
||||
|
||||
import org.junit.jupiter.api.DynamicTest;
|
||||
import org.junit.jupiter.api.TestFactory;
|
||||
import ru.pdguard.config.SystemPolicy;
|
||||
import ru.pdguard.core.PayloadStore;
|
||||
import ru.pdguard.core.Pipeline;
|
||||
import ru.pdguard.detect.RuleRegistry;
|
||||
import ru.pdguard.detect.Span;
|
||||
import ru.pdguard.mask.Masker;
|
||||
|
||||
import java.util.List;
|
||||
import java.util.stream.Stream;
|
||||
|
||||
import static org.junit.jupiter.api.Assertions.assertEquals;
|
||||
import static org.junit.jupiter.api.Assertions.assertFalse;
|
||||
import static org.junit.jupiter.api.DynamicTest.dynamicTest;
|
||||
|
||||
/**
|
||||
* 200 вручную составленных текстовых тестов из {@code dataset-200.txt} — по одному
|
||||
* предложению на строку, каждое своя отдельная проверка (не сборка одного большого
|
||||
* текста, как в {@link HugeDatasetTest}). Набор покрывает все типы ПДН из
|
||||
* {@link RuleRegistry} (кроме ADDRESS_REGION/ADDRESS_DISTRICT — для них нет правил,
|
||||
* только модель второй ступени), варианты написания (регистр, формат даты, разделяющие
|
||||
* слова) и несколько строк-ловушек без разметки (известный человек, адрес отделения,
|
||||
* дата без якоря) — они не должны маскироваться вовсе.
|
||||
*
|
||||
* <p>На каждой строке: маскирование не оставляет исходное значение ПДН в открытом
|
||||
* виде, а демаскирование побайтово восстанавливает исходный текст.
|
||||
*/
|
||||
class Dataset200Test {
|
||||
|
||||
private static final RuleRegistry REGISTRY = new RuleRegistry();
|
||||
private static final Masker MASKER = new Masker();
|
||||
private static final List<BenchmarkFixtures.Sample> DATASET = BenchmarkFixtures.load("/dataset-200.txt");
|
||||
|
||||
@TestFactory
|
||||
Stream<DynamicTest> datasetOf200Cases() {
|
||||
List<DynamicTest> cases = new java.util.ArrayList<>(DATASET.size());
|
||||
for (int i = 0; i < DATASET.size(); i++) {
|
||||
BenchmarkFixtures.Sample sample = DATASET.get(i);
|
||||
int index = i;
|
||||
cases.add(dynamicTest(
|
||||
String.format("#%03d: %s", index, preview(sample.text())),
|
||||
() -> runCase(sample, index)));
|
||||
}
|
||||
return cases.stream();
|
||||
}
|
||||
|
||||
private void runCase(BenchmarkFixtures.Sample sample, int index) {
|
||||
Pipeline pipeline = new Pipeline(REGISTRY, MASKER, new PayloadStore(1_000_000L, 30));
|
||||
String payloadId = "dataset200-" + index;
|
||||
|
||||
String masked = pipeline.process(sample.text(), payloadId, SystemPolicy.DEFAULT);
|
||||
for (Span gold : sample.gold()) {
|
||||
String value = sample.text().substring(gold.start(), gold.end());
|
||||
assertFalse(masked.contains(value),
|
||||
"ПДН типа " + gold.type() + " утекло в замаскированный текст: " + value);
|
||||
}
|
||||
|
||||
String restored = pipeline.process(masked, payloadId, SystemPolicy.DEFAULT);
|
||||
assertEquals(sample.text(), restored, "демаскирование не восстановило исходный текст");
|
||||
}
|
||||
|
||||
private static String preview(String text) {
|
||||
return text.length() <= 40 ? text : text.substring(0, 40) + "...";
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,157 @@
|
||||
package ru.pdguard;
|
||||
|
||||
import org.junit.jupiter.api.DynamicTest;
|
||||
import org.junit.jupiter.api.TestFactory;
|
||||
import ru.pdguard.config.SystemPolicy;
|
||||
import ru.pdguard.core.PayloadStore;
|
||||
import ru.pdguard.core.Pipeline;
|
||||
import ru.pdguard.detect.RuleRegistry;
|
||||
import ru.pdguard.detect.Span;
|
||||
import ru.pdguard.mask.Masker;
|
||||
|
||||
import java.util.ArrayList;
|
||||
import java.util.Collections;
|
||||
import java.util.List;
|
||||
import java.util.Random;
|
||||
import java.util.stream.Stream;
|
||||
|
||||
import static org.junit.jupiter.api.Assertions.assertEquals;
|
||||
import static org.junit.jupiter.api.Assertions.assertTrue;
|
||||
import static org.junit.jupiter.api.DynamicTest.dynamicTest;
|
||||
|
||||
/**
|
||||
* Датасет из 1000 прогонов разной длины — критерий 3.5 из "Критерии_оценивания_альфа"
|
||||
* (обработка текстов до 100 000 токенов) и стоп-сигнал по утечке ПДН из "критерии_фрейм_топы".
|
||||
*
|
||||
* <p>Тексты строятся перемешиванием строк из уже существующих размеченных наборов
|
||||
* {@code benchmark-*.txt} (17+ типов ПДН из ТЗ) — отдельный датасет с нуля не заводится,
|
||||
* пул размеченных примеров и так покрывает все типы. Длина растёт от одного предложения
|
||||
* до 400 000 знаков (100 000 токенов при 4 знака/токен — так же, как считает сам
|
||||
* {@link Pipeline}); не менее {@link #HUGE_CASES} прогонов лежат в полосе 90 000-100 000
|
||||
* токенов. На каждом прогоне проверяются: отсутствие ПДН в открытом виде в замаскированном
|
||||
* тексте и побайтовое совпадение после демаскирования; на прогонах из полосы 90-100к токенов
|
||||
* дополнительно проверяется, что маскирование укладывается в 5 секунд.
|
||||
*
|
||||
* <p>Полный прогон класса занимает пару минут — это ожидаемо на объёме, требуемом ТЗ.
|
||||
*/
|
||||
class HugeDatasetTest {
|
||||
|
||||
private static final int TOTAL_CASES = 1000;
|
||||
private static final int HUGE_CASES = 50;
|
||||
private static final int CHARS_PER_TOKEN = 4;
|
||||
private static final int HUGE_MIN_CHARS = 90_000 * CHARS_PER_TOKEN;
|
||||
private static final int HUGE_MAX_CHARS = 100_000 * CHARS_PER_TOKEN;
|
||||
/** Короткие значения (PIN, номер дома и т.п.) чаще случайно совпадают с посторонним
|
||||
* текстом пула — их из проверки на утечку исключаем, длинные ПДН проверяем всегда. */
|
||||
private static final int LEAK_CHECK_MIN_LENGTH = 6;
|
||||
/** Допустимая доля утечек на прогон. Пул включает настоящие holdout-наборы
|
||||
* (benchmark-holdout*.txt), на которых BenchmarkTest сам принимает полноту
|
||||
* от 0.70 — это и есть отправная точка, а не 0.85 из LargeTextTest, где
|
||||
* участвует только benchmark-generated.txt, подстроенный под правила. */
|
||||
private static final double MAX_LEAK_RATE = 0.30;
|
||||
|
||||
private static final RuleRegistry REGISTRY = new RuleRegistry();
|
||||
private static final Masker MASKER = new Masker();
|
||||
private static final List<BenchmarkFixtures.Sample> POOL = loadPool();
|
||||
|
||||
private static List<BenchmarkFixtures.Sample> loadPool() {
|
||||
List<BenchmarkFixtures.Sample> pool = new ArrayList<>();
|
||||
for (String resource : List.of(
|
||||
"/benchmark.txt", "/benchmark-generated.txt", "/benchmark-pdn-types.txt",
|
||||
"/benchmark-bank-context.txt", "/benchmark-holdout.txt",
|
||||
"/benchmark-holdout2.txt", "/benchmark-holdout3.txt")) {
|
||||
pool.addAll(BenchmarkFixtures.load(resource));
|
||||
}
|
||||
return pool;
|
||||
}
|
||||
|
||||
@TestFactory
|
||||
Stream<DynamicTest> datasetOfThousandCases() {
|
||||
List<DynamicTest> cases = new ArrayList<>(TOTAL_CASES);
|
||||
for (int i = 0; i < TOTAL_CASES; i++) {
|
||||
int targetChars = targetChars(i);
|
||||
int index = i;
|
||||
cases.add(dynamicTest(
|
||||
String.format("#%04d, %d знаков (~%d токенов)", index, targetChars, targetChars / CHARS_PER_TOKEN),
|
||||
() -> runCase(targetChars, index)));
|
||||
}
|
||||
return cases.stream();
|
||||
}
|
||||
|
||||
/**
|
||||
* Длина растёт по логарифмической шкале от предложения до порога "огромного" текста —
|
||||
* так тесты покрывают все порядки величины, а не только маленькие и не только большие.
|
||||
* Последние {@link #HUGE_CASES} индексов — обязательная полоса 90-100к токенов из ТЗ.
|
||||
*/
|
||||
private static int targetChars(int index) {
|
||||
int regular = TOTAL_CASES - HUGE_CASES;
|
||||
if (index >= regular) {
|
||||
int step = (HUGE_MAX_CHARS - HUGE_MIN_CHARS) / Math.max(1, HUGE_CASES - 1);
|
||||
return HUGE_MIN_CHARS + (index - regular) * step;
|
||||
}
|
||||
double minChars = 80;
|
||||
double maxChars = HUGE_MIN_CHARS - 1;
|
||||
double ratio = (double) index / Math.max(1, regular - 1);
|
||||
return (int) Math.round(minChars * Math.pow(maxChars / minChars, ratio));
|
||||
}
|
||||
|
||||
private void runCase(int targetChars, int seed) {
|
||||
Pipeline pipeline = new Pipeline(REGISTRY, MASKER, new PayloadStore(targetChars * 2L + 4096, 30));
|
||||
BenchmarkFixtures.Sample sample = buildText(targetChars, seed);
|
||||
String payloadId = "dataset-" + seed;
|
||||
|
||||
long maskStarted = System.nanoTime();
|
||||
String masked = pipeline.process(sample.text(), payloadId, SystemPolicy.DEFAULT);
|
||||
long maskMillis = (System.nanoTime() - maskStarted) / 1_000_000;
|
||||
|
||||
int checked = 0;
|
||||
int leaked = 0;
|
||||
for (Span gold : sample.gold()) {
|
||||
String value = sample.text().substring(gold.start(), gold.end());
|
||||
if (value.length() >= LEAK_CHECK_MIN_LENGTH) {
|
||||
checked++;
|
||||
if (masked.contains(value)) {
|
||||
leaked++;
|
||||
}
|
||||
}
|
||||
}
|
||||
if (checked > 0) {
|
||||
// На малых текстах пара пропусков — статистический шум, не деградация детектора:
|
||||
// абсолютный запас на такие случаи не даёт доле "перевесить" маленький знаменатель.
|
||||
int allowed = Math.max(4, (int) Math.ceil(checked * MAX_LEAK_RATE));
|
||||
assertTrue(leaked <= allowed,
|
||||
String.format("утечка ПДН в замаскированном тексте: %d из %d, допустимо %d",
|
||||
leaked, checked, allowed));
|
||||
}
|
||||
|
||||
String restored = pipeline.process(masked, payloadId, SystemPolicy.DEFAULT);
|
||||
assertEquals(sample.text(), restored, "демаскирование не восстановило исходный текст");
|
||||
|
||||
if (targetChars >= HUGE_MIN_CHARS) {
|
||||
assertTrue(maskMillis < 5000, "маскирование " + targetChars + " знаков заняло " + maskMillis + " мс");
|
||||
}
|
||||
}
|
||||
|
||||
/** Перемешивает строки пула детерминированно по seed и склеивает до нужного объёма. */
|
||||
private static BenchmarkFixtures.Sample buildText(int targetChars, long seed) {
|
||||
List<BenchmarkFixtures.Sample> shuffled = new ArrayList<>(POOL);
|
||||
Random random = new Random(seed);
|
||||
StringBuilder text = new StringBuilder(targetChars + 1024);
|
||||
List<Span> gold = new ArrayList<>();
|
||||
|
||||
while (text.length() < targetChars) {
|
||||
Collections.shuffle(shuffled, random);
|
||||
for (BenchmarkFixtures.Sample sample : shuffled) {
|
||||
int offset = text.length();
|
||||
text.append(sample.text()).append('\n');
|
||||
for (Span span : sample.gold()) {
|
||||
gold.add(new Span(span.start() + offset, span.end() + offset, span.type(), 0));
|
||||
}
|
||||
if (text.length() >= targetChars) {
|
||||
break;
|
||||
}
|
||||
}
|
||||
}
|
||||
return new BenchmarkFixtures.Sample(text.toString(), gold);
|
||||
}
|
||||
}
|
||||
Reference in New Issue
Block a user