Кампания на пять равных долей: контейнер сразу считает свою часть

gen_scenarios.py раскладывает 115 прогонов по пяти долям (LPT, поправка
на размер сетки по замерам dzn) — по ≈24 ч каждая; поле shard в
scenarios.json. run_campaign.sh/.ps1 получили --shard. Новая точка входа
образа entrypoint.sh: при KBC2D_SHARD сама выбирает путь к карте (dzn
или NVIDIA), проверяет vulkaninfo и parity.py и запускает долю. Для
чужих ПК под Windows/WSL2 — docker-compose.shards.yml и shard.bat.
Образ notbigghost/kbc2d:1.3.0.

Co-Authored-By: Claude Opus 5.5 <noreply@anthropic.com>
This commit is contained in:
2026-10-01 20:15:40 +03:00
co-authored by Claude Opus 5.5
parent 3e81ed130c
commit 1d495e3e89
12 changed files with 582 additions and 130 deletions
+60 -1
View File
@@ -6,9 +6,67 @@
схемы. Каждый прогон кладёт в собственную папку `cmd.txt`, `log.txt`, `report.txt`, `series.csv`
и `summary.json`; гифку пишут **59 прогонов из 115** — остальным `--gif` не передаётся.
## Пять долей: чужие ПК под Windows / WSL2
Кампания разложена на **пять долей, равных по времени**: у каждого прогона в `scenarios.json`
есть поле `shard` (1…5). Каждая доля — отдельный контейнер, который при развёртывании **сразу
начинает считать**: ни сборки, ни ручной цепочки проверок, всё окружение (решатель, Vulkan-
загрузчик, dzn, Python) — внутри образа.
На машину переносятся два файла из корня решателя — `docker-compose.shards.yml` и `shard.bat`:
```bat
shard.bat 3
```
или из любой оболочки:
```sh
docker compose -f docker-compose.shards.yml up -d shard3
docker compose -f docker-compose.shards.yml logs -f shard3
```
При старте контейнер (`entrypoint.sh`) сам делает то, что раньше делалось профилями check:
1. выбирает путь к карте — есть `/dev/dxg`, значит WSL2 / Docker Desktop и dzn; нет —
нативный Linux с NVIDIA Container Toolkit;
2. проверяет `vulkaninfo`: нужен хотя бы один не программный адаптер;
3. гоняет `parity.py` (~2 мин) и только при совпадении с CPU-эталоном идёт дальше; после
успеха кладёт `out/parity_shardN.ok`, и перезапуск сверку не повторяет;
4. `run_campaign.sh --resume --shard N`.
Любой провал на шагах 1–3 останавливает контейнер с объяснением, что поправить на хосте, — а
не отдаёт кампанию считать впустую.
**В контейнер нельзя положить** драйвер видеокарты: он должен стоять в самой Windows (Vulkan
внутри контейнера — это dzn, транслирующий вызовы в D3D12 драйвера хоста). И нужен Docker
Desktop с бэкендом WSL2 (так по умолчанию) либо Docker внутри WSL2.
| доля | прогонов | ≈ часов |
|---|---|---|
| 1 | 22 | 24.0 |
| 2 | 23 | 24.0 |
| 3 | 23 | 24.0 |
| 4 | 23 | 24.0 |
| 5 | 24 | 24.0 |
Часы — оценка при 1200 MLUPS на крупной сетке **с поправкой на размер сетки**: на dzn мелкие
сетки считаются медленнее на узел, а сверхмелкие из группы I идут через раздельные привязки
(кривая — `DZN_MLUPS` в `gen_scenarios.py`, по замерам из раздела «Чего трансляция стоит по
скорости»). Раскладка жадная: самый долгий прогон — в самую лёгкую долю. Девять прогонов
группы I (по ≈8.7 ч) разошлись по два на долю в четырёх долях, пятая получила один и добрала остальным.
Равенство долей — равенство на **одинаковых** картах: на разных доли закончатся в разное время.
Абсолютные часы на конкретной карте — `--dry-run --shard N` после `--calibrate`.
Пересобрать раскладку под другое число машин: `python gen_scenarios.py --shards 3`.
**Сбор результатов.** Каждая доля пишет в `./out` рядом с compose-файлом: каталоги прогонов
`out/<id>/` (уникальны по id), свою сводку `summary_shardN.csv` и свой журнал
`campaign_shardN.log`. Собрать кампанию целиком — скопировать все пять `out/` в одну папку.
## Быстрый старт на сервере
Образ опубликован, собирать ничего не нужно: **`notbigghost/kbc2d:1.2.0`**. Исходники на
Образ опубликован, собирать ничего не нужно: **`notbigghost/kbc2d:1.3.0`**. Исходники на
сервере тоже не нужны — переносится один файл `docker-compose.server.yml`.
```sh
@@ -186,6 +244,7 @@ KBC2D_GPU_MLUPS=1400 ./run_campaign.sh --dry-run
| `--group A,B` | только выбранные группы |
| `--only cyl_re150` | по подстроке идентификатора |
| `--budget-hours 24` | остановиться, когда время выйдет |
| `--shard 3` | только доля 3 (поле `shard` в `scenarios.json`); то же — переменная `KBC2D_SHARD` |
Прогон, который упал или развалился, помечается в сводке и **не останавливает кампанию**:
группы E и G специально ищут предел устойчивости, там развал — ожидаемый результат.
+66
View File
@@ -0,0 +1,66 @@
#!/usr/bin/env bash
# Точка входа образа.
#
# Без KBC2D_SHARD — ровно прежнее поведение: аргументы уходят в run_campaign.sh, а по
# умолчанию (CMD --dry-run) печатается смета. Профили check в compose-файлах работают как раньше.
#
# С KBC2D_SHARD=K контейнер — одна из долей кампании, и считать он начинает сам, без ручной
# цепочки vulkan → parity → plan. Перед стартом три шага, каждый обрывает запуск с понятным
# сообщением, а не даёт кампании уйти считать впустую:
# 1. путь к карте: /dev/dxg есть — значит WSL2 или Docker Desktop, и работает dzn;
# нет — настоящий Linux, Vulkan-ICD подкладывает NVIDIA Container Toolkit;
# 2. vulkaninfo должен увидеть хотя бы один НЕпрограммный адаптер;
# 3. parity.py — сверка GPU с CPU-f64 на двух эталонах (~2 мин). Один раз на каталог out:
# после успеха кладётся маркер, и перезапуск контейнера её не повторяет.
set -u
cd "$(dirname "$0")"
[ -n "${KBC2D_SHARD:-}" ] || exec ./run_campaign.sh "$@"
K="$KBC2D_SHARD"
OUT="${KBC2D_OUT:-out}"
mkdir -p "$OUT"
say() { echo "[доля $K] $*"; }
die() { echo; echo "[доля $K] ОСТАНОВЛЕНО: $*" >&2; exit 3; }
# ── 1. путь к карте ──────────────────────────────────────────────────────────
if [ -e /dev/dxg ]; then
say "найден /dev/dxg — WSL2 / Docker Desktop, Vulkan через dzn (Vulkan → D3D12)"
[ -d /usr/lib/wsl/lib ] || die "нет /usr/lib/wsl/lib: смонтируйте /usr/lib/wsl:/usr/lib/wsl:ro
(в docker-compose.shards.yml это уже прописано)"
export LD_LIBRARY_PATH="${LD_LIBRARY_PATH:-/usr/lib/wsl/lib}"
# dzn сообщает conformanceVersion 0.0.0.0, и без согласия wgpu его прячет. Согласие
# оправдано только потому, что шаг 3 ниже проверяет числа.
export WGPU_ALLOW_UNDERLYING_NONCOMPLIANT_ADAPTER="${WGPU_ALLOW_UNDERLYING_NONCOMPLIANT_ADAPTER:-1}"
else
say "/dev/dxg нет — нативный Linux, Vulkan-драйвер NVIDIA от Container Toolkit"
fi
# ── 2. видна ли карта ────────────────────────────────────────────────────────
info=$(vulkaninfo --summary 2>&1)
gpus=$(printf '%s\n' "$info" | grep -E 'deviceType *=' | grep -vc 'PHYSICAL_DEVICE_TYPE_CPU')
if [ "$gpus" -lt 1 ]; then
printf '%s\n' "$info" | tail -20 >&2
die "Vulkan не видит ни одной видеокарты. Что проверить на хосте:
* Windows / WSL2: драйвер видеокарты под Windows установлен и свежий; Docker Desktop
работает на бэкенде WSL2; контейнеру проброшены /dev/dxg и /usr/lib/wsl.
* Linux: установлен nvidia-container-toolkit, контейнер запущен с GPU, и в
NVIDIA_DRIVER_CAPABILITIES есть graphics (сейчас: ${NVIDIA_DRIVER_CAPABILITIES:-не задано})."
fi
printf '%s\n' "$info" | grep -E 'deviceName *=|driverName *=|deviceType *=' | sed 's/^ */ /'
# ── 3. считает ли карта правильно ────────────────────────────────────────────
mark="$OUT/parity_shard$K.ok"
if [ -f "$mark" ]; then
say "сверка GPU с CPU уже пройдена ранее ($mark)"
else
say "сверка GPU с CPU-эталоном (parity.py, около двух минут)…"
python3 parity.py || die "GPU расходится с CPU-эталоном — результаты этой машины нечем
защищать. Вывод сверки выше. Повторить: удалить контейнер и поднять заново."
date -Is > "$mark"
fi
# ── кампания ─────────────────────────────────────────────────────────────────
say "старт: run_campaign.sh --resume --shard $K"
exec ./run_campaign.sh --resume --shard "$K" "$@"
+59 -3
View File
@@ -5,6 +5,7 @@
# получаются циклами, а стоимость каждого прогона считается тут же и суммируется. Запуск:
# python gen_scenarios.py # перезаписать scenarios.json и напечатать смету
# python gen_scenarios.py --scale 2 # растянуть все длительности вдвое
# python gen_scenarios.py --shards 5 # на сколько равных по времени долей делить кампанию
#
# Стоимость меряется в ОБНОВЛЕНИЯХ УЗЛОВ (nodes_per_step * steps) — единственная переносимая
# между машинами мера. Часы драйвер получает из неё, поделив на фактические MLUPS, которые
@@ -23,6 +24,18 @@ GIF_MAX_W = 1280 # предельная ширина кадра после
GIF_MIN_W = 480 # ниже не опускаемся: нечитаемая гифка бесполезнее большой
GIF_PX_BUDGET = 1.5e9 # кадры×пиксели на гифку; при 0.103 байта на пиксель это ~150 МБ
# Доли кампании: прогоны раскладываются по N контейнерам так, чтобы те считали примерно
# одинаковое ВРЕМЯ, а не одинаковое число узлов. Время на узел зависит от размера сетки:
# на мелкой накладные расходы на отправку в очередь дороже самого счёта. Кривая — замер
# dzn в контейнере (Intel Iris Xe, bench/README.md, «Чего трансляция стоит по скорости»),
# потому что доли рассчитаны на чужие Windows/WSL-машины, где путь к карте — именно dzn.
# Важна только ФОРМА кривой: абсолют нормируется к ASSUMED_GPU_MLUPS.
ASSUMED_GPU_MLUPS = 1200
ASSUMED_CPU_MLUPS = 22
DZN_MLUPS = [(61_440, 44.5), (460_800, 86.0), (1_843_200, 98.7)]
SPLIT_NODES = 3_730_000 # выше — раздельные привязки популяций, у них своя скорость
SPLIT_MLUPS = 67.4 # замер на 2048×2048
def conv_steps(d_cells, n_conv, u_lat=U_LAT):
"""Сколько шагов нужно на n_conv конвективных времён D/U."""
@@ -472,15 +485,50 @@ def group_i(scale):
nx * ny, st, gif="fine_multi.gif", nx=nx)
def est_hours(r):
"""Оценка времени прогона в часах для раскладки по долям (см. DZN_MLUPS)."""
if r["backend"] == "cpu":
return r["cost"] / (ASSUMED_CPU_MLUPS * 1e6) / 3600
n = r["nodes_per_step"]
if n > SPLIT_NODES:
m = SPLIT_MLUPS
elif n <= DZN_MLUPS[0][0]:
m = DZN_MLUPS[0][1]
elif n >= DZN_MLUPS[-1][0]:
m = DZN_MLUPS[-1][1]
else:
for (n0, m0), (n1, m1) in zip(DZN_MLUPS, DZN_MLUPS[1:]):
if n <= n1:
t = math.log(n / n0) / math.log(n1 / n0)
m = m0 + t * (m1 - m0)
break
rel = m / DZN_MLUPS[-1][1]
return r["cost"] / (ASSUMED_GPU_MLUPS * 1e6 * rel) / 3600
def assign_shards(runs, n):
"""Разложить прогоны по n долям жадно (LPT): самый долгий — в самую лёгкую долю.
Порядок прогонов внутри доли остаётся порядком групп. Возвращает часы по долям."""
load = [0.0] * n
for r in sorted(runs, key=lambda r: (-est_hours(r), r["id"])):
k = min(range(n), key=lambda i: load[i])
r["shard"] = k + 1
load[k] += est_hours(r)
return load
def main():
ap = argparse.ArgumentParser()
ap.add_argument("--scale", type=float, default=2.0,
help="общий множитель длительности всех прогонов")
ap.add_argument("--shards", type=int, default=5,
help="на сколько равных по времени долей делить кампанию")
ap.add_argument("--out", default=os.path.join(os.path.dirname(__file__), "scenarios.json"))
args = ap.parse_args()
for g in (group_a, group_b, group_c, group_d, group_e, group_f, group_g, group_h, group_i):
g(args.scale)
shard_hours = assign_shards(RUNS, args.shards)
doc = {
"meta": {
@@ -490,12 +538,14 @@ def main():
"gif_policy": "вся длительность прогона, реальная скорость, 10 кадр/с; кадр "
"прореживается до ширины не больше 1280 пикселей",
"scale": args.scale,
"assumed_gpu_mlups": 1200,
"assumed_cpu_mlups": 22,
"assumed_gpu_mlups": ASSUMED_GPU_MLUPS,
"assumed_cpu_mlups": ASSUMED_CPU_MLUPS,
"shards": args.shards,
"shard_hours": [round(h, 2) for h in shard_hours],
},
"runs": RUNS,
}
with open(args.out, "w", encoding="utf-8") as f:
with open(args.out, "w", encoding="utf-8", newline="\n") as f:
json.dump(doc, f, ensure_ascii=False, indent=1)
print(f"прогонов: {len(RUNS)} файл: {args.out}\n")
@@ -513,6 +563,12 @@ def main():
f"{tot_gpu:>12.1f}{tot_cpu:>12.1f}")
print(f"\nвсего ≈ {tot_gpu + tot_cpu:.1f} ч при 1200 MLUPS на GPU и 22 на CPU")
print("\nдоли (часы с поправкой на размер сетки, см. DZN_MLUPS):")
for k, h in enumerate(shard_hours, 1):
n = sum(1 for r in RUNS if r["shard"] == k)
print(f" доля {k}: {n:>3} прогонов ≈ {h:5.1f} ч")
print(f" разброс: {(max(shard_hours) / min(shard_hours) - 1) * 100:.1f} %")
if __name__ == "__main__":
main()
@@ -7,6 +7,7 @@
# .\run_campaign.ps1 -Smoke
# .\run_campaign.ps1 -Resume -Group A,B
# .\run_campaign.ps1 -Only cyl_re150 -BudgetHours 6
# .\run_campaign.ps1 -Resume -Shard 3
[CmdletBinding()]
param(
@@ -16,6 +17,7 @@ param(
[switch]$Smoke,
[string[]]$Group,
[string]$Only,
[int]$Shard = 0,
[double]$BudgetHours = 0,
[string]$Bin = "..\target\release\kbc2d.exe",
[string]$Scenarios = "scenarios.json",
@@ -45,6 +47,7 @@ if ($Calibrate) {
$runs = (Get-Content $Scenarios -Raw -Encoding UTF8 | ConvertFrom-Json).runs
if ($Group) { $g = $Group | ForEach-Object { $_.ToUpper() }; $runs = $runs | Where-Object { $g -contains $_.group.ToUpper() } }
if ($Shard) { $runs = $runs | Where-Object { $_.shard -eq $Shard } }
if ($Only) { $runs = $runs | Where-Object { $_.id -like "*$Only*" } }
if ($Smoke) { $runs = $runs | Sort-Object cost | Select-Object -First 3 }
if (-not $runs) { "под выборку не попал ни один прогон"; return }
@@ -67,6 +70,11 @@ if ($DryRun) {
New-Item -ItemType Directory -Force $Out | Out-Null
$summary = Join-Path $Out 'summary.csv'
$log = Join-Path $Out 'campaign.log'
# у каждой доли своя сводка и свой журнал, как в run_campaign.sh
if ($Shard) {
$summary = Join-Path $Out "summary_shard$Shard.csv"
$log = Join-Path $Out "campaign_shard$Shard.log"
}
if (-not (Test-Path $summary)) { 'id,group,backend,status,seconds,steps,cost,title' | Out-File $summary -Encoding utf8 }
$started = Get-Date
+14 -2
View File
@@ -9,6 +9,7 @@
# ./run_campaign.sh --group A,B только выбранные группы
# ./run_campaign.sh --only cyl_re150 по подстроке идентификатора
# ./run_campaign.sh --budget-hours 24 остановиться, когда время выйдет
# ./run_campaign.sh --shard 3 только доля 3 из scenarios.json (или KBC2D_SHARD=3)
#
# Прогон, который упал или развалился, помечается в сводке и НЕ останавливает кампанию:
# группы E и G специально ищут предел устойчивости.
@@ -23,6 +24,7 @@ OUT="${KBC2D_OUT:-out}"
# молча игнорируется, а "$GROUPS" под root разворачивается в 0 — и выборка съедает всю
# кампанию, не сказав ни слова. Отсюда GRP_SEL.
DRY=0; RESUME=0; CALIB=0; SMOKE=0; GRP_SEL=""; ONLY=""; BUDGET=""
SHARD="${KBC2D_SHARD:-}"
GPU_MLUPS="${KBC2D_GPU_MLUPS:-1200}"
CPU_MLUPS="${KBC2D_CPU_MLUPS:-22}"
@@ -35,7 +37,8 @@ while [ $# -gt 0 ]; do
--group) GRP_SEL="$2"; shift ;;
--only) ONLY="$2"; shift ;;
--budget-hours) BUDGET="$2"; shift ;;
-h|--help) sed -n '2,20p' "$0"; exit 0 ;;
--shard) SHARD="$2"; shift ;;
-h|--help) sed -n '2,21p' "$0"; exit 0 ;;
*) echo "неизвестный ключ: $1" >&2; exit 2 ;;
esac
shift
@@ -65,13 +68,22 @@ fi
mkdir -p "$OUT"
SUMMARY="$OUT/summary.csv"
LOG="$OUT/campaign.log"
# У каждой доли своя сводка и свой журнал: папки out/ с разных машин сливаются простым
# копированием (каталоги прогонов уникальны по id), а доли на одной машине не пишут в один файл.
if [ -n "$SHARD" ]; then
SUMMARY="$OUT/summary_shard$SHARD.csv"
LOG="$OUT/campaign_shard$SHARD.log"
fi
[ -f "$SUMMARY" ] || echo "id,group,backend,status,seconds,steps,cost,title" > "$SUMMARY"
# Выборку и порядок считает python: разбирать JSON башем — верный способ ошибиться.
PLAN=$("$PY" - "$SCEN" "$GRP_SEL" "$ONLY" "$SMOKE" <<'PYEOF'
PLAN=$("$PY" - "$SCEN" "$GRP_SEL" "$ONLY" "$SMOKE" "$SHARD" <<'PYEOF'
import json, sys
scen, groups, only, smoke = sys.argv[1], sys.argv[2], sys.argv[3], sys.argv[4] == "1"
shard = sys.argv[5]
runs = json.load(open(scen, encoding="utf-8"))["runs"]
if shard:
runs = [r for r in runs if str(r.get("shard")) == shard]
if groups:
keep = {g.strip().upper() for g in groups.split(",")}
runs = [r for r in runs if r["group"].upper() in keep]
File diff suppressed because it is too large Load Diff