4ba9c42829
En 3.4.3 `item_template` ya no existe: los datos del juego viven en ficheros
DB2 del cliente, y aquí acore_world está vacío. Se extraen a `home_item_data`
(44873 ítems): nombre es/en, calidad, nivel de objeto, tipo de inventario y
displayId.
No hay ninguna librería en PyPI que lea WDC4 (wdbx, dbc-extract3, wow-db2 no
existen), así que el lector va incluido en sql/db2/:
- `wdc_db2.py`: WDC3/WDC4 con registros fijos (bitpacked, common y pallet).
- `itemsparse.py`: ItemSparse es una tabla *sparse*, que es otro mundo: los
locstring van inline y terminados en \0, así que desplazan todo lo que va
detrás y los offsets de field_storage_info no valen. Hay que recorrer los
campos en orden, y el fichero no dice cuáles son strings: eso sale de las
definiciones oficiales de WoWDBDefs (ItemSparse.dbd, incluido), casando el
layout_hash del propio fichero (D532973D = 3.4.3).
- `db2_to_sql.py`: genera sql/item_data.sql. Regenerable y multi-locale: basta
con dejar el ItemSparse.db2 de cada idioma en /root/<locale>/.
Verificado: los 3068 ítems de la tienda están cubiertos; 2949 nombres (96%)
coinciden literalmente con el catálogo antiguo y los 119 restantes son
revisiones de traducción de Blizzard, no fallos del parser ("Bordón de Luz" ->
"Batuta de Luz"). El ítem 45327 sale q4 / ilvl 238 / "Siren's Cry", idéntico a
lo que devuelve wowhead. La distribución de calidad es realista (53
legendarios, 23 artefactos).
Ojo: la tabla está cargada pero TODAVÍA no la usa ningún código de la web.
Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
144 lines
6.5 KiB
Python
144 lines
6.5 KiB
Python
"""Lector mínimo de DB2 WDC3/WDC4 (formato de wowdev.wiki).
|
|
|
|
Solo lo necesario para sacar columnas enteras: registros normales, bitpacked,
|
|
common data y pallet (indexed). No implementa strings ni arrays de pallet, que
|
|
no hacen falta para el mapeo item -> displayId.
|
|
"""
|
|
import struct
|
|
|
|
FIELD_COMPRESSION_NONE = 0
|
|
FIELD_COMPRESSION_BITPACKED = 1
|
|
FIELD_COMPRESSION_COMMON_DATA = 2
|
|
FIELD_COMPRESSION_BITPACKED_INDEXED = 3
|
|
FIELD_COMPRESSION_BITPACKED_INDEXED_ARRAY = 4
|
|
FIELD_COMPRESSION_BITPACKED_SIGNED = 5
|
|
|
|
|
|
def _bits(data, bit_offset, bit_size):
|
|
"""Lee bit_size bits a partir de bit_offset (little-endian)."""
|
|
byte = bit_offset // 8
|
|
shift = bit_offset % 8
|
|
nbytes = (shift + bit_size + 7) // 8
|
|
chunk = data[byte:byte + nbytes]
|
|
if len(chunk) < nbytes:
|
|
chunk = chunk + b'\x00' * (nbytes - len(chunk))
|
|
val = int.from_bytes(chunk, 'little')
|
|
return (val >> shift) & ((1 << bit_size) - 1)
|
|
|
|
|
|
class DB2:
|
|
def __init__(self, path):
|
|
self.d = d = open(path, 'rb').read()
|
|
self.magic = d[:4].decode()
|
|
if self.magic not in ('WDC3', 'WDC4'):
|
|
raise ValueError(f'formato no soportado: {self.magic}')
|
|
(self.record_count, self.field_count, self.record_size, self.string_table_size,
|
|
self.table_hash, self.layout_hash, self.min_id, self.max_id, self.locale,
|
|
self.flags, self.id_index, self.total_field_count, self.bitpacked_data_offset,
|
|
self.lookup_column_count, self.field_storage_info_size, self.common_data_size,
|
|
self.pallet_data_size, self.section_count) = struct.unpack_from('<IIIIIIIIIHHIIIIIII', d, 4)
|
|
|
|
o = 4 + struct.calcsize('<IIIIIIIIIHHIIIIIII')
|
|
# WDC4 mete aquí un bloque extra de "encrypted section" opcional; en la
|
|
# práctica de estos ficheros la cabecera de sección sigue directamente.
|
|
self.sections = []
|
|
for _ in range(self.section_count):
|
|
(tact, file_offset, rec_count, str_size, offset_records_end, id_list_size,
|
|
rel_size, offset_map_id_count, copy_count) = struct.unpack_from('<QIIIIIIII', d, o)
|
|
o += 40
|
|
self.sections.append(dict(file_offset=file_offset, record_count=rec_count,
|
|
string_table_size=str_size, offset_records_end=offset_records_end,
|
|
id_list_size=id_list_size, relationship_data_size=rel_size,
|
|
offset_map_id_count=offset_map_id_count, copy_table_count=copy_count))
|
|
|
|
# field_structure
|
|
self.fields = []
|
|
for _ in range(self.field_count):
|
|
size, pos = struct.unpack_from('<hH', d, o); o += 4
|
|
self.fields.append((size, pos))
|
|
|
|
# field_storage_info
|
|
self.storage = []
|
|
for _ in range(self.field_count):
|
|
(off_bits, size_bits, extra, stype, c1, c2, c3) = struct.unpack_from('<HHIIIII', d, o)
|
|
o += 24
|
|
self.storage.append(dict(offset_bits=off_bits, size_bits=size_bits,
|
|
extra=extra, type=stype, c1=c1, c2=c2, c3=c3))
|
|
|
|
self.pallet = d[o:o + self.pallet_data_size]; o += self.pallet_data_size
|
|
self.common_raw = d[o:o + self.common_data_size]; o += self.common_data_size
|
|
|
|
# Base de cada campo dentro de pallet_data: suma acumulada de los
|
|
# additional_data_size de los campos pallet anteriores (c1/c2 son los bits
|
|
# de bitpacking, NO un offset).
|
|
self.pallet_base = {}
|
|
acc = 0
|
|
for fi, st in enumerate(self.storage):
|
|
if st['type'] in (FIELD_COMPRESSION_BITPACKED_INDEXED,
|
|
FIELD_COMPRESSION_BITPACKED_INDEXED_ARRAY):
|
|
self.pallet_base[fi] = acc
|
|
acc += st['extra']
|
|
|
|
# common data: por campo, `extra`/8 pares (id, value)
|
|
self.common = {}
|
|
p = 0
|
|
for fi, st in enumerate(self.storage):
|
|
if st['type'] == FIELD_COMPRESSION_COMMON_DATA and st['extra']:
|
|
m = {}
|
|
for _ in range(st['extra'] // 8):
|
|
k, v = struct.unpack_from('<II', self.common_raw, p); p += 8
|
|
m[k] = v
|
|
self.common[fi] = m
|
|
|
|
self.rows = []
|
|
for s in self.sections:
|
|
self._read_section(s)
|
|
|
|
def _read_section(self, s):
|
|
d = self.d
|
|
o = s['file_offset']
|
|
if self.flags & 0x1: # sparse: offset map en vez de registros fijos
|
|
raise NotImplementedError('tabla sparse (offset map) no soportada')
|
|
rec_data = d[o:o + s['record_count'] * self.record_size]
|
|
o += s['record_count'] * self.record_size
|
|
o += s['string_table_size']
|
|
ids = None
|
|
if s['id_list_size']:
|
|
ids = list(struct.unpack_from(f'<{s["id_list_size"] // 4}I', d, o))
|
|
o += s['id_list_size']
|
|
# copy table y relationship data: no se usan aquí
|
|
|
|
for i in range(s['record_count']):
|
|
rec = rec_data[i * self.record_size:(i + 1) * self.record_size]
|
|
row = [self._field(rec, fi, i) for fi in range(self.field_count)]
|
|
rid = ids[i] if ids is not None else row[self.id_index]
|
|
# common data: valor por id, o el default (c1) si no está listado
|
|
for fi, st in enumerate(self.storage):
|
|
if st['type'] == FIELD_COMPRESSION_COMMON_DATA:
|
|
row[fi] = self.common.get(fi, {}).get(rid, st['c1'])
|
|
self.rows.append((rid, row))
|
|
|
|
def _field(self, rec, fi, rec_index):
|
|
st = self.storage[fi]
|
|
t = st['type']
|
|
if t == FIELD_COMPRESSION_NONE:
|
|
if st['size_bits'] == 0:
|
|
return 0
|
|
return _bits(rec, st['offset_bits'], st['size_bits'])
|
|
if t in (FIELD_COMPRESSION_BITPACKED, FIELD_COMPRESSION_BITPACKED_SIGNED):
|
|
v = _bits(rec, st['offset_bits'], st['size_bits'])
|
|
if t == FIELD_COMPRESSION_BITPACKED_SIGNED:
|
|
sign = 1 << (st['size_bits'] - 1)
|
|
if v & sign:
|
|
v -= 1 << st['size_bits']
|
|
return v
|
|
if t == FIELD_COMPRESSION_COMMON_DATA:
|
|
return None # se resuelve en _read_section, que sí conoce el id
|
|
if t in (FIELD_COMPRESSION_BITPACKED_INDEXED, FIELD_COMPRESSION_BITPACKED_INDEXED_ARRAY):
|
|
idx = _bits(rec, st['offset_bits'], st['size_bits'])
|
|
off = self.pallet_base[fi] + idx * 4
|
|
if off + 4 <= len(self.pallet):
|
|
return struct.unpack_from('<I', self.pallet, off)[0]
|
|
return 0
|
|
raise NotImplementedError(f'storage type {t}')
|