---
tags: [ingles, recursos]
created: 2026-08-19
updated: 2026-08-19
---

# Libros y material

Todo vive en una carpeta compartida de Drive (`Compartido conmigo > INGLES`). Al vault solo baja **lo que estoy usando**, nunca la colección entera.

## Libro espina

**Navigate B1+ Intermediate**, en `BRITANICO / B2 Upper Intermediate`.

- Unidad actual: (por empezar)

Por qué este, con el inventario delante:

- De los cinco niveles de Navigate, la carpeta `Audio and video scripts` **solo existe en A2, B1 y B1+**. A1 y C1 tienen audio y video pero sin transcripción, y eso los mata
- B1+ es el más alto de los tres que sí la tienen
- Los **Wordlists** (13 PDFs) son listas de vocabulario por unidad, alimentan [[02-Areas/English/vocab|la cola]] directo
- Los **mark schemes de Speaking y de Writing** son las rúbricas del examinador, sirven para autoevaluarme con el mismo criterio

| Pieza | Qué hay |
|---|---|
| Coursebook | 240p (Teacher's Ed) + 145 audios |
| Workbook | 113p + 70 audios |
| Video | Reports 1-12 y Voxpops 1-12 |
| Audio and video scripts | coursebook, workbook, videoscripts, voxpops, tests |
| Wordlists | 13 PDFs |
| Tests + Answer keys | con mark scheme de Speaking y Writing |

## Reserva

- **Focus on Pronunciation 3** (`ICPNA / 3.- ADVANCED`), A, B y C con 50 audios. Único material de pronunciación dedicado del Drive. Se activa solo si el problema resulta ser pronunciación
- **NorthStar 7-9** y **Pathways** (mismo sitio), listening académico, cercano al registro de IELTS. Segunda fuente
- **Navigate C1**, el siguiente escalón cuando B1+ quede corto. No tiene scripts

## Descartado

| Material | Motivo |
|---|---|
| Navigate C1 y A1 | sin `Audio and video scripts` |
| Navigate A1, A2 | por debajo del nivel |
| Roadmap B2 | 3 PDFs, sin audio |
| Top Notch | 4 PDFs, sin audio |
| Empower (PUCP) | 3 PDFs por nivel, no compite con Navigate |
| Cursos de INGLES EXTRA | vídeos en español, media carpeta de Avanzado vacía |
| Methodology | es para enseñar inglés, no para aprenderlo |

## No hay material de IELTS

Revisado todo el Drive. `CAMBRIDGE PREPARACION`, `BRITANICO/Exam` y `Gold` son **Cambridge B2 First (FCE)**, otro examen, otro formato y otra puntuación.

En 11.3 GB no hay nada de IELTS. Los Cambridge IELTS 15-19 se consiguen aparte cuando se abra el proyecto.

## Material en el servidor

2.8 GB en `/data/databases/Julio/english/`, **fuera del vault**. Se borra cuando el procesamiento termine.

- `navigate-b1plus/` 858.8 MB
- `navigate-c1/` 987.1 MB
- `icpna-advanced/` 953.9 MB

### Los audioscripts estaban donde no miraba

El corte por nombre de carpeta estaba mal. Los Teacher's Guide traen **los audioscripts completos dentro del PDF**, con capa de texto:

- `307_9` (B1+, 265 pág, 1.08M chars), audioscript en 102 páginas y videoscript en 13
- `309_9` (C1, 263 pág, 1.11M chars), audioscript en 90 páginas y videoscript en 12

Verificado abriendo la página 40 del de C1: sale `AUDIOSCRIPT 1.3` con el texto corrido debajo de las respuestas del ejercicio.

O sea, **Navigate no necesita Whisper en ningún nivel**. B1+ lo tiene por partida doble, en los 5 PDFs sueltos del resource disk y otra vez en el Teacher's Guide.

### Lo único que sí va a Whisper

**ICPNA Advanced**: 211 mp3, **10.17 horas** de audio. Ninguno de sus PDFs trae audioscript.

| Carpeta | Horas |
|---|---|
| Focus on Grammar | 3.26 |
| Listening and Speaking (Pathways) | 2.87 |
| NorthStar | 2.12 |
| Focus on Pronunciation | 1.93 |

Los nombres de archivo ya vienen mapeados, tipo `08_01_Unit_08_Read_124.mp3`, así que cada `.srt` hereda unidad, ejercicio y página del libro. El propio audio además empieza diciendo "Unit 8, page 124".

### Corrección sobre el OCR

Dije que no hacía falta OCR porque los PDFs eran digitales. **Un tercio son escaneados**, sin capa de texto: NorthStar 7/8/9, Focus on Grammar AG1/AG2/AG3, Focus on Pronunciation 3, los Coursebook, Workbook y Teacher's Notes de C1, el Workbook y Teacher's Notes de B1+, y el Gold C1.

No cambia el plan. Lo que hace falta leer (los Teacher's Guide con los audioscripts, los wordlists, los answer keys) sí tiene texto. Los escaneados son libros de ejercicios, que se hacen a mano.

### Transcripción

`assets/codes/transcribir.py` con faster-whisper y `large-v3`, dos RTX A5500. Medido: **12.4x tiempo real** por GPU, así que las 10 horas salen en unos 25 minutos repartidas entre las dos.

Saca **`.srt`, no `.txt`**, a propósito. El timestamp es lo que permite preguntar "minuto 12:34 no entendí" y que la skill `ingles-vocab` lo resuelva. Van a `subs/`, que sí entra a git porque es texto ligero y se sincroniza a Windows solo.

El `ffprobe` del entorno `deep` está roto, le falta `libx264`. No estorba, faster-whisper decodifica con PyAV.

## Qué quedó en el vault

Todo el texto útil, 4 MB en total, y todo entra a git y se sincroniza a Windows.

```
02-Areas/English/
├── subs/icpna-advanced/       211 .srt  (1.3 MB)
│   ├── Focus on Grammar/            56
│   ├── Focus on Pronunciation/      50
│   ├── Listening and Speaking/      89
│   └── NorthStar Audios/            16
└── scripts/                    25 .txt  (2.7 MB)
    ├── navigate-b1plus/
    │   ├── Coursebook audioscripts.txt
    │   ├── Workbook audioscripts.txt
    │   ├── Coursebook videoscripts.txt
    │   ├── Vox pops videoscripts.txt
    │   ├── Audioscripts for tests.txt
    │   ├── teachers-guide.txt
    │   ├── wordlists/       13 unidades + A-Z
    │   └── answer-keys/     con los mark schemes de Speaking y Writing
    └── navigate-c1/
        └── teachers-guide.txt   110 bloques AUDIOSCRIPT + 12 VIDEOSCRIPT
```

Los `.srt` llevan timestamp porque vienen de audio y sirven para preguntar por minuto. Los `.txt` no lo necesitan, el propio libro numera cada pista.

El audio y los PDFs se quedan en Windows, en `C:\INGLES`. Al servidor no vuelven.

## Triaje del Drive

Se hace una vez, sobre el inventario, no abriendo archivos.

Generar el inventario con `assets/codes/inventario.py`, que saca el árbol con tamaños, el tipo de archivo por carpeta y los nombres de los PDFs.

Criterios de corte, en este orden:

1. **¿Tiene audio?** Sin audio, un libro solo sirve para gramática, y la gramática la resuelvo preguntando. Se descarta
2. **¿Tiene transcripción del audio?** Sin script no puedo depurar lo que no pesqué. Baja mucho de valor
3. **¿Es curso completo o piezas sueltas?** Un paquete con workbook, tests y answer keys se sostiene solo. Un PDF suelto no
4. **¿Está a mi nivel o por debajo?** Lo que quede por debajo se descarta entero, aunque esté completo
5. **¿Es de alumno o de profesor?** La Teacher's Edition trae respuestas impresas, sirve para leer pero no para practicar
6. **¿Está repetido?** Si el mismo libro aparece en tres carpetas, se queda una copia

Lo que sobrevive entra en este archivo con su ruta. Lo demás se queda en Drive y no se baja.

## Cómo se usa

- Una unidad a la vez, en orden
- El coursebook que hay es la **Teacher's Edition** y trae las respuestas impresas. Los ejercicios se hacen en el **Workbook**, que va limpio. El coursebook queda para leer y para los audios
- El audio se escucha primero sin mirar el texto. Donde me trabo, voy a `Audio and video scripts`
- Lo que se traba de oído va a las [[02-Areas/English/vocab#Frases de escucha|frases de escucha]], no a la tabla de términos
- Los ejercicios no se copian al vault. El libro es la secuencia, el vault es lo que se me atraviesa

## Dónde van los archivos

- PDF en `assets/pdf/`
- Audio en `assets/audio/`

Ambas están en `.gitignore`. El vault se auto-comitea y el `.git` ya pasa de 100 MB. Un PDF que entra al historial se queda ahí para siempre aunque después se borre.

Los PDFs son digitales, no escaneados, así que **no hace falta OCR**.

## Resto del material

No se baja. Si hace falta algo puntual, se busca en Drive y se baja ese archivo suelto.
