Skip to content

FreeToken ROCm Watch — notification channel - #1

Draft
Castoff995 wants to merge 1 commit into
mainfrom
automation/freetoken-rocm-watch-log
Draft

FreeToken ROCm Watch — notification channel#1
Castoff995 wants to merge 1 commit into
mainfrom
automation/freetoken-rocm-watch-log

Conversation

@Castoff995

Copy link
Copy Markdown
Owner

Этот PR служит постоянным каналом уведомлений для автоматической проверки GitHub каждые 2 часа. Его не нужно ревьюить, мержить или закрывать, пока слежка нужна.

Высший приоритет

Рабочие форки

  • PialGhosh2233/FreeToken-rocm-gfx1200:gfx1200-moe-gguf.
  • Maxritz/FreeToken-rocm-test:main.

Зависимости

  • ROCm/TheRock — Windows/RDNA4/gfx1201 wheels, PyTorch/HIP regressions and releases.
  • triton-lang/triton-windows — Windows AMD/HIP support and releases.
  • apache/tvm-ffi — Windows/HIP JIT and cache/toolchain changes.

Устойчивость модели

Также отслеживаются изменения, способные повлиять на первый токен и практический перевод: Qwen3.6/NVFP4, MoE offload, hybrid_radix, pinned/pageable residency, mapped device pointers, long-prefill/KV-cache hangs and engine crashes.

Уведомление публикуется только при существенном изменении: новый релевантный issue/PR, новый commit в ключевом PR/форке, изменение draft/merge/CI/state, новый релиз либо подтверждённый gfx1201/Windows результат. При отсутствии новостей комментариев не будет.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch запущен. Проверка выполняется каждые 2 часа; при отсутствии существенных изменений комментариев не будет.

Текущий P0 baseline:

Ключевые issues: FreeToken Roadmap (2026), ROCm RDNA4 gfx1201 Ported. Windows only for now. Test please, Native Windows is classified as pin-uncapped, so #112's per-layer residency never auto-engages, Windows/ROCm on RX 9060 XT (gfx1200): packed GGUF working end-to-end (dense + MoE), root cause of the RDNA4 offload-decode TDR, benchmarks vs llama.cpp.

Дополнительно отслеживаются fork commits, ROCm/TheRock, Triton Windows, TVM-FFI, PyTorch gfx1201, Qwen3.6/NVFP4, mapped host pointers, pin-budget, long-prefill и offload stability.

@github-actions

github-actions Bot commented Aug 24, 2026

Copy link
Copy Markdown

{"branches":{"FlashML-org/FreeToken:main":{"branch":"main","date":"2026-08-26T07:41:24Z","message":"chore(assets): update wechat group QR code","repo":"FlashML-org/FreeToken","sha":"9ef3651309fe4058672f2cc92069238dea06be1b","url":"FlashML-org@9ef3651309fe4058672f2cc92069238dea06be1b"},"Maxritz/FreeToken-rocm-test:main":{"branch":"main","date":"2026-08-26T08:26:56Z","message":"Merge pull request Maxritz#2 from PialGhosh2233/main","repo":"Maxritz/FreeToken-rocm-test","sha":"89f14790de7bbc69dd61a999ee76b86ba8316f26","url":"Maxritz@89f14790de7bbc69dd61a999ee76b86ba8316f26"},"PialGhosh2233/FreeToken-rocm-gfx1200:gfx1200-moe-gguf":{"branch":"gfx1200-moe-gguf","date":"2026-08-26T07:51:22Z","message":"docs: Gemma-4-26B-A4B QAT q4_0 GGUF results on gfx1200","repo":"PialGhosh2233/FreeToken-rocm-gfx1200","sha":"a338f49b93e2f098eeb3aa83423c9c5386c53ac4","url":"PialGhosh2233@a338f49b93e2f098eeb3aa83423c9c5386c53ac4"}},"discovered":{"FlashML-org/FreeToken#103%22:%7B%22body_hash%22:%225cc83924c09bfe42%22,%22comments%22:3,%22kind%22:%22pr%22,%22number%22:103,%22repo%22:%22FlashML-org/FreeToken%22,%22state%22:%22open%22,%22title%22:%22feat(kvcache): 8-bit KV cache (q8_0 / fp8_e4m3) behind --kv-cache-dtype","updated_at":"2026-08-26T00:18:30Z","url":"https://github.com/FlashML-org/FreeToken/pull/103"},"FlashML-org/FreeToken#104":{"body_hash":"0ba9970c69c92be9","comments":9,"kind":"pr","number":104,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(models): support TP for qwen3_5_moe","updated_at":"2026-08-27T16:03:01Z","url":"https://github.com/FlashML-org/FreeToken/pull/104"},"FlashML-org/FreeToken#16":{"body_hash":"fb266d8bbe40557f","comments":1,"kind":"issue","number":16,"repo":"FlashML-org/FreeToken","state":"open","title":"NotImplementedError: GPUs on both sides of the sm_89 fp8 boundary in one process: the host-side e4m3 convention is process-global","updated_at":"2026-08-28T00:17:11Z","url":"https://github.com/FlashML-org/FreeToken/issues/16"},"FlashML-org/FreeToken#163":{"body_hash":"3354c81f6b608f8b","comments":2,"kind":"issue","number":163,"repo":"FlashML-org/FreeToken","state":"open","title":"Model catalog shows models the local machine cannot run (no capability pre-check before display)","updated_at":"2026-08-26T03:08:36Z","url":"https://github.com/FlashML-org/FreeToken/issues/163"},"FlashML-org/FreeToken#176":{"body_hash":"04e37c143183da8a","comments":1,"kind":"issue","number":176,"repo":"FlashML-org/FreeToken","state":"open","title":"Feature: Predictive Expert Offloading","updated_at":"2026-08-27T11:52:50Z","url":"https://github.com/FlashML-org/FreeToken/issues/176"},"FlashML-org/FreeToken#182":{"body_hash":"74dc75c6a8458390","comments":1,"kind":"issue","number":182,"repo":"FlashML-org/FreeToken","state":"open","title":"Bug in PyTorch 2.11 causes SM89 hangs","updated_at":"2026-08-28T02:01:26Z","url":"https://github.com/FlashML-org/FreeToken/issues/182"},"FlashML-org/FreeToken#183":{"body_hash":"d9234165f0ba8b4d","comments":0,"kind":"issue","number":183,"repo":"FlashML-org/FreeToken","state":"open","title":"Apodex-1.1-mini-NVFP4 fails: dense_quant hardcoded to NVFP4 when experts are NVFP4, but shared_expert is FP8 (modelopt MIXED_PRECISION)","updated_at":"2026-08-25T18:38:31Z","url":"https://github.com/FlashML-org/FreeToken/issues/183"},"FlashML-org/FreeToken#184":{"body_hash":"2a982f2f6f55c0d9","comments":0,"kind":"pr","number":184,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(deps): use PyTorch 2.13 to fix SM89 hangs","updated_at":"2026-08-26T21:29:47Z","url":"https://github.com/FlashML-org/FreeToken/pull/184"},"FlashML-org/FreeToken#205":{"body_hash":"b1a5c2d0307706f1","comments":0,"kind":"issue","number":205,"repo":"FlashML-org/FreeToken","state":"open","title":"Qwen3.6-35B-A3B hits KV-cache limit during prolonged reasoning on LeetCode problem","updated_at":"2026-08-26T03:20:23Z","url":"https://github.com/FlashML-org/FreeToken/issues/205"},"FlashML-org/FreeToken#206":{"body_hash":"24b88776193797d3","comments":1,"kind":"issue","number":206,"repo":"FlashML-org/FreeToken","state":"closed","title":"Loading nvidia/Qwen3.6-35B-A3B-NVFP4 fails: "Incomplete fp8 fusions: ['model.layers.37.linear_attn.in_proj_qkvz']"","updated_at":"2026-08-26T04:37:00Z","url":"https://github.com/FlashML-org/FreeToken/issues/206"},"FlashML-org/FreeToken#207":{"body_hash":"9d6c44260cb6edc1","comments":2,"kind":"issue","number":207,"repo":"FlashML-org/FreeToken","state":"open","title":"[Linux] AppImage blank window / WebKitWebProcess abort: "Could not create default EGL display: EGL_BAD_PARAMETER" (bundled libwayland-client on Mesa 25+ hosts)","updated_at":"2026-08-27T22:13:46Z","url":"https://github.com/FlashML-org/FreeToken/issues/207"},"FlashML-org/FreeToken#208":{"body_hash":"86da2a39c01e2f6d","comments":0,"kind":"pr","number":208,"repo":"FlashML-org/FreeToken","state":"open","title":"qwen3_5_moe: load mixed-precision compressed-tensors checkpoints (unsloth NVFP4+FP8)","updated_at":"2026-08-26T05:43:36Z","url":"https://github.com/FlashML-org/FreeToken/pull/208"},"FlashML-org/FreeToken#212":{"body_hash":"1c3a223f5e607452","comments":0,"kind":"pr","number":212,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(models): add Qwen3-Next-80B-A3B support","updated_at":"2026-08-26T09:16:46Z","url":"https://github.com/FlashML-org/FreeToken/pull/212"},"FlashML-org/FreeToken#217":{"body_hash":"0e0dbaaf50222ee4","comments":1,"kind":"pr","number":217,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(rocm): AMD ROCm support (gfx1100) + Qwen3.5-MoE GGUF loader","updated_at":"2026-08-26T21:28:52Z","url":"https://github.com/FlashML-org/FreeToken/pull/217"},"FlashML-org/FreeToken#219":{"body_hash":"9228f8de3767d0ec","comments":0,"kind":"issue","number":219,"repo":"FlashML-org/FreeToken","state":"open","title":"[Feature Request] Model architecture Qwen3VLForConditionalGeneration not supported","updated_at":"2026-08-26T19:46:04Z","url":"https://github.com/FlashML-org/FreeToken/issues/219"},"FlashML-org/FreeToken#220":{"body_hash":"6b1886fee28cd2f7","comments":0,"kind":"issue","number":220,"repo":"FlashML-org/FreeToken","state":"open","title":"RTX 4070 Ti Super (SM89): every request hangs ~123s then worker dies (empty response) — Qwen3.6-35B-A3B-NVFP4 offload","updated_at":"2026-08-26T22:59:05Z","url":"https://github.com/FlashML-org/FreeToken/issues/220"},"FlashML-org/FreeToken#227":{"body_hash":"ec213ea17037ea8c","comments":5,"kind":"issue","number":227,"repo":"FlashML-org/FreeToken","state":"open","title":"[Bug]: RuntimeError: Rowwise scaling is not currently supported on your device","updated_at":"2026-08-28T01:37:59Z","url":"https://github.com/FlashML-org/FreeToken/issues/227"},"FlashML-org/FreeToken#232":{"body_hash":"f416cf9abf56bf26","comments":4,"kind":"pr","number":232,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(qwen4): support Qwen3.8 Flash Next NVFP4, vision, and Windows serving","updated_at":"2026-08-28T05:12:06Z","url":"https://github.com/FlashML-org/FreeToken/pull/232"},"FlashML-org/FreeToken#234":{"body_hash":"393bea20cfada04a","comments":0,"kind":"issue","number":234,"repo":"FlashML-org/FreeToken","state":"open","title":"[Ecosystem Integration] Proposal: Connecting WMP-compliant OS Maintenance Agents via FreeToken Local MoE Streaming","updated_at":"2026-08-27T06:25:33Z","url":"https://github.com/FlashML-org/FreeToken/issues/234"},"FlashML-org/FreeToken#236":{"body_hash":"09109eeafa74b1ea","comments":0,"kind":"issue","number":236,"repo":"FlashML-org/FreeToken","state":"open","title":"Qwen3.6-35B-A3B-Uncensored-NVFP4","updated_at":"2026-08-27T10:46:38Z","url":"https://github.com/FlashML-org/FreeToken/issues/236"},"FlashML-org/FreeToken#238":{"body_hash":"44be9d09584ba9be","comments":1,"kind":"issue","number":238,"repo":"FlashML-org/FreeToken","state":"open","title":"[BUG] qwen3_5 dense: mixed-precision NVFP4 crashes in ct_bf16_fuse (Float8 × BFloat16 promotion)","updated_at":"2026-08-27T11:39:24Z","url":"https://github.com/FlashML-org/FreeToken/issues/238"},"FlashML-org/FreeToken#239":{"body_hash":"e0d9878137f1a275","comments":1,"kind":"issue","number":239,"repo":"FlashML-org/FreeToken","state":"open","title":"RTX 2050 4GB: Qwen3.6-35B-A3B-NVFP4 runs at ~21 tok/s with single-layer CPU MoE prefill buffer","updated_at":"2026-08-27T18:36:20Z","url":"https://github.com/FlashML-org/FreeToken/issues/239"},"FlashML-org/FreeToken#240":{"body_hash":"4aa45ef9a8e076ed","comments":0,"kind":"issue","number":240,"repo":"FlashML-org/FreeToken","state":"open","title":"Qwen3.8-27B-FP8 fails during fp8 weight load with 'CUDA driver error: device not ready' (Qwen3.6-35B-A3B-FP8 and gpt-oss-120b load fine in the same env)","updated_at":"2026-08-27T17:34:02Z","url":"https://github.com/FlashML-org/FreeToken/issues/240"},"FlashML-org/FreeToken#241":{"body_hash":"95dfe6f638979db8","comments":3,"kind":"pr","number":241,"repo":"FlashML-org/FreeToken","state":"open","title":"rocm: fix native extensions, kernel JIT builds, and Triton PTX fallbacks for gfx1150","updated_at":"2026-08-27T21:48:12Z","url":"https://github.com/FlashML-org/FreeToken/pull/241"},"FlashML-org/FreeToken#242":{"body_hash":"b6caa4e64710ff67","comments":1,"kind":"issue","number":242,"repo":"FlashML-org/FreeToken","state":"closed","title":"[BUG] 0.2.0-beta.15 - Linux, KDE Plasma: Entire GUI "Locks Up" / Freezes when clicking on "Chat"","updated_at":"2026-08-27T22:21:36Z","url":"https://github.com/FlashML-org/FreeToken/issues/242"},"FlashML-org/FreeToken#243":{"body_hash":"4f6757944b72e036","comments":0,"kind":"pr","number":243,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(kernel): avoid row-wise _scaled_mm stall on sm_89 with torch<2.12","updated_at":"2026-08-28T03:28:04Z","url":"https://github.com/FlashML-org/FreeToken/pull/243"},"FlashML-org/FreeToken#57":{"body_hash":"d1874a2dc3ddb60e","comments":0,"kind":"issue","number":57,"repo":"FlashML-org/FreeToken","state":"closed","title":"[AppImage] Global LD_LIBRARY_PATH export breaks system-curl child processes (engine installer fails on non-Ubuntu distros)","updated_at":"2026-08-26T02:19:39Z","url":"https://github.com/FlashML-org/FreeToken/issues/57"},"FlashML-org/FreeToken#60":{"body_hash":"9ff8ed296bc092d9","comments":13,"kind":"issue","number":60,"repo":"FlashML-org/FreeToken","state":"open","title":"Feature request: AMD GPU support","updated_at":"2026-08-26T21:25:28Z","url":"https://github.com/FlashML-org/FreeToken/issues/60"},"FlashML-org/FreeToken#66":{"body_hash":"d3e830e55881d7d2","comments":2,"kind":"issue","number":66,"repo":"FlashML-org/FreeToken","state":"closed","title":"[Bug]: Detect hardware fails with cudaErrorNotSupported on NVIDIA RTX 4060 Lapt","updated_at":"2026-08-26T10:00:04Z","url":"https://github.com/FlashML-org/FreeToken/issues/66"},"FlashML-org/FreeToken#72":{"body_hash":"13f044b42513eb42","comments":4,"kind":"issue","number":72,"repo":"FlashML-org/FreeToken","state":"open","title":"Prefill hangs on RTX 4060 Ti (SM89) for prompts beyond warmup length","updated_at":"2026-08-27T14:36:06Z","url":"https://github.com/FlashML-org/FreeToken/issues/72"},"FlashML-org/FreeToken#97":{"body_hash":"1d5f83de197791fd","comments":7,"kind":"issue","number":97,"repo":"FlashML-org/FreeToken","state":"open","title":"Difficult to load model despite more than enough vram/ram available","updated_at":"2026-08-25T17:38:46Z","url":"https://github.com/FlashML-org/FreeToken/issues/97"}},"errors":["dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 5404:2C07F1:9C7D2C:20AC8FB:6A9125F5 and timestamp 2026-08-28 06:08:53 UTC. For more on scraping GitHub and how it may affect your rights, please review our Terms of Service (https://docs.github.com/en/site-policy/github-terms/github-terms-of-service)"],"external_tracked_issues":{"ROCm/legacy-rocm-build#6461":{"body_hash":"0ac6e80ee9b489cd","comments":4,"kind":"issue","number":6461,"relevance":"high","relevance_reason":"Windows + gfx1201 + hipBLASLt/rocBLAS sequence/state-dependent GEMM failure","repo":"ROCm/legacy-rocm-build","state":"open","title":"[Issue]: rocBLAS bf16/f16 GEMM fails with hipErrorInvalidValue on 2nd call, gfx1201 / Windows / ROCm 7.14","updated_at":"2026-08-25T10:25:55Z","url":"https://github.com/ROCm/legacy-rocm-build/issues/6461"}},"last_checked":"2026-08-28T06:08:28+00:00","releases":{"FlashML-org/FreeToken":{"draft":false,"name":"v0.1.2","prerelease":false,"published_at":"2026-08-19T06:20:18Z","tag":"v0.1.2","url":"https://github.com/FlashML-org/FreeToken/releases/tag/v0.1.2"},"ROCm/ROCm":{"draft":false,"name":"ROCm 7.14.0 Release","prerelease":false,"published_at":"2026-07-16T03:28:58Z","tag":"rocm-7.14.0","url":"https://github.com/ROCm/legacy-rocm-build/releases/tag/rocm-7.14.0"},"ROCm/TheRock":{"draft":false,"name":"","prerelease":false,"published_at":"2026-08-26T10:03:34Z","tag":"therock-10.0","url":"https://github.com/ROCm/TheRock/releases/tag/therock-10.0"},"apache/tvm-ffi":{"draft":false,"name":"v0.1.13-post3","prerelease":false,"published_at":"2026-08-10T13:31:09Z","tag":"v0.1.13-post3","url":"https://github.com/apache/tvm-ffi/releases/tag/v0.1.13-post3"},"ggml-org/llama.cpp":{"draft":false,"name":"v0.3.0","prerelease":false,"published_at":"2026-08-25T10:22:58Z","tag":"v0.3.0","url":"https://github.com/ggml-org/llama.cpp/releases/tag/v0.3.0"},"triton-lang/triton-windows":{"draft":false,"name":"v3.7.1-windows.post27","prerelease":false,"published_at":"2026-06-21T17:01:59Z","tag":"v3.7.1-windows.post27","url":"https://github.com/triton-lang/triton-windows/releases/tag/v3.7.1-windows.post27"}},"tracked_issues":{"110":{"body_hash":"d6672f16a90f2854","comments":1,"kind":"issue","number":110,"repo":"FlashML-org/FreeToken","state":"open","title":"Unhandled CUDA OOM in prefill expert workspace kills the engine; server keeps accepting requests that never return (root cause behind FlashML-org#20-style headless state; likely also FlashML-org#72)","updated_at":"2026-08-23T20:43:34Z","url":"https://github.com/FlashML-org/FreeToken/issues/110"},"111":{"body_hash":"b01b977d143435c7","comments":2,"kind":"issue","number":111,"repo":"FlashML-org/FreeToken","state":"open","title":"Requests longer than the KV pool are queued forever with no error — and --moe-cache-auto leaves only ~8k tokens of KV on a 96GB GPU","updated_at":"2026-08-26T01:19:22Z","url":"https://github.com/FlashML-org/FreeToken/issues/111"},"120":{"body_hash":"a7caa8c0bca18470","comments":1,"kind":"issue","number":120,"repo":"FlashML-org/FreeToken","state":"open","title":"Native Windows is classified as pin-uncapped, so FlashML-org#112's per-layer residency never auto-engages","updated_at":"2026-08-24T03:04:21Z","url":"https://github.com/FlashML-org/FreeToken/issues/120"},"122":{"body_hash":"4d42515b782747ed","comments":6,"kind":"issue","number":122,"repo":"FlashML-org/FreeToken","state":"open","title":"Windows/ROCm on RX 9060 XT (gfx1200): packed GGUF working end-to-end (dense + MoE), root cause of the RDNA4 offload-decode TDR, benchmarks vs llama.cpp","updated_at":"2026-08-27T07:18:05Z","url":"https://github.com/FlashML-org/FreeToken/issues/122"},"123":{"body_hash":"09dd1b9b8cf6560f","comments":0,"kind":"issue","number":123,"repo":"FlashML-org/FreeToken","state":"open","title":"Request hang (silent, zero-log) with hybrid_radix cache + moe-backend offload + nvfp4 triton backend — reproduced on 2 independent models, not explained by FlashML-org#110","updated_at":"2026-08-24T04:06:26Z","url":"https://github.com/FlashML-org/FreeToken/issues/123"},"124":{"body_hash":"64a1de8500f135a3","comments":0,"kind":"issue","number":124,"repo":"FlashML-org/FreeToken","state":"open","title":"NVFP4 checkpoints fail to load: model.safetensors.index.json is not downloaded, but the NVFP4 bank loader requires it","updated_at":"2026-08-24T04:49:32Z","url":"https://github.com/FlashML-org/FreeToken/issues/124"},"79":{"body_hash":"ed16773e722041fc","comments":15,"kind":"issue","number":79,"repo":"FlashML-org/FreeToken","state":"open","title":"FreeToken Roadmap (2026)","updated_at":"2026-08-28T01:43:52Z","url":"https://github.com/FlashML-org/FreeToken/issues/79"},"82":{"body_hash":"ff59a7ff00722b01","comments":14,"kind":"issue","number":82,"repo":"FlashML-org/FreeToken","state":"open","title":"ROCm RDNA4 gfx1201 Ported. Windows only for now. Test please","updated_at":"2026-08-28T01:30:10Z","url":"https://github.com/FlashML-org/FreeToken/issues/82"}},"tracked_prs":{"112":{"base_sha":"f0abe587a11cca53bb3c37a9596fad24973ace62","body_hash":"aa539235301fea3d","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":1,"commits":3,"draft":false,"head_sha":"831d38a66bc45543411078c6805de8c42e7603fa","merged":true,"number":112,"review_comments":0,"state":"closed","title":"feat(moe): per-layer host-bank residency","updated_at":"2026-08-24T00:39:32Z","url":"https://github.com/FlashML-org/FreeToken/pull/112"},"118":{"base_sha":"e0a3bbc04652ec0622d932adcbf2772848e3c2e2","body_hash":"d73a76c00cdb2f94","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"6241178a7550e5a0ffadd85f0eb04af0160f9988","merged":false,"number":118,"review_comments":0,"state":"open","title":"fix(scheduler): clamp admission to the actual KV pool so oversized prompts fail loudly","updated_at":"2026-08-24T00:52:33Z","url":"https://github.com/FlashML-org/FreeToken/pull/118"},"125":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"793491958f083651","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"cb44bdeedb7ea6ed2b37c5c49864ad40065e1985","merged":false,"number":125,"review_comments":0,"state":"open","title":"test(pinned): use mapped memory for UVA pointer check","updated_at":"2026-08-24T05:48:44Z","url":"https://github.com/FlashML-org/FreeToken/pull/125"},"129":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"d5c4ac29d87557fc","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":2,"commits":1,"draft":false,"head_sha":"d30726e006b2708d4fbfead120985bc23c935541","merged":false,"number":129,"review_comments":0,"state":"open","title":"fix(download): include json files when fetching weights, so NVFP4's index.json is no longer silently skipped","updated_at":"2026-08-24T17:01:52Z","url":"https://github.com/FlashML-org/FreeToken/pull/129"},"131":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"33bc52d171e8ca00","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":7,"commits":36,"draft":false,"head_sha":"bb432e8c473c557cdef6517abccf0c129bd8c544","merged":false,"number":131,"review_comments":0,"state":"open","title":"GGUF: support all quant types, add qwen35moe","updated_at":"2026-08-26T06:53:07Z","url":"https://github.com/FlashML-org/FreeToken/pull/131"},"132":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"e00f6516cf1eda6d","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":3,"commits":8,"draft":false,"head_sha":"45417560beeba896a9b0866e50154d2a7a320b8b","merged":false,"number":132,"review_comments":0,"state":"open","title":"feat(rocm): add RDNA3 and RDNA4 runtime foundation","updated_at":"2026-08-26T02:16:40Z","url":"https://github.com/FlashML-org/FreeToken/pull/132"},"133":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"0138f488cd51a4c2","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":9,"draft":true,"head_sha":"89ad7ab016b3d51ae9e0b1b1adaf9a996c4cacf3","merged":false,"number":133,"review_comments":0,"state":"open","title":"fix(rocm): make TVM-FFI index and store JIT kernels portable to HIP","updated_at":"2026-08-24T07:49:09Z","url":"https://github.com/FlashML-org/FreeToken/pull/133"},"134":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"95a5590c8c830ce1","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":9,"draft":true,"head_sha":"9a523dc85353b574fe7c7940bdfbe948dd51cbd9","merged":false,"number":134,"review_comments":0,"state":"open","title":"fix(rocm): gate CUDA-only optional backends on ROCm","updated_at":"2026-08-24T07:49:21Z","url":"https://github.com/FlashML-org/FreeToken/pull/134"},"135":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"648ff52dcf5fc77c","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":9,"draft":true,"head_sha":"9d5e3fc8bc417855a16c4155766e86cd1b4c1bc6","merged":false,"number":135,"review_comments":0,"state":"open","title":"fix(rocm): route tensor parallel communication through RCCL","updated_at":"2026-08-24T07:49:30Z","url":"https://github.com/FlashML-org/FreeToken/pull/135"},"136":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"7744299232e0946b","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":1,"commits":10,"draft":true,"head_sha":"49591978de5cf20fe1096d9bf8a07a8f5156b7b6","merged":false,"number":136,"review_comments":0,"state":"open","title":"feat(rocm): enable native GGUF kernels on RDNA4","updated_at":"2026-08-26T00:56:43Z","url":"https://github.com/FlashML-org/FreeToken/pull/136"},"137":{"base_sha":"f7c31e92dbf296de3a5bb1b9c5fcb58f988e3a07","body_hash":"a0597a23e4607628","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"5eec2582ce89376e3f5016d47ff73ca1b4e8d445","merged":false,"number":137,"review_comments":0,"state":"open","title":"feat(rocm): serve on AMD GPUs through the HIP toolchain","updated_at":"2026-08-26T09:03:28Z","url":"https://github.com/FlashML-org/FreeToken/pull/137"},"27":{"base_sha":"0ab982f10905fa775962a4eddcb44caa50065251","body_hash":"e85637efb5176c06","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":4,"commits":1,"draft":false,"head_sha":"d76d5e0105235e9f13edd534fec3dfa86f25cb15","merged":false,"number":27,"review_comments":0,"state":"closed","title":"feat(moe): partial-pin serving to beat the Windows/WSL2 pinned-memory quota (--pin-exempt-layers)","updated_at":"2026-08-24T01:28:09Z","url":"https://github.com/FlashML-org/FreeToken/pull/27"}},"version":1}

Technical baseline updated automatically: 2026-08-28T06:08:28+00:00. This comment is edited in place and does not represent a notification.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T15:02:31+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T16:56:53+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T18:31:06+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T19:01:35+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T20:49:53+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T22:45:58+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T01:53:38+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T03:13:46+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T04:55:02+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T07:09:50+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T09:01:32+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T10:51:05+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T11:11:49+00:00).

  • Новый явно отслеживаемый external issue: [Issue]: rocBLAS bf16/f16 GEMM fails with hipErrorInvalidValue on 2nd call, gfx1201 / Windows / ROCm 7.14. High relevance.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 8024:3880E4:B12B:25494:6A8D788F and timestamp 2026-08-25 11:12:15 UTC. For…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T13:13:08+00:00).

  • feat(rocm): add RDNA3 and RDNA4 runtime foundation: обновлены описание/review/discussion (comments 1→2, review 0→0).
  • Новый релевантный issue: Feature: Predictive Expert Offloading.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID F440:3A3DE2:D8F1C6:2D7E43E:6A8D950E and timestamp 2026-08-25 13:13:50 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T15:07:11+00:00).

  • FreeToken Roadmap (2026): comments 5→6.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 0407:272BC6:1AC4A9F:5964A5E:6A8DAFBB and timestamp 2026-08-25 15:07:39 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T16:57:34+00:00).

  • Model catalog shows models the local machine cannot run (no capability pre-check before display): обновлён (state open→open, comments 0→1).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 283F:2B3BAA:2009A4A:6A360EB:6A8DC9A1 and timestamp 2026-08-25 16:58:09 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T18:58:44+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T20:47:37+00:00).

  • fix(deps): use PyTorch 2.13 to fix SM89 hangs: обновлён (state open→open, comments 0→0).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 7830:16ACDE:3C41178:CA29304:6A8DFF87 and timestamp 2026-08-25 20:48:07 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T22:46:42+00:00).

  • GGUF: support all quant types, add qwen35moe: новый commit dd48aacb9952a39d.
  • Maxritz/FreeToken-rocm-test:main: 45675e473a5616ec — Merge pull request FreeToken ROCm Watch — notification channel #1 from Castoff995/codex/gfx1201-offload-decode.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID CC18:2EB04F:4D5504F:100358CF:6A8E1B72 and timestamp 2026-08-25 22:47:14 UT…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T01:59:36+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T03:19:34+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T04:57:21+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T07:10:22+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T09:04:06+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T10:52:44+00:00).

  • Новый релевантный pr: feat(models): add Qwen3-Next-80B-A3B support.
  • feat(models): support TP for qwen3_5_moe: обновлён (state open→open, comments 3→5).
  • Новый релиз: ROCm/TheRock therock-10.0.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID B008:2BB36A:73A408:77B54F:6A8EC59E and timestamp 2026-08-26 10:53:18 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T13:18:13+00:00).

  • FreeToken Roadmap (2026): comments 6→7.
  • Feature request: AMD GPU support: обновлён (state open→open, comments 11→12).
  • feat(models): support TP for qwen3_5_moe: обновлён (state open→open, comments 5→7).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 0400:15153F:A5D123:230714B:6A8EE7C0 and timestamp 2026-08-26 13:18:56 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T15:55:00+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T17:33:54+00:00).

  • FreeToken Roadmap (2026): comments 7→8.
  • Новый релевантный pr: feat(rocm): AMD ROCm support (gfx1100) + Qwen3.5-MoE GGUF loader.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 3C34:1A0AD0:3D5C1B3:CC983FC:6A8F239F and timestamp 2026-08-26 17:34:23 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T20:02:52+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T23:36:03+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-27T09:52:05+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-27T20:32:35+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-28T06:08:28+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant