adapter.go 12 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237238239240241242243244245246247248249250251252253254255256257258259260261262263264265266267268269270271272273274275276277278279280281282283284285286287288289290291292293294295296297298299300301302303304305306307308309310311312313314315316317318319320321322323324325326327328329330331332333334335336337338339340341342343344345346347348349350351352353354355356357358359360361362363364365366367368369370371372373374375376377378379380381382383384385386387388389390391392393394395396397398399400401402403404405406407408409410411412413414415416417418419420421422423424425426427428429430431432433434435436437438439440441442443444445446447448449450451452453454455456457458459460461462463464465466467468469470471472473
  1. // SPDX-FileCopyrightText: Copyright The Miniflux Authors. All rights reserved.
  2. // SPDX-License-Identifier: Apache-2.0
  3. package rss // import "miniflux.app/v2/internal/reader/rss"
  4. import (
  5. "cmp"
  6. "html"
  7. "iter"
  8. "log/slog"
  9. "path"
  10. "slices"
  11. "strconv"
  12. "strings"
  13. "time"
  14. "miniflux.app/v2/internal/crypto"
  15. "miniflux.app/v2/internal/model"
  16. "miniflux.app/v2/internal/reader/date"
  17. "miniflux.app/v2/internal/reader/language"
  18. "miniflux.app/v2/internal/reader/sanitizer"
  19. "miniflux.app/v2/internal/urllib"
  20. )
  21. type rssAdapter struct {
  22. rss *rss
  23. }
  24. func (r *rssAdapter) buildFeed(baseURL string) *model.Feed {
  25. feed := &model.Feed{
  26. Title: html.UnescapeString(strings.TrimSpace(r.rss.Channel.Title)),
  27. FeedURL: strings.TrimSpace(baseURL),
  28. SiteURL: strings.TrimSpace(r.rss.Channel.Link),
  29. Description: strings.TrimSpace(r.rss.Channel.Description),
  30. Language: language.Normalize(r.rss.Channel.Language),
  31. }
  32. // Hybrid feeds declare the channel language with <dc:language>
  33. // instead of <language>.
  34. if feed.Language == "" {
  35. feed.Language = language.Normalize(r.rss.Channel.DublinCoreLanguage)
  36. }
  37. // Ensure the Site URL is absolute.
  38. if absoluteSiteURL, err := urllib.ResolveToAbsoluteURL(baseURL, feed.SiteURL); err == nil {
  39. feed.SiteURL = absoluteSiteURL
  40. }
  41. // Try to find the feed URL from the Channel links.
  42. for _, link := range r.rss.Channel.Links {
  43. href := strings.TrimSpace(link.Href)
  44. if href == "" || link.Rel != "self" {
  45. continue
  46. }
  47. if absoluteFeedURL, err := urllib.ResolveToAbsoluteURL(feed.FeedURL, href); err == nil {
  48. feed.FeedURL = absoluteFeedURL
  49. break
  50. }
  51. }
  52. // Fallback to the site URL if the title is empty.
  53. if feed.Title == "" {
  54. feed.Title = feed.SiteURL
  55. }
  56. // Get TTL if defined.
  57. if r.rss.Channel.TTL != "" {
  58. if ttl, err := strconv.Atoi(r.rss.Channel.TTL); err == nil {
  59. feed.TTL = time.Duration(ttl) * time.Minute
  60. }
  61. }
  62. // Get the feed icon URL if defined.
  63. if r.rss.Channel.Image != nil {
  64. if absoluteIconURL, err := urllib.ResolveToAbsoluteURL(feed.SiteURL, r.rss.Channel.Image.URL); err == nil {
  65. feed.IconURL = absoluteIconURL
  66. }
  67. }
  68. // Track GUIDs already seen in this feed to disambiguate items from
  69. // non-conformant feeds that reuse the same <guid> for every entry.
  70. seenGUIDs := make(map[string]int)
  71. for _, item := range r.rss.Channel.Items {
  72. entry := model.NewEntry()
  73. entry.Date = findEntryDate(&item)
  74. entry.Content = findEntryContent(&item)
  75. entry.Enclosures = findEntryEnclosures(&item, feed.SiteURL)
  76. // Populate the entry URL.
  77. entryURL := findEntryURL(&item)
  78. if entryURL != "" {
  79. entry.URL = entryURL
  80. if absoluteEntryURL, err := urllib.ResolveToAbsoluteURL(feed.SiteURL, entryURL); err == nil {
  81. entry.URL = absoluteEntryURL
  82. }
  83. }
  84. if entry.URL == "" {
  85. // Fallback to the feed URL if no entry URL is found.
  86. entry.URL = feed.SiteURL
  87. // Fallback to the first enclosure URL if it exists.
  88. if len(entry.Enclosures) > 0 && entry.Enclosures[0].URL != "" {
  89. entry.URL = entry.Enclosures[0].URL
  90. }
  91. }
  92. // Populate the entry title.
  93. entry.Title = findEntryTitle(&item)
  94. if entry.Title == "" {
  95. entry.Title = sanitizer.TruncateHTML(entry.Content, 100)
  96. if entry.Title == "" {
  97. entry.Title = entry.URL
  98. }
  99. }
  100. entry.Author = findEntryAuthor(&item)
  101. if entry.Author == "" {
  102. entry.Author = findFeedAuthor(&r.rss.Channel)
  103. }
  104. // Populate the entry language, falling back to the channel
  105. // language: items are part of the channel's content.
  106. entry.Language = language.Normalize(item.DublinCoreLanguage)
  107. if entry.Language == "" {
  108. entry.Language = feed.Language
  109. }
  110. // Generate the entry hash.
  111. //
  112. // The RSS 2.0 spec requires <guid> to uniquely identify the item, but
  113. // some feeds ship the same GUID for every entry. Keep the first
  114. // occurrence stable (so existing stored entries still match) and
  115. // disambiguate later collisions using the entry URL or, as a last
  116. // resort, the item position.
  117. switch {
  118. case item.GUID.Data != "":
  119. n := seenGUIDs[item.GUID.Data]
  120. seenGUIDs[item.GUID.Data] = n + 1
  121. switch {
  122. case n == 0:
  123. entry.Hash = crypto.SHA256(item.GUID.Data)
  124. case entry.URL != "":
  125. entry.Hash = crypto.SHA256(item.GUID.Data + "|" + entry.URL)
  126. default:
  127. entry.Hash = crypto.SHA256(item.GUID.Data + "|" + strconv.Itoa(n))
  128. }
  129. case entryURL != "":
  130. entry.Hash = crypto.SHA256(entryURL)
  131. default:
  132. entry.Hash = crypto.SHA256(entry.Title + entry.Content)
  133. }
  134. // Find CommentsURL if defined.
  135. if absoluteCommentsURL := strings.TrimSpace(item.CommentsURL); absoluteCommentsURL != "" && urllib.IsAbsoluteURL(absoluteCommentsURL) {
  136. entry.CommentsURL = absoluteCommentsURL
  137. }
  138. // Set podcast listening time.
  139. if item.ItunesDuration != "" {
  140. if duration, err := getDurationInMinutes(item.ItunesDuration); err == nil {
  141. entry.ReadingTime = duration
  142. }
  143. }
  144. // Populate entry categories.
  145. entry.Tags = findEntryTags(&item)
  146. if len(entry.Tags) == 0 {
  147. entry.Tags = findFeedTags(&r.rss.Channel)
  148. }
  149. feed.Entries = append(feed.Entries, entry)
  150. }
  151. return feed
  152. }
  153. func findFeedAuthor(rssChannel *rssChannel) string {
  154. var author string
  155. switch {
  156. case rssChannel.ItunesAuthor != "":
  157. author = rssChannel.ItunesAuthor
  158. case rssChannel.GooglePlayAuthor != "":
  159. author = rssChannel.GooglePlayAuthor
  160. case rssChannel.ItunesOwner.String() != "":
  161. author = rssChannel.ItunesOwner.String()
  162. case rssChannel.ManagingEditor != "":
  163. author = rssChannel.ManagingEditor
  164. case rssChannel.Webmaster != "":
  165. author = rssChannel.Webmaster
  166. default:
  167. return ""
  168. }
  169. return sanitizer.StripTags(author)
  170. }
  171. func findFeedTags(rssChannel *rssChannel) []string {
  172. tags := make([]string, 0, len(rssChannel.Categories)+2*len(rssChannel.ItunesCategories)+1)
  173. tags = appendSorted(tags, strings.TrimSpace, rssChannel.Categories...)
  174. tags = appendSortedSeq(tags, strings.TrimSpace, rssChannel.ItunesCategoriesSeq())
  175. tags = appendSorted(tags, strings.TrimSpace, rssChannel.GooglePlayCategory.Text)
  176. return tags
  177. }
  178. func findEntryTitle(rssItem *rssItem) string {
  179. title := rssItem.Title.Content
  180. if rssItem.DublinCoreTitle != "" {
  181. title = rssItem.DublinCoreTitle
  182. }
  183. return html.UnescapeString(html.UnescapeString(strings.TrimSpace(title)))
  184. }
  185. func findEntryURL(rssItem *rssItem) string {
  186. for _, link := range []string{rssItem.FeedBurnerLink, rssItem.Link} {
  187. if link != "" {
  188. return strings.TrimSpace(link)
  189. }
  190. }
  191. for _, atomLink := range rssItem.Links {
  192. if atomLink.Href != "" && (strings.EqualFold(atomLink.Rel, "alternate") || atomLink.Rel == "") {
  193. return strings.TrimSpace(atomLink.Href)
  194. }
  195. }
  196. // Specs: https://cyber.harvard.edu/rss/rss.html#ltguidgtSubelementOfLtitemgt
  197. // isPermaLink is optional, its default value is true.
  198. // If its value is false, the guid may not be assumed to be a url, or a url to anything in particular.
  199. if rssItem.GUID.IsPermaLink == "true" || rssItem.GUID.IsPermaLink == "" {
  200. return strings.TrimSpace(rssItem.GUID.Data)
  201. }
  202. return ""
  203. }
  204. func findEntryContent(rssItem *rssItem) string {
  205. for _, value := range []string{
  206. rssItem.DublinCoreContent,
  207. rssItem.Description,
  208. rssItem.GooglePlayDescription,
  209. rssItem.ItunesSummary,
  210. rssItem.ItunesSubtitle,
  211. } {
  212. if value != "" {
  213. return value
  214. }
  215. }
  216. return ""
  217. }
  218. func findEntryDate(rssItem *rssItem) time.Time {
  219. value := rssItem.PubDate
  220. if rssItem.DublinCoreDate != "" {
  221. value = rssItem.DublinCoreDate
  222. }
  223. if value = strings.TrimSpace(value); value == "" {
  224. return time.Now()
  225. }
  226. parsedDate, err := date.Parse(value)
  227. if err != nil {
  228. slog.Debug("Unable to parse date from RSS feed",
  229. slog.String("date", value),
  230. slog.String("guid", rssItem.GUID.Data),
  231. slog.Any("error", err),
  232. )
  233. return time.Now()
  234. }
  235. return parsedDate
  236. }
  237. func findEntryAuthor(rssItem *rssItem) string {
  238. var author string
  239. switch {
  240. case rssItem.GooglePlayAuthor != "":
  241. author = rssItem.GooglePlayAuthor
  242. case rssItem.ItunesAuthor != "":
  243. author = rssItem.ItunesAuthor
  244. case rssItem.DublinCoreCreator != "":
  245. author = rssItem.DublinCoreCreator
  246. case rssItem.PersonName() != "":
  247. author = rssItem.PersonName()
  248. case strings.Contains(rssItem.Author.Inner, "<![CDATA["):
  249. author = rssItem.Author.Data
  250. case rssItem.Author.Inner != "":
  251. author = rssItem.Author.Inner
  252. default:
  253. return ""
  254. }
  255. return sanitizer.StripTags(author)
  256. }
  257. func findEntryTags(rssItem *rssItem) []string {
  258. tags := make([]string, 0, len(rssItem.Categories)+len(rssItem.MediaCategories))
  259. tags = appendSorted(tags, strings.TrimSpace, rssItem.Categories...)
  260. tags = appendSortedSeq(tags, strings.TrimSpace, rssItem.MediaCategories.LabelsSeq())
  261. return tags
  262. }
  263. func findEntryEnclosures(rssItem *rssItem, siteURL string) model.EnclosureList {
  264. mediaThumbnails := rssItem.AllMediaThumbnails()
  265. mediaContents := rssItem.AllMediaContents()
  266. mediaPeerLinks := rssItem.AllMediaPeerLinks()
  267. capacity := len(mediaThumbnails) + len(rssItem.Enclosures) + len(mediaContents) + len(mediaPeerLinks)
  268. enclosures := make(model.EnclosureList, 0, capacity)
  269. duplicates := make(map[string]bool, capacity)
  270. for _, mediaThumbnail := range mediaThumbnails {
  271. mediaURL := strings.TrimSpace(mediaThumbnail.URL)
  272. if mediaURL == "" {
  273. continue
  274. }
  275. mediaURL, err := urllib.ResolveToAbsoluteURL(siteURL, mediaURL)
  276. if err != nil {
  277. slog.Debug("Unable to build absolute URL for media thumbnail",
  278. slog.String("url", mediaThumbnail.URL),
  279. slog.String("site_url", siteURL),
  280. slog.Any("error", err),
  281. )
  282. continue
  283. }
  284. if _, found := duplicates[mediaURL]; found {
  285. continue
  286. }
  287. duplicates[mediaURL] = true
  288. enclosures = append(enclosures, &model.Enclosure{
  289. URL: mediaURL,
  290. MimeType: mediaThumbnail.MimeType(),
  291. Size: mediaThumbnail.Size(),
  292. })
  293. }
  294. for _, enclosure := range rssItem.Enclosures {
  295. enclosureURL := enclosure.URL
  296. if rssItem.FeedBurnerEnclosureLink != "" {
  297. filename := path.Base(rssItem.FeedBurnerEnclosureLink)
  298. if strings.HasSuffix(enclosureURL, filename) {
  299. enclosureURL = rssItem.FeedBurnerEnclosureLink
  300. }
  301. }
  302. enclosureURL = strings.TrimSpace(enclosureURL)
  303. if enclosureURL == "" {
  304. continue
  305. }
  306. if absoluteEnclosureURL, err := urllib.ResolveToAbsoluteURL(siteURL, enclosureURL); err == nil {
  307. enclosureURL = absoluteEnclosureURL
  308. }
  309. if _, found := duplicates[enclosureURL]; found {
  310. continue
  311. }
  312. duplicates[enclosureURL] = true
  313. enclosures = append(enclosures, &model.Enclosure{
  314. URL: enclosureURL,
  315. MimeType: enclosure.Type,
  316. Size: enclosure.Size(),
  317. })
  318. }
  319. for _, mediaContent := range mediaContents {
  320. mediaURL := strings.TrimSpace(mediaContent.URL)
  321. if mediaURL == "" {
  322. continue
  323. }
  324. mediaURL, err := urllib.ResolveToAbsoluteURL(siteURL, mediaURL)
  325. if err != nil {
  326. slog.Debug("Unable to build absolute URL for media content",
  327. slog.String("url", mediaContent.URL),
  328. slog.String("site_url", siteURL),
  329. slog.Any("error", err),
  330. )
  331. continue
  332. }
  333. if _, found := duplicates[mediaURL]; found {
  334. continue
  335. }
  336. duplicates[mediaURL] = true
  337. enclosures = append(enclosures, &model.Enclosure{
  338. URL: mediaURL,
  339. MimeType: mediaContent.MimeType(),
  340. Size: mediaContent.Size(),
  341. })
  342. }
  343. for _, mediaPeerLink := range mediaPeerLinks {
  344. mediaURL := strings.TrimSpace(mediaPeerLink.URL)
  345. if mediaURL == "" {
  346. continue
  347. }
  348. mediaURL, err := urllib.ResolveToAbsoluteURL(siteURL, mediaURL)
  349. if err != nil {
  350. slog.Debug("Unable to build absolute URL for media peer link",
  351. slog.String("url", mediaPeerLink.URL),
  352. slog.String("site_url", siteURL),
  353. slog.Any("error", err),
  354. )
  355. continue
  356. }
  357. if _, found := duplicates[mediaURL]; found {
  358. continue
  359. }
  360. duplicates[mediaURL] = true
  361. enclosures = append(enclosures, &model.Enclosure{
  362. URL: mediaURL,
  363. MimeType: mediaPeerLink.MimeType(),
  364. Size: mediaPeerLink.Size(),
  365. })
  366. }
  367. return enclosures
  368. }
  369. // appendSorted is identical to [appendSortedSeq] except receives variadic values rather than [iter.Seq].
  370. func appendSorted[I any, O cmp.Ordered](sorted []O, fn func(I) O, values ...I) []O {
  371. sorted = slices.Grow(sorted, len(values))
  372. return appendSortedSeq(sorted, fn, slices.Values(values))
  373. }
  374. // appendSortedSeq appends elements from "values" iterator into "sorted" slice.
  375. // - "fn" applied to every element of "values"
  376. // - elements inserted into "sorted" slice so it stays sorted
  377. // - duplicate elements are not inserted
  378. func appendSortedSeq[I any, O cmp.Ordered](sorted []O, fn func(I) O, values iter.Seq[I]) []O {
  379. var zero O
  380. for in := range values {
  381. out := fn(in)
  382. if out == zero {
  383. continue
  384. }
  385. where, found := slices.BinarySearch(sorted, out)
  386. if found {
  387. continue
  388. }
  389. // Insert sorted to avoid duplicates.
  390. sorted = slices.Insert(sorted, where, out)
  391. }
  392. return sorted
  393. }